المقصود

يمكن تدريب نموذج مكافأة من الصفر أو ضبطه بدقة فوق نموذج مُسبق التدريب أو نموذج SFT.

الشاهد

“The reward model can be trained from scratch or finetuned on top of another model”

📕 من كتاب: AI Engineering بقلم Chip Huyen

ما الذي تثبته الفكرة؟

يُثبت أن نماذج المكافأة ليست مقيدة بإعداد تدريب واحد، ويمكنها إعادة استخدام نماذج موجودة.

حدود الفكرة

لا يثبت أي إعداد تدريبي هو الأفضل دائمًا عبر جميع المهام ومجموعات البيانات.

اقرأ أيضاً

مفاهيم

روابط للقراءة