المقصود
بعد التدريب المسبق، تُحسَّن كثير من نماذج اللغة الكبيرة أكثر من خلال التعلم المعزز من التغذية الراجعة البشرية، حيث يقيّم البشر المخرجات ثم يُعاد تدريب النموذج ليفضل الإجابات الأفضل.
الشاهد
“requires powerful computers to handle the immense calculations involved in learning from billions of words.”
📕 من كتاب: Co-Intelligence بقلم Ethan Mollick
ما الذي تثبته الفكرة؟
يُثبت أن الأحكام البشرية تُستخدم لتنقيح سلوك النموذج بعد التدريب المسبق.
حدود الفكرة
لا يوضح مقدار التحسن الذي يحققه RLHF في كل حالة استخدام.
اقرأ أيضاً
مفاهيم
روابط للقراءة
- الذكاء المشترك
- المجال: التكنولوجيا