مفهوم: rlhf
مفهوم: rlhf عدد الذرات: 2 | عدد الكتب: 2
هذا المفهوم يظهر في 2 ذرة عبر 2 كتاباً في الأطلس.
📊 إحصائيات المفهوم
| المقياس | القيمة |
|---|---|
| إجمالي الذرات | 2 |
| عدد الكتب | 2 |
| ذرات قوي | 2 (100%) |
| ذرات جوهر | 1 |
| أنواع الحجج | 2 |
📚 كيف عالج كل كتاب هذا المفهوم
هندسة الذكاء الاصطناعي (1 ذرة)
قد يؤدي التعلم المعزز من التغذية الراجعة البشرية (RLHF (تعزيز التعلم بالملاحظات البشرية)) إلى تقليل الدقة
“RLHF (تعزيز التعلم بالملاحظات البشرية) made hallucination أسوأ”
الذكاء المشترك (1 ذرة)
تُحسّن RLHF (تعزيز التعلم بالملاحظات البشرية) المخرجات
“ذلك تغذية راجعة is then used إلى do additional تدريب”
🌟 أبرز الذرات في هذا المفهوم
1. تُحسّن RLHF (تعزيز التعلم بالملاحظات البشرية) المخرجات
الكتاب: الذكاء المشترك (إيثان Mollick)
الادعاء: بعد pretraining, كثير LLMs are further improved بواسطة reinforcement تعلم من human تغذية راجعة, أين humans معدل outputs و the نموذج is retrained إلى favor أفضل answers.
الشاهد: “ذلك تغذية راجعة is then used إلى do additional تدريب”
2. قد يؤدي التعلم المعزز من التغذية الراجعة البشرية (RLHF (تعزيز التعلم بالملاحظات البشرية)) إلى تقليل الدقة
الكتاب: هندسة الذكاء الاصطناعي (تشيب هويين)
الادعاء: RLHF (تعزيز التعلم بالملاحظات البشرية) can reduce hallucinations في بعض contexts, لكن the شريحة ملاحظات InstructGPT is an مثال أين hallucination became أسوأ.
الشاهد: “RLHF (تعزيز التعلم بالملاحظات البشرية) made hallucination أسوأ”
🔍 كيف يختلف هذا المفهوم بين الكتب؟
من خلال تحليل 2 ذرة عبر 2 كتب:
الطرق المطبقة
- بعد pretraining, كثير LLMs are further improved بواسطة reinforcement تعلم من human تغذية راجعة, أين humans معدل outputs و the نموذج is retrained إلى favor أفضل answers.
📌 ملاحظة
هذا المفهوم مترجم آلياً من المحتوى الإنجليزي الأصلي. الشواهد النصية محفوظة بالإنجليزية لضمان الدقة.