المقصود
يتطلب اكتشاف فروق أصغر في الدرجات أحجام عينات تقييم أكبر بكثير.
الشاهد
“You should have multiple evaluation sets to represent different data slices.”
📕 من كتاب: AI Engineering بقلم Chip Huyen
ما الذي تثبته الفكرة؟
يُثبت ذلك أن المقارنات التقييمية الدقيقة تحتاج إلى بيانات أكثر بكثير من المقارنات الخشنة.
حدود الفكرة
لا يقدّم قانونًا إحصائيًا عالميًا، بل مجرد تقدير تقريبي منسوب إلى OpenAI.
اقرأ أيضاً
مفاهيم
روابط للقراءة
- هندسة الذكاء الاصطناعي
- المجال: التكنولوجيا