المقصود

يجب تقييم كفاءة الوكيل بحسب عدد الخطوات والتكلفة ووقت التنفيذ، لكن كفاءة الإنسان والذكاء الاصطناعي لا يمكن مقارنتها مباشرة.

الشاهد

“identify its failure modes and measure how often each of these failure modes happens”

📕 من كتاب: AI Engineering بقلم Chip Huyen

ما الذي تثبته الفكرة؟

يثبت أن تقييم الكفاءة يحتاج إلى مقاييس متعددة وإلى معايير مرجعية حساسة للسياق.

حدود الفكرة

لا يحدد عتبة عالمية موحدة لسلوك الوكيل الكفء.

اقرأ أيضاً

مفاهيم

روابط للقراءة