المقصود
توسّع Mamba نماذج فضاء الحالة إلى مليارات المعلمات، ولها تكلفة استدلال خطية مع طول التسلسل، على عكس التوسّع التربيعي في المحولات (Transformers).
الشاهد
“having no context length limitation doesn’t guarantee good performance with long context.”
📕 من كتاب: AI Engineering بقلم Chip Huyen
ما الذي تثبته الفكرة؟
يُظهر أن Mamba مصممة لتكون أكثر كفاءة مع التسلسلات الأطول مقارنةً بالمحولات القياسية.
حدود الفكرة
لا يثبت أن التوسّع الخطي يؤدي دائمًا إلى دقة أفضل في كل مهمة.
اقرأ أيضاً
مفاهيم
روابط للقراءة
- هندسة الذكاء الاصطناعي
- المجال: التكنولوجيا