مفهوم: المحوّلات (Transformers)
مفهوم: transformers عدد الذرات: 3 | عدد الكتب: 1
هذا المفهوم يظهر في 3 ذرة عبر 1 كتاباً في الأطلس.
📊 إحصائيات المفهوم
| المقياس | القيمة |
|---|---|
| إجمالي الذرات | 3 |
| عدد الكتب | 1 |
| ذرات قوي | 3 (100%) |
| ذرات جوهر | 1 |
| أنواع الحجج | 3 |
📚 كيف عالج كل كتاب هذا المفهوم
هندسة الذكاء الاصطناعي (3 ذرة)
تتوسع مamba بشكل خطي
“Mamba’s inference computation scales linearly مع sequence length”
🌟 أبرز الذرات في هذا المفهوم
1. تتوسع مamba بشكل خطي
الكتاب: هندسة الذكاء الاصطناعي (تشيب هويين)
الادعاء: Mamba scales state space نماذج إلى billions من parameters و has linear inference cost مع sequence length, unlike transformers’ quadratic scaling.
الشاهد: “Mamba’s inference computation scales linearly مع sequence length”
2. فلاش أتينشن هو نواة مدمجة
الكتاب: هندسة الذكاء الاصطناعي (تشيب هويين)
الادعاء: FlashAttention (انتباه سريع) speeds up انتباه بواسطة fusing together عدة common transformer operations into واحد kernel.
الشاهد: “هذا kernel fused together كثير operations commonly used في a transformer-based نموذج إلى صنع them تشغيل faster”
3. تستهدف LoRA مصفوفات الانتباه
الكتاب: هندسة الذكاء الاصطناعي (تشيب هويين)
الادعاء: في transformer نماذج, LoRA is معظم commonly applied إلى the انتباه matrices لـ query, key, قيمة, و output projection.
الشاهد: “LoRA is معظم commonly applied إلى the أربعة وزن matrices في the انتباه modules”
🔍 كيف يختلف هذا المفهوم بين الكتب؟
من خلال تحليل 3 ذرة عبر 1 كتب:
المبادئ الأساسية
- Mamba scales state space نماذج إلى billions من parameters و has linear inference cost مع sequence length, unlike transformers’ quadratic scaling.
الطرق المطبقة
- FlashAttention (انتباه سريع) speeds up انتباه بواسطة fusing together عدة common transformer operations into واحد kernel.
📌 ملاحظة
هذا المفهوم مترجم آلياً من المحتوى الإنجليزي الأصلي. الشواهد النصية محفوظة بالإنجليزية لضمان الدقة.