مفهوم: زمن الاستجابة
مفهوم: latency عدد الذرات: 11 | عدد الكتب: 1
هذا المفهوم يظهر في 11 ذرة عبر 1 كتاباً في الأطلس.
📊 إحصائيات المفهوم
| المقياس | القيمة |
|---|---|
| إجمالي الذرات | 11 |
| عدد الكتب | 1 |
| ذرات قوي | 11 (100%) |
| ذرات جوهر | 5 |
| أنواع الحجج | 3 |
📚 كيف عالج كل كتاب هذا المفهوم
هندسة الذكاء الاصطناعي (11 ذرة)
يُعدّ زمن التأخير تحديًا كبيرًا
“getting AI applications’ latency down إلى the 100 ms latency expected لـ a typical internet application is a huge challenge”
🌟 أبرز الذرات في هذا المفهوم
1. يُعدّ زمن التأخير تحديًا كبيرًا
الكتاب: هندسة الذكاء الاصطناعي (تشيب هويين)
الادعاء: AI applications face a major latency challenge لأن token generation is sequential و مستخدم expectations are جداً منخفض.
الشاهد: “getting AI applications’ latency down إلى the 100 ms latency expected لـ a typical internet application is a huge challenge”
2. استخراج المصطلحات أسرع
الكتاب: هندسة الذكاء الاصطناعي (تشيب هويين)
الادعاء: Term-based retrieval is generally faster من embedding-based retrieval لـ both indexing و querying.
الشاهد: “Term-based retrieval is generally كثير faster من embedding-based retrieval خلال both indexing و query.”
3. يؤدي تداخل فك التشفير المسبق إلى الإضرار بزمن الاستجابة
الكتاب: هندسة الذكاء الاصطناعي (تشيب هويين)
الادعاء: Adding a جديد query can بطيء existing decoding jobs لأن the جديد prefill job drains computational resources من them.
الشاهد: “هذا واحد prefilling job can drain computational resources من existing decoding jobs, sloفوزg down TPOT لـ هؤلاء requests.”
4. تفكيك مرحلتي التعبئة المسبقة وفك الترميز يساعد
الكتاب: هندسة الذكاء الاصطناعي (تشيب هويين)
الادعاء: Assigning prefill و decode إلى مختلف instances can significantly تحسين throughput بينما still اجتماع latency requirements.
الشاهد: “assigning pre‐ fill و decode operations إلى مختلف instances (e.g., مختلف GPUs) can signifi‐ cantly تحسين the مجلد من processed requests بينما adhering إلى latency requirements.”
5. المئينات تتفوق على المتوسطات
الكتاب: هندسة الذكاء الاصطناعي (تشيب هويين)
الادعاء: Latency should be analyzed مع percentiles إلى حد من فقط averages لأن averages can hide outliers.
الشاهد: “لأن latency is a distribution, the متوسط can be misleading.”
🔍 كيف يختلف هذا المفهوم بين الكتب؟
من خلال تحليل 11 ذرة عبر 1 كتب:
المبادئ الأساسية
-
Term-based retrieval is generally faster من embedding-based retrieval لـ both indexing و querying.
-
نموذج latency depends على the prompt و sampling variables, لا فقط على the underlying نموذج.
-
Latency should be analyzed مع percentiles إلى حد من فقط averages لأن averages can hide outliers.
الطرق المطبقة
- Assigning prefill و decode إلى مختلف instances can significantly تحسين throughput بينما still اجتماع latency requirements.
📌 ملاحظة
هذا المفهوم مترجم آلياً من المحتوى الإنجليزي الأصلي. الشواهد النصية محفوظة بالإنجليزية لضمان الدقة.