← جميع المقالات

فريق vLLM يجعل Kimi K3 أسرع بنسبة 57% على شرائح Google TPU مقارنةً ببطاقات NVIDIA

وحدات تسريع زجاجية مضيئة يربطها تيار من جزيئات البيانات المتوهجة

حقّقت شركة Inferact، التي أسّسها مطوّرو ومشرفو محرّك vLLM مفتوح المصدر، نتيجة لافتة: على 16 مسرّعاً من نوع Google TPU v7 يقدّم نموذج Kimi K3 نحو 709 رموز في الثانية، بينما لا تتجاوز 16 بطاقة NVIDIA GB200 نحو 452 رمزاً. أي فارق 57% لصالح TPU، مع أن عتاد NVIDIA أقوى على الورق. والسرّ ليس في الشرائح بل في طبقة البرمجيات: كتب الفريق «ميغا كيرنل» يدمج مئات العمليات الصغيرة في برنامج واحد كبير. والكود متاح مفتوح المصدر.

ما الذي قُورن بالضبط

وضعت Inferact شرائح TPU والبطاقات في ظروف متطابقة: 16 مسرّعاً من كل جهة، والنموذج نفسه Kimi K3، والمحرّك نفسه vLLM. المتغيّر الوحيد هو الشريحة وتنفيذ الأنوية منخفض المستوى. ومع تفعيل الفكّ التخميني (speculative decoding) بلغ TPU نحو 709 رموز في الثانية مقابل 452 لبطاقة GB200.

وإذا أوقفنا الفكّ التخميني ونظرنا إلى السرعة الخام، لا يختفي الفارق. عند حجم دفعة 1 ينتج TPU نحو 249 رمزاً في الثانية مقابل 127 لـ GB200، أي ضعف تقريباً. وعند حجم دفعة 8 يصبح الرقم 865 مقابل 636. وعلى نموذج آخر هو Qwen 3.8 27B يتّسع الفارق أكثر: أربع شرائح TPU تصل إلى 1515 رمزاً في الثانية مقابل 695 لأربع بطاقات.

وحدات تسريع زجاجية مضيئة يربطها تيار من جزيئات البيانات المتوهجة

لماذا تقدّمت الشريحة «الأضعف»؟

على الورق يتقارب TPU v7 Ironwood وGB200: ذروة الأداء في BF16 هي 2.31 مقابل 2.5 بيتافلوبس، وفي FP8 هي 4.61 مقابل 5 بيتافلوبس. أما في عرض نطاق الذاكرة فيخسر TPU فعلاً: 7380 غيغابايت/ثانية مقابل 8000. أي أن ذاكرة NVIDIA أسرع بينما استنتاجها أبطأ. إذن الفرق ليس في العتاد بل في طريقة استغلاله.

لا يتوقّف استنتاج النماذج اللغوية على الحساب بل على نقل البيانات. لتوليد رمز واحد يجب تمرير كل أوزان النموذج عبر الشريحة: سحبها من ذاكرة HBM إلى الذاكرة الداخلية، ثم الحساب، ثم إعادة الكرّة للرمز التالي. وجرت العادة على تقسيم هذه العملية إلى مئات البرامج الصغيرة المسمّاة أنوية (kernels). وبينما ينتهي نواة ولم تبدأ التالية، تبقى الذاكرة عاطلة، وتتراكم هذه الوقفات إلى خسارة ملموسة.

«ميغا كيرنل»: برنامج واحد بدل مئة

فكرة Inferact هي إزالة الحدود بين الأنوية. النموذج كله، أي 92 طبقة من مزيج الخبراء، يتّسع في برنامج واحد بلغة Pallas، وهي لغة منخفضة المستوى لشرائح TPU تؤدي دور CUDA لدى NVIDIA. وبما أن الحدود اختفت، يمكن البدء بتحميل أوزان الطبقة التالية مسبقاً بينما لا تزال الطبقة الحالية تحسب. فبينما تنشغل الطبقة N بخبرائها، تكون أوزان انتباه الطبقة N+1 قد بدأت تنتقل من الذاكرة إلى الشريحة. وهكذا لا تكاد الذاكرة تعطل.

وتناسب هذه الحيلة معمارية TPU جيداً. فكل نواة موتر في TPU v7 تملك 64 ميبيبايت من الذاكرة السريعة على الشريحة، والمبرمج هو من يقرّر ما يسكنها ومتى يفرّغها. أما البطاقات فتنظيمها مختلف: نحو 38 ميبيبايت للبطاقة كاملة، موزّعة على 152 كتلة وتديرها العتاد، فلا مكان لترتيب الأوزان مسبقاً.

ومن الفوائد الجانبية السارّة سرعة البناء: المترجم التقليدي لشرائح TPU يستغرق أكثر من 30 دقيقة لبناء نموذج كبير، بينما يُترجم «ميغا كيرنل» في أقل من 90 ثانية. وبالنسبة للمهندس، هذا فرق بين اختبار التعديل غداً واختباره بعد دقيقة.

الفكّ التخميني والدقة

الطبقة الثانية من التسريع هي الفكّ التخميني وفق مخطط DSpark الذي اقترحه فريق DeepSeek. يقترح نموذج مسوّدة صغير بسرعة عدة مرشّحين للرمز التالي، ثم يتحقّق النموذج الكبير منها دفعةً واحدة: تُقبل التخمينات الصحيحة فوراً وتُرفض الخاطئة. وعلى TPU بلغ متوسط طول السلسلة المقبولة 6 رموز، وتستغرق خطوة الفكّ الواحدة نحو 8.5 ميلي ثانية.

والأهم أن السرعة لم تأتِ على حساب الجودة. فمع الفكّ الجشع وأقصى جهد استدلال، سجّل «ميغا كيرنل» 94.4% على GPQA-Diamond و97.2% على GSM8K، وهي الأرقام نفسها على البطاقات.

من فعل ذلك؟

Inferact شركة من أبناء فريق vLLM، أشهر محرّك مفتوح المصدر لتشغيل الشبكات العصبية. الرئيس التنفيذي سايمون مو أحد مشرفي vLLM، والمؤسّس المشارك ووسوك كوون هو صاحب المشروع وخوارزمية PagedAttention، والعالم الرئيسي يو كاي تشاو جاء من جامعة تسينغهوا. جمعت الشركة هذا العام 150 مليون دولار في جولة تأسيسية بتقييم 800 مليون. والعمل على «ميغا كيرنل» مشروع مشترك مع Google Cloud، والكود كله مفتوح.

ماذا يعني ذلك عملياً

الخلاصة بسيطة: في سباق سرعة الاستنتاج لم يعد العتاد وحده هو الفيصل. شريحتان من الفئة نفسها، ونموذج واحد، ومحرّك واحد، ومع ذلك فارق بمقدار مرة ونصف، وكلّه في طبقة البرمجيات. ولمن يدفع مقابل الحوسبة، يعني هذا أن تحسين الكود قد يمنح أكثر من شراء مسرّعات جديدة.

والتحفّظات صادقة أيضاً. فـ«ميغا كيرنل» مصمّم حالياً لمعمارية Kimi K3 تحديداً ولتشكيلة من 16 شريحة، وأي نموذج آخر أو عدد مختلف من المسرّعات يعني إعادة كتابته. هذه خطوة أولى لا حلّاً شاملاً جاهزاً.

أسئلة شائعة

ما هو «ميغا كيرنل»؟

برنامج كبير واحد ينفّذ مرور النموذج كاملاً دفعةً واحدة بدل مئات البرامج الصغيرة. وبذلك تختفي وقفات التبديل بينها، وتتمكّن الذاكرة من التحميل المسبق.

هل أصبحت شرائح TPU أفضل من البطاقات للذكاء الاصطناعي؟

ليس بهذا القطع. المقارنة هنا تخصّ سيناريو ضيقاً: تشغيل نموذج واحد بدفعة صغيرة. وفي مهام أخرى، خصوصاً التدريب، قد يختلف المشهد. لكن النتيجة تُظهر أن تحسين البرمجيات قد يتجاوز فارق العتاد.

هل يمكنني تجربة Kimi K3؟

نعم، أوزان النموذج مفتوحة. يمكنك الدردشة معه في دردشة NeuralSpace وتجربة سيناريوهات الوكلاء في قسم البرمجة.