← جميع المقالات

DeepSeek أسرع بـ 6.87 مرة على كروت PCIe الرخيصة — بالبرمجيات وحدها

قاعة خوادم: صف من كروت الرسوميات الخافتة وصف يلمع بالأزرق، وبينهما تيار من الجزيئات المضيئة

نشر مشغّل حوسبة صيني، 是石科技 (METASTONE)، نتائج محرّكه لاستدلال النماذج Meta-Infer. على جهاز بثمانية كروت PCIe فقط — أي من دون وصلة NVLink السريعة بين المعالجات، وعلى عتاد أرخص بكثير — ارتفعت إنتاجية DeepSeek-V4.1-Flash على المدخل من 1932 إلى 13274 رمزاً في الثانية. هذا يعني تسريعاً بنسبة 6.87 مرة، وجاء كله من البرمجيات: لم تُمسّ أوزان النموذج ولا بنيته. وقد أعطت الأساليب نفسها تسريعاً بمقدار 1.55 مرة على DeepSeek-V4-Flash، و1.92 مرة على GLM 5.3، وحتى 5.33 مرة على توليد الفيديو في MiniMax H3.

لماذا تُعدّ هذه مشكلة؟

الطلب على الحوسبة للنماذج الكبيرة يرتفع، بينما المعالجات الرائدة غالية ويصعب توفيرها. لذلك يشتري كثيرون كروتاً أبسط: غالباً بلا NVLink — القناة السريعة بين المعالجات — وهي ليست ضمن قائمة العتاد المعتمد رسمياً في الأطر المفتوحة الشائعة.

شكلياً لا مشكلة: النموذج يُحمَّل والخادم يعمل. لكن تحت الغطاء تنسحب الأطر بصمت إلى مسار عام بطيء. بعض العمليات تتراجع إلى تطبيقات عامة غير فعّالة، ومعايير التبادل بين الكروت تُنسخ من NVLink، وإعدادات الذاكرة والتوازي تُنسخ من عتاد آخر. فتظل الكروت عاطلة في انتظار بعضها. وهكذا يبقى كامن العتاد حبيس عدم توافق برمجي، لا حبيس الشرائح نفسها.

ماذا يفعل Meta-Infer

العمل يجري في أربعة اتجاهات.

سدّ ثغرات الأنوية. مع عتاد خارج قائمة التحقق، لا ينهار الإطار ولا يشتكي — بل يتجاوز المسارات السريعة بصمت. فيشغّلها الفريق يدوياً: يفتح مسار المدخل الطويل السريع (sparse-MLA Prefill)، ويستبدل نواة ضرب المصفوفات البطيئة بأخرى أسرع، ويوسّع تغطية قناة التبادل السريعة بين الكروت.

تحسين العمليات وإعادة بناء التبادل. تُدمج العمليات الأساسية لتقصير زمن الخطوة الواحدة؛ ويُوازى الحساب مع تبادل البيانات زمنياً حتى لا تنتظر الكروت بعضها؛ وتُعاد كتابة منطق الاتصال الجماعي ليلائم عرض نطاق PCIe الحقيقي لا NVLink.

ضبط التوازي والسعة. تُختار إعدادات توازٍ مختلفة لمرحلة التمهيد (Prefill) ومرحلة التوليد (Decode)، ويُعدَّل حجم ذاكرة المفاتيح والقيم ونصيب الذاكرة الثابتة ديناميكياً لتجنّب الفيض والتراجع إلى مسارات بطيئة.

إعادة استخدام الذاكرة المؤقتة. للنصوص الطويلة والفيديو يُعاد استخدام الكاش المحسوب سابقاً مع تقييم للمخاطر: أين يمكن أخذه جاهزاً وأين يلزم تحديثه من دون خسارة جودة الإجابة.

قاعة خوادم: صف من كروت الرسوميات الخافتة وصف يلمع بالأزرق، وبينهما تيار من الجزيئات المضيئة

الأرقام

كل القياسات أُجريت على العتاد نفسه، ومن دون تغيير أوزان النماذج أو بنيتها.

DeepSeek-V4.1-Flash: نسخة «اليوم صفر» المجتمعية أعطت 1932 رمزاً في الثانية على المدخل. بعد ملاءمة العتاد — 5850. وبعد الضبط الكامل — 13274 رمزاً في الثانية، أي نمو بنسبة 6.87 مرة، مع سياق يصل إلى مليون رمز.

DeepSeek-V4-Flash: من 14546 إلى 22584 رمزاً في الثانية (1.55 مرة).

GLM 5.3: من 3236.78 إلى 6222.72 رمزاً في الثانية (1.92 مرة). وانخفض زمن أول رمز عند المئين 95 من 141.6 إلى 46.6 ثانية، وارتفع السياق المدعوم من 270 ألفاً إلى 1.05 مليون رمز.

نموذج الفيديو MiniMax H3: توليد مقطع 15 ثانية من صورة مرجعية صار أسرع بـ 2.48 مرة عند الذروة نفسها لاستهلاك ذاكرة الفيديو، وعلى الجهاز الثماني ارتفعت الإنتاجية حتى 5.33 مرة للنص إلى فيديو و4.98 مرة للصورة إلى فيديو.

ويلفتون أيضاً إلى أثر تغيير واحد فقط: عندما صار الخبراء المشتركون والخبراء الموجَّهون يُمرَّرون على التوازي، أعطى ذلك زيادة 11.26% في 35 اختباراً مزدوجاً.

ما مدى القرب من العتاد الرائد؟

الفارق مع الرائد أصغر مما يبدو. بحساب جهاز كامل (ثمانية كروت، مقطع 5 ثوانٍ، 768p، 16:9) ينتج هذا الإعداد 296 مقطعاً في الساعة مقابل 439 لجهاز B300 الرائد — نحو 67%. وللصورة إلى فيديو: 131 مقابل 225 في الساعة، نحو 58%. وليتحقق التكافؤ في الإنتاجية، يقدّر المؤلفون الحاجة إلى نحو 2.6–2.9 من هذه الأجهزة مقابل كل B300، ومع أساليب إضافية للتخزين المؤقت وإضافة خفيفة مضبوطة تنزل النسبة إلى 1.5–1.7 جهاز.

بمعنى آخر، الفارق في العتاد لم يختفِ، لكن جزءاً كبيراً من التأخر المرئي ليس فيزياء شرائح، بل جهوزية البرمجيات.

أين المكمن؟

أولاً، كل الأرقام من الشركة نفسها، ولا يوجد تكرار مستقل بعد. والقياسات أُجريت على تهيئة معينة وإصدارات محددة من الإطار، وسيكون الناتج مختلفاً على عتاد آخر.

ثانياً، تبقى كروت PCIe أبطأ في تبادل البيانات من NVLink. قد تقلّل البرمجيات وقت العطالة، لكنها لا توسّع القناة. وفي المهام التي يكون فيها التبادل بين الكروت حرجاً سيبقى الفارق.

ثالثاً، التسريع محسوب على إنتاجية المدخل لا على الكلفة الإجمالية للتملك. فقد يأكل عدد أكبر من الأجهزة والطاقة جزءاً من التوفير الذي تجلبه الكروت الرخيصة.

ماذا يعني ذلك للمستخدم

الخلاصة بسيطة: كلفة تشغيل النماذج تتحدّد أكثر فأكثر لا بسعر الشرائح فقط، بل بجودة حزمة البرمجيات. وإذا انتشرت تحسينات كهذه، ستصبح الحوسبة نفسها أرخص — ما يمنح الخدمات مجالاً لخفض الأسعار وخدمة طلبات أكثر على العتاد ذاته.

يمكنك رؤية كيف تعمل النماذج الحديثة في دردشة NeuralSpace. لتوليد الصور قسم الصور، وللفيديو قسم الفيديو.

المصدر: 量子位 (QbitAI).