نموذج مفتوح بحجم 9B يتصدّر 8 من 9 اختبارات للفهم المكاني دون التضحية بقدراته العامة
أطلقت فرق صينية نموذج ZDTaichu5.0-9B بأوزان مفتوحة: تسعة مليارات معامل، وسياق يصل إلى 128 ألف رمز، ومدخلات من نص وصور وفيديو. الحجم ليس القصة هنا. في ثمانية من تسعة اختبارات دولية للاستدلال المكاني يتقدّم على كل النماذج دون 10B، بما فيها Qwen3.5-9B وSTEP3-VL-10B، وفي MindCube-tiny يسجّل 78.27 مقابل 70.87 لـ Gemini 3 Pro و63.56 لـ Grok 4. وكل هذا من دون المقايضة المعتادة: التعرّف على النصوص والرياضيات والبرمجة بقيت في مستوى متصدّري فئته.
لماذا يُعدّ الفهم المكاني صداعاً منفصلاً؟
النماذج متعددة الوسائط تصف الصورة بشكل معقول منذ زمن: ما فيها، ومن يقف أين، وما تقوله اللافتة. لكن اطلب من أحدها إعادة ترتيب أشياء في غرفة وتبدأ المشاكل. أين مقبض الكوب بالضبط؟ وعلى أي جهة سيكون الخزانة إن استدرت نحو الأريكة؟ وهل المساحة يمين الطبق فارغة؟
هذه مهام من نوع آخر. لا يُطلب منك «التعرّف على جسم»، بل بناء مشهد ثلاثي الأبعاد في رأسك، وتحويل نظام الإحداثيات، وفهم ما يمكن ليد أن تفعله فعلاً. الروبوتات تتعثّر هنا تحديداً، لا في التعرّف.
وهناك فخ ثانٍ: النماذج عادة تُدفع في اتجاه واحد. تحمّلها بيانات مكانية فتنهار الرياضيات والتعرّف على النصوص. أما ZDTaichu5.0-9B فيُقدَّم كمحاولة للجلوس على الكرسيين معاً.
ماذا يفعل عملياً
تعرض العروض ثلاث مهام يومية، لكنها ليست يومية إطلاقاً بالنسبة لروبوت.
الأولى: «جد الصندوق الفضي الثاني من اليسار إلى اليمين» على طاولة مزدحمة. على النموذج أن يمسك في الوقت نفسه بصفة «فضي»، ونوع الجسم «صندوق»، والترتيب «الثاني من اليسار». فيعطي إحداثيات مُطبَّعة (237، 226) — داخل المنطقة المطلوبة تماماً.
الثانية: ثلاث صور لغرفة واحدة. على النموذج أن يتخيّل نفسه ينتقل إلى الستارة الخضراء، ويستدير نحو الأريكة الزرقاء، ثم يقول أين تقع الخزانة الحمراء بالنسبة إليه. الجواب «أمامه ويمينه» صحيح. هذا لم يعد تعرّفاً، بل تغييراً لمرجع الإحداثيات.
الثالثة: إيجاد مساحة فارغة قرب مقبض الكوب الأقصى يميناً. أولاً تحديد مكان المقبض، ثم التحقق مما إذا كانت المساحة بجانبه مشغولة. إصابة أخرى.

ثم تأتي مشاهد أطول: ذراع آلية تعيد سكيناً إلى الدرج، وذراعان تنقلان أنابيب اختبار إلى حامل، ومناولة ترفع قطعة عمل من الرف وتضعها على الطاولة. في كل حالة يحتفظ النموذج في ذهنه ليس باللقطة الحالية فقط، بل بما تغيّر بعد الحركة السابقة.
الأرقام
المقارنة تجري مع النماذج المفتوحة Qwen3.5-9B وSTEP3-VL-10B وgemma4-8B-E4B، ومع المغلقة Gemini 3 Pro وGrok 4 وGPT-5.2.
الاختبارات المكانية: MindCube-tiny — 78.27 (Gemini 3 Pro 70.87، Grok 4 63.56، gemma4-8B-E4B 48.85). ViewSpatial — 62.50 مقابل 48.20 لـ Qwen3.5-9B. MMSI-Bench — 47.20 مقابل 38.70. VSI-Bench — 59.69. SparBench — 51.82. RoboSpatial — 56.00. ERQA — 48.00. 3DSRBench — 60.96. الاختبار الوحيد الذي يخسره داخل فئته هو CV-Bench: 86.82 مقابل 87.19 لـ Qwen3.5-9B. ومن هنا عبارة «ثمانية من تسعة».
القدرات العامة: AI2D — 91.48 (Gemini 3 Pro 94.10، GPT-5.2 92.20)، MathVista Mini — 84.50، WeMath — 75.90، OCRBench — 85.50، MMStar — 76.80.
المهام الوكيلية والنصية: TAU2-Bench — 87.70، Claw-Eval — 71.40، IFEval — 93.70، LiveCodeBench v6 — 73.40، AIME 2025 — 86.70.
لكن انظر إلى التشتّت. في MMLU-Pro النموذج متأخّر بوضوح (77.20 مقابل 89.80 لـ Gemini 3 Pro)، وكذلك في OCRBench (85.50 مقابل 90.40). هذا ليس بطلاً شاملاً، بل نموذجاً بميل قوي نحو المكان ومستوى عام جيد لكنه ليس الأفضل.
كيف صُنع؟
جزءان: البيانات والاستدلال.
في البيانات يصف الفريق خط إنتاج من ثلاث مراحل. أولاً تدريب مسبق على أزواج «صورة — نص» المفتوحة، ومستندات الويب، والفيديو متعدد الإطارات، والمشاهد ثلاثية الأبعاد المُصنَّعة، مع إزالة التكرار وتنقية المحتوى الرديء. ثم ضبط دقيق على التعليمات والأسئلة الحقيقية والأمثلة المكانية ومسارات استدعاء الأدوات. وأخيراً اختيار أكثر الأمثلة إفادة وتعلّم معزّز تُحسب مكافأته آلياً: إجابة صحيحة، إحداثيات في الهدف، التزام بالتنسيق.
وتفصيل لطيف: في الأمثلة التي تتضمن أفعالاً في العالم المادي يتحقق الخط من انسجام الصورة والسؤال وعلاقات الأجسام وقيود الفعل. إذا كان الدرج مغلقاً في اللقطة، فلا يجوز تدريب النموذج على أمر «ضعها في الداخل».
الجزء الثاني هو الاستدلال التكراري التكيّفي. بعد مرور أمامي عادي ينظر النموذج إلى إنتروبيا التوزيع للرمز الحالي. إن كانت منخفضة يخرج الرمز فوراً. وإن كانت مرتفعة يُعاد تشغيل كتلة وسيطة: تُصقل الحالات المخفية في الفضاء الكامن، ويحصل الرمز الصعب على حساب أكثر. ويتوقف هذا وفق إشارتين معاً — تباعد KL بين التوزيعات وبقايا الحالة المخفية — ثم يختار مسار القراءة الحالة الأقل خطراً، مع تراجع عند الحاجة.
الفكرة ليست فريدة: مبدأ مشابه — «ارفع الجهد في المهمة الصعبة واخفضه في السهلة» — ظهر مؤخراً في GPT-6 Astra. لكن بين النماذج المفتوحة بهذا الحجم يبدو هذا أول تطبيق.
أين المكمن؟
أولاً، كل الأرقام من مدوّنة الإصدار الخاصة بالفريق. لا توجد حتى الآن تجارب مستقلة، واختبارات الاستدلال المكاني حديثة ويسهل الإفراط في ملاءمتها.
ثانياً، 9B تبقى 9B. في المعرفة والاستدلال العام يخسر النموذج بصدق أمام النماذج الرائدة، ومكانه في الروبوتات الحقيقية هو طبقة التخطيط العليا، لا استبدال منظومة التحكم كلها.
ثالثاً، العروض أمثلة ناجحة منتقاة. كم مرة من عشر تضع الذراع السكين في الدرج فعلاً — هذا لا يظهر من الإصدار.
ما العمل؟
الأوزان مفتوحة: مستودع على GitHub، وبطاقات على Hugging Face وModelScope، وموقع منفصل بالاختبارات. ويقول الفريق إنه يمكن ضبط النموذج على بياناتك الخاصة — تسجيلات المصنع، وسجلات التجارب، والمحاكاة.
وإن أردت فقط رؤية كيف تجيب نماذج كهذه عن أسئلة حول الصور، يمكنك تجربتها في دردشة NeuralSpace. لمهام الفيديو هناك قسم الفيديو، ولتوليد الصور — الصور.
المصدر: 量子位 (QbitAI) ومدوّنة الإصدار الرسمية للنموذج.