فريق كايمنغ هي يُظهر أن نموذجاً درُبّ مسبقاً على صور القطط يحلّ مسائل ARC شبه كالنماذج اللغوية
نشر فريق كايمنغ هي — صاحب ResNet وMasked Autoencoder، وأستاذ في MIT اليوم — ورقة لمؤتمر ECCV 2026 يحلّ فيها نموذج بصري درُبّ مسبقاً على صور عادية من ImageNet (قطط وكلاب وأزهار) مسائل اختبار ARC التجريدي: 63.4% pass@2 لنموذج واحد و70.2% لمجموعة. لا نصّ ولا لغة في هذا النموذج، بل «رؤية» فقط نُقلت من الصور الحقيقية إلى شبكات ملوّنة مجرّدة. وهذه أول مرة يقترب فيها نهج بصري خالص إلى هذا الحدّ من أنظمة النماذج اللغوية المتخصّصة، وذلك بربع معاملاتها تقريباً.
ما هو ARC ولماذا هو صعب
ابتكر فرانسوا شوليه، صانع Keras، اختبار ARC (Abstraction and Reasoning Corpus) عام 2019. الصيغة موحّدة: شبكة حتى 30×30 خلية، حتى 10 ألوان، ومن 2 إلى 5 أزواج «مدخل — مخرج». عليك استنتاج القاعدة الخفية من الأمثلة وتطبيقها على شبكة جديدة. يبدو الأمر كلعبة أطفال «اعثر على النمط»، لكنه للآلة أحد أصعب اختبارات التفكير التجريدي: القاعدة جديدة كل مرة، ولا قالباً يحفظ، والأمثلة اثنان أو ثلاثة فقط.
كيف يُحلّ ARC اليوم
تهيمن النماذج اللغوية: تُترجم الشبكة إلى نص أو سلسلة رموز وتُسلَّم إلى LLM للاستدلال. تأخّر الطريق البصري طويلاً، لكنه هو مصدر الحركة الأكثر إثارة الآن. المجموعة نفسها من MIT أعادت في عملها السابق VARC تعريف ARC كمهمّة ترجمة شرطية «صورة إلى صورة» ودفعت نموذجاً بـ19 مليون معامل إلى 54%. ثم جاءت التحسينات: LoopViT باستدلال دوري — 18 مليون معامل و65.8%، وLoop-OWM بتدريب مسبق على الفيديو — 10.6 مليون و68.5%. معاملات أقل بمراتب، والنتائج صارت قريبة.
ما افتقده النماذج البصرية هو التدريب المسبق. النماذج اللغوية تنمو بالتوسّع لأنها درُبّت مسبقاً على جيوب نصية هائلة، بينما بدأت الحلول البصرية لـARC من تهيئة عشوائية ولم تحصل على هذه الميزة.
NAT-ARC: تدريب مسبق على صور القطط
يُدخل NAT-ARC خطوة تدريب مسبق بأسلوب MAE على ImageNet — مجموعة بيانات بنحو 1.3 مليون صورة طبيعية — أمام مسار VARC البصري. MAE (Masked Autoencoder) هو طريقة هي نفسها من عام 2022: يغطي النموذج معظم الصورة ويتعلّم استعادة الأصل من الشظايا المتبقية، فيفهم الأشكال والبنية والعلاقات المكانية في الطريق.
وتفصيلة عملية: أخذ الباحثون نقطة فحص MAE العامة الجاهزة ولم ينفقوا قرشاً على التدريب المسبق. النقطة مصمّمة لصور ImageNet الكبيرة بينما شبكات ARC بحجم 64×64 بكسل فقط، فأبقوا من العمود الفقري (backbone) فقط، وأسقطوا تضمين الرقع والترميزات الموضعية، ووضعوا بدلاً منها 2D RoPE المرن.

لماذا تساعد القطط في حل مسائل مجرّدة
وضع المؤلفون ثلاثة نماذج بتهيئات مختلفة — بلا تدريب مسبق، وبتدريب ImageNet MAE، وبتدريب MAE بأسلوب ARC — أمام مسائل ARC قبل أي تدريب ونظروا إلى خرائط الانتباه. انتباه النموذج العشوائي ممتدّ بالتساوي بلا تركيز. أما انتباه النموذج المدرَّب على ImageNet فيتجمع تلقائياً على المناطق ذات المعنى: يعرف كيف يفصل الكائن عن خلفيته مع أنه لم يرَ أي شبكة ARC.
انتقى الباحثون 15 مسألة منحها التدريب المسبق دفعة واضحة وشروحوها يدوياً. ستّ منها من نوع «طابق وانسخ» — التعرّف على كائن أو لون أو نمط ونسخ بنيته إلى المخرج. وستّ أخرى من نوع الاستدلال على المكوّنات المتصلة — عزل منطقة متصلة من الشبكة أو تعبئتها أو إعادة تلوينها. «افصل القطة عن العشب» يتحوّل في ARC إلى «افصل المنطقة الملوّنة المتصلة عن الخلفية» — العالم البصري والعالم المجرّد يتشاركان الميكانيكا نفسها.
الأرقام: 0.6 مليار معامل مقابل 8 مليارات
على ARC-1 سجّل أفضل نموذج مفرد من NAT-ARC بمقياس huge — 0.6 مليار معامل — 63.4±0.7% pass@2. ومجموعة من ثلاثة نماذج باستراتيجيات تدريب مسبق مختلفة (تصويت الأغلبية، نحو 2 مليار معامل إجمالاً) بلغت 70.2±0.6%. وللمقارنة: أفضل نظام LLM متخصّص، The ARChitects، يسجّل 71.6% — لكن على نموذج لغوي بـ8 مليارات معامل. اقترب الطريق البصري منه بربع المعاملات.
التدريب المسبق أصلح منحنى التوسّع
النتيجة المهمة الثانية تتعلق بكيفية نمو النماذج. بلا تدريب مسبق ينكسر المنحنى: ترتفع الدقة من base إلى large ثم تهبط من large إلى huge — نموذج أكبر بلا نتيجة أفضل، لأن بيانات ARC قليلة جداً فتذهب السعة الإضافية إلى فرط التخصيص. ومع تدريب ImageNet المسبق يصبح المنحنى صحياً: المقاييس الثلاثة تتحسّن مع الحجم. هذا هو التوسّع المكشوف للطريق البصري.
وحصل المؤلفون على برهان أنيق من الجهة المعاكسة: يحوّل مرمّز تلقائي صورة عادية من ImageNet إلى شبكة منفصلة 60×60 بعشرة ألوان — أي «يترجم القطة إلى لغة ARC». ثم يطبّق NAT-ARC على هذه الشبكة تحويلات تعلّمها — دوراناً بـ180 درجة وإطاراً أزرق — ويفكّها إلى بكسل من جديد. لقد دارت القطة فعلاً وظهر الإطار فعلاً. القواعد المجرّدة والتمثيلات البصرية تسكن فضاءً واحداً.
من وراء ذلك
المؤلفة الأولى هي شياومان ديلوريس دينغ من MIT CSAIL، من مجموعة هي؛ وهي التي قادت VARC السابقة أيضاً. ثم كيا هو وكيتلين غان وفيكتور ين — من MIT كذلك. والمؤلف المشارك والمراسِل هو كايمنغ هي نفسه؛ عبر ResNet وMAE يمكن خياطة نحو عقد كامل من الذكاء البصري. والمضحك أنه في هذا العمل الجديد يستخدم طريقته التي أوجدها قبل أربع سنوات أداةً: سلاح قديم فتح طريقاً جديداً.
ماذا يعني ذلك عملياً
الخلاصة الرئيسية: الحجم ليس كل شيء — التدريب المسبق هو الفيصل. نموذج مدمج بتدريب مسبق جيد يلحق بنظام أكبر منه أربع مرات. وتوليد الصور يسير بالمنطق نفسه: الفائز ليس النموذج الأكبر بل الأفضل تدريباً للمهمّة والأرخص تشغيلاً. وفق بيانات خدمتنا، خلال الثلاثين يوماً الأخيرة (11,177 محاولة توليد صور من 2 سبتمبر إلى 1 أكتوبر 2026) كان النموذج الأكثر طلباً ليس الأثقل على الإطلاق — استحوذ nano-banana-2 على 2,560 توليدة مكتملة، نحو 23% من المجموع، بمتوسط تكلفة يقارب 0.05 دولار للصورة (جدول generation_costs للفترة نفسها). وموثوقية النماذج المدمجة بمستوى إنتاجي كامل: خلال الشهر نفسه فشلت في إنتاج نتيجة نحو كل محاولة ثالثة عشرة — 829 فشلاً من 11,177.
والتحفّظ صادق: ARC-1 معيار واحد، والاستدلال البصري الشامل ما يزال بعيداً. لكن الاتجاه واضح: بدل تضخيم النماذج اللغوية بلا نهاية، يمكن تعليم الرؤية من العالم الحقيقي ونقلها إلى المجرّدات.
أسئلة شائعة
ما هو ARC؟
معيار استدلال تجريدي من صانع Keras فرانسوا شوليه: من 2–5 أمثلة «مدخل — مخرج» على شبكة ملوّنة، استنتج القاعدة الخفية وطبّقها على شبكة جديدة. يُعدّ من أصعب المعايير للذكاء الاصطناعي.
لماذا القطط تحديداً؟
الجوهر ليس القطط بل التدريب المسبق على الصور الطبيعية — ImageNet مليء بها. النموذج الذي تعلّم فصل الكائنات عن الخلفيات في الصور ينقل هذه القدرة إلى الشبكات المجرّدة.
هل يمكنني تجربة توليد الصور؟
نعم، في قسم توليد الصور في NeuralSpace — يجمع نماذج من فئات مختلفة، من السريعة إلى الأعلى جودة.