← جميع المقالات

الذكاء الاصطناعي Ataraxos يهزم أفضل لاعب Stratego في التاريخ — ويتعلّم بآلاف الدولارات لا بملايينها

لوح لعب زجاجي فاتح يطفو في الهواء مع صفوف من القطع الملساء، بعضها يتوهج بالفيروزي والمرجاني

تمكّن Ataraxos، وهو ذكاء اصطناعي بناه باحثون من جامعة كارنيغي ميلون وMIT وجامعة نيويورك وجامعة ستانفورد، من هزيمة أفضل لاعب Stratego في التاريخ: 15 فوزاً و1 خسارة و4 تعادلات في 20 مباراة ضد بيم نيميّر، أكثر لاعبي هذه اللعبة تتويجاً. نُشرت النتيجة في Nature. والمثير هنا ليس الفوز بحد ذاته بل ثمنه: استغرق التدريب 16 بطاقة رسومية لأسبوع، وأربع بطاقات لأربعة أيام — أي بضعة آلاف من الدولارات — بينما احتاجت محاولة سابقة من DeepMind إلى موارد حوسبة تُقدَّر بنحو 3 إلى 4.5 ملايين دولار. قصة Stratego في حقيقتها قصة عن اتخاذ القرارات حين يكون نصف الموقف مخفياً، وهي المسألة ذاتها في المفاوضات والأسواق المالية والمناورات العسكرية.

ما هي Stratego ولماذا قاومت الذكاء الاصطناعي

في Stratego يملك كل لاعب 40 قطعة تمثّل رتباً عسكرية — من المارشال إلى الجاسوس — إضافة إلى القنابل والعلم. يرى الخصم أين تقف القطع لكنه لا يعرف ما هي. ولا تُكشف الهوية إلا عند الاحتكاك: تُرفع القطعة الأضعف عن اللوح ويُعرف الفائز. ويفوز من يأسر علم خصمه.

المعلومة المخفية هي ما يجعل Stratego صعباً على الآلات. في تكساس هولدم لدى اللاعب ورقتان مخفيتان فقط — أي 1326 احتمالاً، وهو عدد يستطيع الحاسوب تعداده كاملاً. أما في Stratego فيمكن أن تقف 40 قطعة بأي ترتيب: أكثر من 10^33 ترتيباً. أضف طول المباراة — نادراً ما تتجاوز الشطرنج 40 نقلة، بينما تمتد Stratego بسهولة إلى 2000 — فتحصل على مسألة لا يعمل فيها التعداد الكامل.

وثمّة صعوبة ثالثة هي الخداع. أحياناً يكون من المفيد تحريك قطعة ضعيفة كأنها مارشال لإخافة الخصم. ومن يخدع كثيراً يصبح تهديده بلا معنى، ومن لا يخدع أبداً يُقرأ بسهولة. وهذا التوازن هو ما أوقف أنظمة الذكاء الاصطناعي السابقة؛ فحتى DeepNash من DeepMind عام 2022 لم يستطع بميزانيته الضخمة أن يهزم أقوى البشر بثبات.

الفكرتان التي غيّرتا المعادلة

مثل DeepNash، تعلّم Ataraxos باللعب ضد نفسه — 163 مليون مباراة. تُدعَّم النقلات الفائزة وتتكرر أكثر، وتقلّ الخاسرة. لكن المعلومة المخفية تجعل هذه الخوارزميات «تدور في حلقة» لأن تقدير الموقف يتبدّل باستمرار. عالج الفريق ذلك بتغيير الاستراتيجية على نحو غير متساوٍ: خطوات كبيرة وجسورة في بداية التدريب، وخطوات صغيرة حذرة في آخره.

أما الابتكار الأهم فهو ما لم يملكه DeepNash: التفكير قبل كل نقلة. في AlphaGo كان البحث يصقل الاستراتيجية العامة، لكن فضاء البحث في Stratego ضخم إلى حد أن نجاح هذا النهج كان مجهولاً. والحل نموذج عصبي ثانٍ يُسمّى «نموذج المعتقدات» (belief model): يراقب كيف يتحرك الخصم ويقدّر القطع التي قد تشغل الخلايا المخفية. فلم يعد Ataraxos يعدّد كل الترتيبات، بل يأخذ ترتيبات معقولة ويجرّب فيها نقلات مرشحة ويقرّر بناءً على النتيجة.

لوح لعب زجاجي فاتح يطفو في الهواء مع صفوف من القطع الملساء، بعضها يتوهج بالفيروزي والمرجاني

هادئ وغير مضطرب

اسم Ataraxos مشتق من كلمة يونانية قديمة تعني السكينة والاطمئنان، وهذا يظهر في أسلوب لعبه. حيث يعمد الإنسان أمام هزيمة ساحقة إلى المجازفة، يعمل الذكاء الاصطناعي على استعادة الموقف بمنهجية. ومعرفة السرّ لا تشتّت الآلة كما تشتّت الإنسان: يصعب على البشر اتخاذ قرار مع تجاهل معلومات مخفية يعرفونها، ويسهل ذلك على الخوارزمية. لذلك «يخادع» Ataraxos بوجه هادئ ويعود من مواقف لم يبقَ له فيها سوى نحو 2% احتمالاً للفوز.

نيميّر بطل عالم أربع مرات وقضى أكثر من 600 أسبوع في صدارة الترتيب العالمي. لعب خلال ثلاثة أسابيع 20 مباراة ضد الذكاء الاصطناعي مقابل 100 دولار عن كل فوز، ولم يفز إلا مرة واحدة. ولا يرى الباحثون في هذه الخسارة عيباً: فحُسن اللعب في Stratego يقتضي ترتيباً عشوائياً للقطع، لذا يظلّ الحظ فاعلاً. وفي بطولة العالم 2025 كان أداء المتحدّين أسوأ — فقد فاز الذكاء الاصطناعي في 38 مباراة من 40.

الأرقام: 16 بطاقة مقابل 1024 شريحة

تدرّب DeepNash شهرين إلى ثلاثة على 1024 شريحة متخصّصة من Google — ويقدّر فريق Ataraxos كلفة ذلك بـ3 إلى 4.5 ملايين دولار بأسعار 2025. أما Ataraxos فاكتفى بـ16 بطاقة رسومية لأسبوع وأربع بطاقات لأربعة أيام لتدريب نموذج المعتقدات. لعب نحو 34 مرة أقل من المباريات، ومع ذلك لعب أقوى بكثير. والسرّ في محاكٍ خاص يشغّل ملايين النقلات في الثانية على بطاقة رسومية.

ليس Stratego وحده

نجح النهج نفسه في ألعاب أخرى ذات معلومات مخفية. في Barrage Stratego، النسخة الأسرع بثماني قطع، هزم الذكاء الاصطناعي ثلاثة أبطال عالم. وفي لعبة الورق التعاونية Hanabi وفي اللعبة الصينية dou dizhu بلغ مستوى أفضل البرامج. لم يعد الأمر حلاً منفرداً للعبة واحدة بل نمطاً عامّاً للتعلّم المعزَّز والبحث مع كمّ كبير من البيانات المخفية.

وينظر الباحثون إلى ما هو أبعد من ألعاب اللوح. فالمسائل الواقعية — المفاوضات والأسواق والسيناريوهات العسكرية — لا قواعد ثابتة لها ولا فائز واضح، لكن الفريق يذكّر بأن أي تحليل لموقف واقعي يبدأ بنموذج مبسّط. وللتدريب على ردود خصم قوي يصلح هذا النهج من الآن. والتحفّظ صادق أيضاً: لا يستطيع Ataraxos حتى الآن تفسير سبب اختياره لنقلة ما، وهذه مهمة الفريق التالية.

ماذا يعني ذلك عملياً

الخلاصة بسيطة: الفيصل ليس حجم الميزانية بل كفاءة الأسلوب. أنفق Ataraxos موارد حوسبة أقل بمراتب من سابقه ومع ذلك لعب أقوى. وفي الذكاء الاصطناعي التوليدي المنطق نفسه: عند الحجم يفوز ليس النموذج الأثقل بل الأرخص والأكثر موثوقية للمهمة. ووفق بيانات خدمتنا خلال الثلاثين يوماً الأخيرة (الفترة 05.09–05.10.2026، قاعدة إنتاج NeuralSpace) لم يكن أكثر نماذج الصور طلباً هو الأغلى: استحوذ nano-banana-2 على 2351 توليدة بمتوسط كلفة يقارب 0.053 دولار للصورة. والوضع نفسه في الفيديو: حقّق grok-image-to-video الخفيف 1648 مهمة بـ0.15 دولار، بينما لم يسجّل seedance-2.5 الثقيل سوى 246 بمتوسط 1.74 دولار. وإجمالاً نفّذت المنصّة خلال 30 يوماً 12,689 توليدة: 9907 صور و2334 فيديو و448 مقطعاً موسيقياً (تجميع مجهول الهوية، server/seo/benchmarkData.json).

أسئلة شائعة

ما هو Ataraxos؟

شبكة عصبية للعب Stratego بناها فريق من CMU وMIT وجامعتي نيويورك وستانفورد. وهي الأولى في التاريخ التي تهزم أفضل لاعب بشري، وتفعل ذلك بموارد حوسبة أقل بلا مقارنة من المحاولات السابقة.

كيف يختلف هذا عن فوز AlphaGo في لعبة غو؟

في غو والشطرنج يرى اللاعبان الموقف كاملاً. أما Stratego ف لعبة معلومات مخفية: نصف قطع الخصم مجهول. لذلك احتاجت ليس إلى التعلّم المعزَّز فحسب، بل إلى نموذج يقدّر القطع المخفية، وإلى بحث في الترتيبات المعقولة.

هل يمكنني تجريب نماذج مماثلة؟

Ataraxos نفسه مشروع بحثي لا وصول عام إليه. لكن يمكنك التحدّث مع النماذج اللغوية الحديثة في دردشة NeuralSpace، وبناء مشروعك الخاص بالذكاء الاصطناعي في قسم البرمجة.