← جميع المقالات

Claude أغلق مبرهنة فيرما في 11 يومًا: 13.4 مليون سطر من Lean ولا عبارة "من الواضح" واحدة

الأشكال الهندسية المتوهجة - نظرية فيرما الأخيرة التي تم صياغتها بواسطة الذكاء الاصطناعي

في 4 سبتمبر، أظهرت أنثروبيك أول اختبار آلي كامل لنظرية فيرما الأخيرة. Claude في 11 يومًا، تقريبًا دون مساعدة من الناس، ترجم برهان أندرو ويلز إلى اللغة Lean: 13.4 مليون سطر من التعليمات البرمجية، حوالي 30 ألف نظرية متوسطة، صفر "واضح مما قيل". تم الانتهاء من المشروع، الذي كان علماء الرياضيات يخططون له لسنوات - فقط رسم المرحلة الأولى لكيفن بوزارد من جامعة إمبريال كوليدج في لندن يبلغ طوله 86 صفحة - في أسبوع ونصف.

دعونا نوضح على الفور ما هو غير موجود هنا: لا يوجد دليل جديد. لم يتوصل النموذج إلى طريقه الخاص إلى النظرية. لقد فعلت شيئًا مختلفًا، وبصراحة، ليس أقل تعقيدًا - لقد أخذت دليلاً بشريًا، حيث يوجد في كل صفحة إخلاء مسؤولية مثل "هذا يتبع بشكل تافه"، وأعادت كتابته بحيث يتحقق المترجم من كل خطوة. كان علماء الرياضيات بعد عام 1995 واثقين من النظرية بنسبة 99.9%. الآن يمكنك التحقق بنسبة مائة بالمائة: لقد تم تشغيل Lean عبر الاشتقاق الكامل من البديهيات القياسية الثلاثة، ولم يعد هناك ما يدعو للشك.

ما الذي فحصه الكمبيوتر بالضبط؟

الأرقام أكثر ملاءمة هنا من الصفات.

  • إن 13.4 مليون سطر من Lean أكبر بخمس مرات من Mathlib بأكمله، مكتبة الرياضيات الرسمية الرئيسية للنظام.
  • تم إثبات حوالي 30 ألف نظرية متوسطة؛ تضمن الناتج النهائي حوالي 29500.
  • يستغرق تجميع مستودع على جهاز ذو 96 نواة حوالي 20 مرة أطول من تجميع Mathlib. تم منح Buzzard خادمًا بسعة 500 جيجابايت من ذاكرة الوصول العشوائي طوال مدة الاختبار.
  • يتم الاعتماد فقط على ثلاث بديهيات قياسية Lean. لا "افتراضات للبساطة".

قام كيفن بوزارد، عالم الرياضيات نفسه الذي قاد مشروع إضفاء الطابع الرسمي على Fermat للمجتمع منذ عام 2024، بتنزيل المستودع وتجميعه وتشغيل المقارنة: تتطابق صياغة مخرجات النظرية مع الصيغة المرجعية من Mathlib، وجميع الاختبارات باللون الأخضر. مراجعته: "إنجاز استثنائي لإضفاء الطابع الرسمي التلقائي".

رسم بياني متوهج للنظريات ذات الصلة - تصور للتحقق الآلي من الإثبات

سطر واحد في الهامش، ثلاثة قرون ونصف من العمل

حوالي عام 1637، عزا بيير دي فيرما العبارة الواردة في هوامش حساب ديوفانتوس: بالنسبة لـ n أكبر من اثنين، فإن المعادلة aⁿ + bⁿ = cⁿ ليس لها حلول في الأعداد الطبيعية. فيما يلي عبارة أصبحت أسطورة: "لقد وجدت دليلاً رائعًا حقًا، لكن الهوامش ضيقة جدًا بالنسبة له". تحركت أجيال من علماء الرياضيات، من أويلر إلى كومر، نحو النتيجة على مراحل. وفي عام 1908، مُنحت جائزة قدرها 100 ألف علامة ذهبية للإثبات، وفي العام الأول تم استلام 621 حلاً غير صحيح.

في يونيو 1993، قدم أندرو وايلز إثباته في سلسلة محاضرات في كامبريدج. وبعد شهرين، طرح أحد المراجعين سؤالاً كشف عن وجود ثقب في أحد التصاميم. لمدة عام، قام ويلز بتصحيحه - في البداية بمفرده، ثم مع الطالب السابق ريتشارد تايلور - وكان على وشك التخلي عن كل شيء، وفي عام 1995 نشر نصًا مكونًا من 129 صفحة. وبقي السؤال "الهندسي" الأخير: هل من الممكن إجبار الكمبيوتر على تأكيد كل هذا برمته؟

ليس دليلا جديدا، بل فرصة جديدة

وهو يعتمد على تحليل دارمون ودايموند وتايلور لعام 1995 لحجة ويلز-تايلور من خلال نظرية لانجلاندز-تونيل ونزول مستوى ريبيت. تم التعبير عن فكرة إضفاء الطابع الرسمي على ويلز في العقد الأول من القرن الحادي والعشرين من قبل عالم الكمبيوتر الهولندي جان بيرجسترا، ولكن حتى وقت قريب كان هذا يعتبر عملاً لاتجاه علمي كامل. الحالات الفردية - الدرجة الرابعة، العادية البسيطة - تم نقلها إلى Lean سابقاً. مع المستودع الجديد، تم إغلاق قائمة Weidik الكاملة المكونة من 100 مهمة إضفاء الطابع الرسمي: المعيار الذي تمت مقارنة هذا المجال به يبلغ من العمر عشرين عامًا.

بالمناسبة، يكتب Buzzard بصراحة: من الناحية الرياضية، لا يكشف العمل عن أي شيء جديد - لقد كان يؤمن بالفعل بويلز. القيمة تكمن في مكان آخر. تستغرق مراجعة مقال جديد في الرياضيات شهورًا، أو حتى سنوات؛ إذا طُلب من الآلة إضفاء الطابع الرسمي على برهان سريعًا، فسوف تتقلص مراجعة الأقران وستبدأ الافتراضات الخفية على مستوى الخبراء في الظهور. بالنسبة للعلم، حيث يعتمد كل شيء على صدق الاستنتاجات، يعد هذا تحولًا خطيرًا.

كيف بدت تلك الأيام الـ 11 من الداخل

أشرف على هذا العمل تياني بينغ، وهو باحث في الأنثروبولوجيا قام في السابق بتجميع مجموعة من أدوات إضفاء الطابع الرسمي على الذكاء الاصطناعي في جامعة كولومبيا. ووفقا له، فإنه في البداية لم يخطط للوصول إلى النهاية: لقد أراد فقط أن يرى مدى تقدم Claude في مشروع Buzzard. تمت ترقيته إلى النهائيات.

عمل العديد من العملاء بالتوازي: بعضهم أكمل التعريفات الرياضية، والبعض الآخر اقتحم المصطلحات المتوسطة، والبعض الآخر انتقل إلى أعلى شجرة النظرية، وقام آخرون بتجميع الأجزاء مرة أخرى في استنتاج واحد. سارت الأمور بشكل خاطئ في الأيام الأولى - فقد الوكلاء الصورة العامة للمشروع، وظل حوالي سبعة بالمائة من المحاولات المبكرة في الكود النهائي. حدث التحول عندما تم نقل الفريق إلى منصة Prove2Me: والدليل الموجود فيه عبارة عن رسم بياني لعقد النظرية، حيث يمكنك رؤية ما تم إثباته بالفعل، وما الذي ينتظر المتطلبات الأساسية وما يجب اتخاذه بعد ذلك. يتم فصل البيانات عن البراهين، ويتم تسريع التجميع، ولكل نظرية وصف نصي قابل للبحث. يبلغ حجم العمل حوالي ستة مليارات رمز إخراج، وتم تخفيض المطالبات البشرية إلى مستوى عالٍ: "هذا الاتجاه هو الأولوية".

أين تشاهد

تم نشر المستودع على GitHub - إذا كنت ترغب في ذلك، يمكنك إجراء الفحص بنفسك إذا كان لديك جهاز يحتوي على 96 مركزًا وأعصابًا قوية. المصادر الأولية: تحليل من الأنثروبي و مشاركة بوزارد على مدونة مشروع زينا.

وإذا كنت تريد، بعد قصة مكونة من 13 مليون سطر، أن ترى كيف تتعامل النماذج الحديثة مع المهام الأصغر - الخوارزميات والتعليمات البرمجية والحسابات - فقم بإلقاء نظرة على الأقسام "شفرة" و "محادثة" على NeuralSpace: هناك يمكنك تجربة النماذج وربطها بمشاريعك عبر واجهة برمجة التطبيقات.