→ כל המאמרים

18 דגמי AI נכנסו למירוץ מחקר אוטונומי לחלוטין - Kimi K3 במשקל פתוח כמעט תפס את קלוד

18 דגמי AI נכנסו למירוץ מחקר אוטונומי לחלוטין - Kimi K3 במשקל פתוח כמעט תפס את קלוד

פריים אינטלקט בדיוק ערך ניסוי יוצא דופן: 18 דגמי שפה מובילים - מ-Fable 5 ו-GPT-5.6 Sol ועד ל-Kimi K3 במשקל פתוח - שוחררו בריצות מחקר אוטונומיות שבהן בני אדם מעולם לא נכנסו פנימה. הסוף קולני: דגם סיני פתוח המחובר לרתמת סוכן זול הגיע במרחק נגיעה מספינת הדגל היקרה ביותר של Anthropic. הנה מה שקרה, ולמה זה חשוב לכל מי שעוקב אחר התקדמות בינה מלאכותית.

המירוץ: להכשיר דוגמנית בכמה שפחות שלבים

המשימה מגיעה מפרויקט ה-nanoGPT speedrun הידוע של Andrej Karpathy. מודל קטן של 124 מיליון פרמטרים צריך להגיע לאובדן אימות של 3.28 - תוך שימוש בכמה שפחות שלבי אימון. מתכון המתחיל מגיע לשם ב-3,290 שלבים. האנשים הכי טובים שהצליחו הם 2,600.

הסוכן מקבל מאגר קודים, ספר חוקים קצר ומטרה אחת. אחרי זה זה לבד: תיקון האופטימיזציה, הפעלת ניסויים, הצגת שיפור אמיתי מרעש אקראי, החלטה מה לבדוק הלאה. חומרה: שמונה H200 GPUs, הכל נעול בתוך ארגז חול לא מקוון כך שהדגם לא יכול לחפש תשובות מוכנות. בסך הכל היו 153 ריצות אוטונומיות לחלוטין; הארוך ביותר נמתח על פני שמונה ימים.

מי סיים איפה

משל 5 של אנתרופיק הגיע הכי רחוק ב-2,726 צעדים, וסגר כ-82% מהפער בין המתכון הבסיסי לרשומה האנושית. ספינת הדגל קלוד אופוס 5 חצתה את הגבול ב-2,920.

ואז הגיעה ההפתעה. Kimi K3 במשקל פתוח מ-Moonshot AI, שרץ דרך ה-Prime Agent Harness מרובה הסוכנים, נעצר ב-2,930 צעדים. עשרה צעדים מאחורי ספינת דגל שעולה משמעותית יותר לכל אסימון. GPT-5.6 Sol סיים ב-3,042 - מאחורי הדגם הפתוח.

Glowing glass modules linked by streams of data inside a dark arena of autonomous experiments

החלק הכי מצחיק: אף אחד לא המציא שום דבר חדש

אף ריצה אחת לא יצרה שיטה חדשנית באמת. כל מה שבאמת עבד - נורמליזציות חכמות, לוחות זמנים של קצב למידה, ממוצע משקל - תואר בעיתונים לפני שנים. כל דגם התכנס בערך לאותו שק של רעיונות.

ההבדל היה ביצוע. מודלים חזקים יותר אינם קוברים השערה לאחר גלגול רע אחד: הם משנים את הזרע האקראי, חוזרים על מדידות, בוחנים מחדש רעיונות ישנים ברגע שהתנאים משתנים. הם מפרידים בזהירות רבה יותר בין התקדמות אמיתית לרעש. והם בונים כלים משלהם: Kimi K3 כתבה פונקציות מותאמות אישית להשוואת עקומות אובדן והרכיבה מעבדה מספרית מינית, ואימתה את שיטת ניוטון-שולץ על מקרי צעצוע לפני שהעבירה אותה לאימון אמיתי.

למה זה פוגע בסקריפט "AI משפר AI".

הסיפור הקלאסי של שיפור עצמי רקורסיבי הולך כך: הדגם הסגור החכם ביותר מתחיל לשדרג את עצמו ומתרחק באופן בלתי הפיך בזמן שכולם אוכלים אבק. הניסוי הזה מקלקל את התמונה הזו. כאשר הרעיונות אוזלים מהר, המנצח הוא לא השחקן החכם ביותר אלא זה שלולאת "הצע - בדיקה - השלכה" שלו עולה פחות ומסתובבת מהר יותר. דגמים פתוחים המונעים על ידי רתמה טובה מריצים יותר ניסיונות לדולר - ומתברר שזה חשוב יותר מעוד נקודת אמת מידה.

המלכוד

למען ההגינות: זו משימה אחת מאוד צרה. תסריט אימון יחיד, מדד אחד ברור, קריטריון הצלחה חד משמעי - המדע האמיתי נראה הרבה יותר מבולגן. גם לא הופיעו שיטות חדשות, כך שעדיין מדובר באוטומציה של שגרת חוקר ולא בהחלפת החוקר. והתוצאות תלויות מאוד ברתמה עצמה: אותו Kimi K3 ללא שכבת הסוכן פועל בצורה גרועה יותר.

שאלות נפוצות

מהי רתמת סוכן?

שכבה סביב המודל: כלים, סביבת ביצוע קוד, זיכרון שלבים קודמים, מתזמן משימות. המודל נשאר זהה, אבל העבודה הופכת קלה יותר - כמו אדם שמקבל שולחן כתיבה מתאים עם כלים מתאימים.

האם משתמשים רגילים יכולים לנסות את Kimi K3?

כן, המשקולות פתוחות. אתה יכול לשוחח איתו בצ'אט NeuralSpaceולנסות זרימות עבודה בסגנון סוכןקוד.

אז האם AI יכתוב מאמרים מדעיים בעצמו בקרוב?

לא כל כך מהר. סוכנים אוטונומיים מסתדרים היטב כאשר יש מדד חד ומשוב מהיר. השערות, טעם ושאילת השאלות הנכונות הן עדיין טריטוריה אנושית. אבל התשתית סביב דגמים משודרגת מהר יותר מכל דבר אחר כרגע - שווה לשים עליה עין.