← Все статьи

18 model AI menyertai perlumbaan penyelidikan autonomi sepenuhnya — Kimi K3 kelas terbuka hampir menangkap Claude

18 model AI menyertai perlumbaan penyelidikan autonomi sepenuhnya — Kimi K3 kelas terbuka hampir menangkap Claude

Prime Intellect baru sahaja menjalankan eksperimen yang luar biasa: 18 model bahasa teratas — daripada Fable 5 dan GPT-5.6 Sol hingga Kimi K3 berwajaran terbuka — telah dilepaskan pada larian penyelidikan autonomi di mana manusia tidak pernah melangkah masuk. Pengakhirannya adalah kuat: model Cina terbuka yang disambungkan ke abah-abah ejen murah datang dalam jarak yang sangat dekat dengan kereta perdana paling mahal Anthropic. Inilah yang berlaku, dan mengapa ia penting bagi sesiapa yang menjejaki kemajuan AI.

Perlumbaan: latih model dalam beberapa langkah yang mungkin

Tugas itu datang daripada projek speedrun nanoGPT terkenal Andrej Karpathy. Model kecil 124 juta parameter perlu mencapai kehilangan pengesahan sebanyak 3.28 — menggunakan sesedikit mungkin langkah latihan. Resipi permulaan sampai ke sana dalam 3,290 langkah. Manusia terbaik telah berjaya adalah 2,600.

Ejen menerima repositori kod, buku peraturan pendek dan satu matlamat. Selepas itu ia sendiri: mengubah suai pengoptimum, menjalankan eksperimen, memberitahu peningkatan sebenar daripada hingar rawak, memutuskan perkara yang akan diuji seterusnya. Perkakasan: lapan GPU H200, semuanya terkunci di dalam kotak pasir luar talian supaya model tidak dapat mencari jawapan sedia. Secara keseluruhan terdapat 153 larian autonomi sepenuhnya; yang paling lama menjangkau lapan hari lepas.

Siapa yang selesai di mana

Fable 5 Anthropic pergi paling jauh pada 2,726 langkah, menutup kira-kira 82% daripada jurang antara resipi garis dasar dan rekod manusia. Kapal perdana Claude Opus 5 melepasi garisan pada 2,920.

Kemudian datang kejutan. Kimi K3 berwajaran terbuka dari Moonshot AI, berjalan melalui Prime Agent Harness berbilang ejen, berhenti pada 2,930 anak tangga. Sepuluh langkah di belakang perdana yang berharga lebih tinggi bagi setiap token. GPT-5.6 Sol selesai pada 3,042 — di belakang model terbuka.

Glowing glass modules linked by streams of data inside a dark arena of autonomous experiments

Bahagian paling lucu: tiada siapa yang mencipta sesuatu yang baru

Tiada satu larian pun menghasilkan kaedah yang benar-benar baru. Semua yang benar-benar berkesan — normalisasi pintar, jadual kadar pembelajaran, purata berat — telah diterangkan dalam kertas tahun lalu. Setiap model berkumpul pada kira-kira beg idea yang sama.

Perbezaannya adalah pelaksanaan. Model yang lebih kukuh tidak menguburkan hipotesis selepas satu gulungan yang buruk: mereka menukar benih rawak, mengulang pengukuran, meninjau semula idea lama apabila keadaan berubah. Mereka memisahkan kemajuan sebenar daripada bunyi dengan lebih berhati-hati. Dan mereka membina alatan mereka sendiri: Kimi K3 menulis fungsi tersuai untuk membandingkan lengkung kerugian dan memasang makmal berangka mini, mengesahkan kaedah Newton–Schulz pada bekas mainan sebelum memindahkannya ke dalam latihan sebenar.

Mengapa ini menjejaskan skrip "AI meningkatkan AI".

Kisah pembaikan diri rekursif klasik adalah seperti ini: model tertutup paling bijak mula menaik taraf dirinya sendiri dan menarik diri secara tidak dapat dipulihkan sementara orang lain makan habuk. Percubaan ini menyerlahkan gambar itu. Apabila idea cepat habis, pemenang bukanlah pemain yang paling bijak tetapi pemain yang kos "cadang — ujian — buang" lebih murah dan berputar lebih cepat. Model terbuka yang didorong oleh abah-abah yang baik menjalankan lebih banyak percubaan setiap dolar — dan itu ternyata lebih penting daripada titik penanda aras yang lain.

Hasil tangkapan

Untuk bersikap adil: ini adalah satu tugas yang sangat sempit. Skrip latihan tunggal, satu metrik yang jelas, kriteria kejayaan yang tidak jelas - sains sebenar kelihatan jauh lebih kucar-kacir. Tiada kaedah baharu juga muncul, jadi ini masih mengenai mengautomasikan rutin penyelidik dan bukannya menggantikan penyelidik. Dan keputusan sangat bergantung pada abah-abah itu sendiri: Kimi K3 yang sama tanpa lapisan ejen berjalan dengan ketara lebih teruk.

Soalan Lazim

Apakah abah ejen?

Lapisan di sekeliling model: alatan, persekitaran pelaksanaan kod, ingatan langkah sebelumnya, penjadual tugas. Modelnya tetap sama, tetapi bekerja menjadi lebih mudah — seperti seseorang mendapat meja yang sesuai dengan alatan yang betul.

Bolehkah pengguna biasa mencuba Kimi K3?

Ya, pemberat terbuka. Anda boleh bersembang dengannya dalamSembang NeuralSpacedan cuba aliran kerja gaya ejenKod.

Jadi adakah AI akan menulis kertas saintifik sendiri tidak lama lagi?

Tidak begitu pantas. Ejen autonomi berfungsi dengan baik apabila terdapat metrik yang jelas dan maklum balas yang cepat. Hipotesis, rasa dan bertanya soalan yang betul masih menjadi wilayah manusia. Tetapi infrastruktur di sekeliling model sedang dinaik taraf lebih pantas daripada apa-apa lagi sekarang - patut diawasi.