18 model AI mengikuti perlombaan penelitian yang sepenuhnya otonom — Kimi K3 berbobot terbuka hampir menangkap Claude
Prime Intellect baru saja menjalankan eksperimen yang tidak biasa: 18 model bahasa teratas — mulai dari Fable 5 dan GPT-5.6 Sol hingga Kimi K3 berbobot terbuka — dilepaskan dalam penelitian otonom yang tidak pernah diintervensi oleh manusia. Akhir cerita sangat mengejutkan: sebuah model Tiongkok terbuka yang dihubungkan ke agen murah berada dalam jarak yang sangat dekat dengan kapal andalan Anthropic yang paling mahal. Inilah yang terjadi, dan mengapa penting bagi siapa pun yang melacak kemajuan AI.
Perlombaan: latih model dalam langkah sesedikit mungkin
Tugas ini berasal dari proyek speedrun nanoGPT Andrej Karpathy yang terkenal. Model kecil dengan 124 juta parameter harus mencapai kerugian validasi sebesar 3,28 — menggunakan langkah pelatihan sesedikit mungkin. Resep starter sampai di sana dalam 3.290 langkah. Manusia terbaik yang pernah mengelolanya adalah 2.600.
Agen menerima repositori kode, buku peraturan singkat, dan satu tujuan. Setelah itu, semuanya berjalan sendiri: menyesuaikan pengoptimal, menjalankan eksperimen, memberi tahu peningkatan nyata dari gangguan acak, memutuskan apa yang akan diuji selanjutnya. Perangkat keras: delapan GPU H200, semuanya terkunci di dalam kotak pasir offline sehingga model tidak dapat mencari jawaban yang sudah siap. Total ada 153 jalur yang sepenuhnya otonom; yang terpanjang berlangsung selama delapan hari.
Siapa yang selesai dimana
Fable 5 dari Anthropic mencapai yang terjauh dengan 2.726 langkah, menutup sekitar 82% kesenjangan antara resep dasar dan catatan manusia. Unggulan Claude Opus 5 melewati batas pada 2.920.
Lalu datanglah kejutannya. Kimi K3 kelas terbuka dari Moonshot AI, yang dijalankan melalui multi-agen Prime Agent Harness, berhenti di 2.930 langkah. Sepuluh langkah di belakang kapal andalan yang harganya jauh lebih mahal per tokennya. GPT-5.6 Sol selesai pada 3.042 — di belakang model terbuka.

Bagian paling lucu: tidak ada yang menemukan sesuatu yang baru
Tidak ada satu pun proses yang menghasilkan metode yang benar-benar baru. Segala sesuatu yang benar-benar berhasil – normalisasi cerdas, jadwal kecepatan pembelajaran, rata-rata bobot – dijelaskan di makalah bertahun-tahun yang lalu. Setiap model berkumpul pada gagasan yang kira-kira sama.
Perbedaannya adalah eksekusi. Model yang lebih kuat tidak mengubur hipotesis setelah satu kegagalan: mereka mengubah benih acak, mengulangi pengukuran, meninjau kembali ide-ide lama ketika kondisi berubah. Mereka memisahkan kemajuan nyata dari kebisingan dengan lebih hati-hati. Dan mereka membuat alatnya sendiri: Kimi K3 menulis fungsi khusus untuk membandingkan kurva kerugian dan merakit laboratorium numerik mini, memvalidasi metode Newton–Schulz pada kotak mainan sebelum memindahkannya ke pelatihan nyata.
Mengapa hal ini merusak skrip "AI meningkatkan AI".
Kisah klasik pengembangan diri rekursif berjalan seperti ini: model tertutup yang paling cerdas mulai meningkatkan dirinya sendiri dan menjauh secara permanen sementara orang lain memakan debu. Eksperimen ini menghilangkan gambaran itu. Ketika ide cepat habis, pemenangnya bukanlah pemain terpintar, melainkan pemain yang siklus "usulkan - uji - buang" lebih murah dan berputar lebih cepat. Model terbuka yang digerakkan oleh tali pengaman yang baik menghasilkan lebih banyak upaya per dolar — dan hal ini ternyata lebih penting daripada titik tolok ukur lainnya.
Hasil tangkapannya
Agar adil: ini adalah tugas yang sangat sempit. Satu naskah pelatihan, satu metrik yang jelas, dan kriteria keberhasilan yang jelas — sains nyata terlihat jauh lebih berantakan. Tidak ada metode baru yang muncul, jadi ini masih tentang mengotomatisasi rutinitas peneliti dibandingkan mengganti peneliti. Dan hasilnya sangat bergantung pada harness itu sendiri: Kimi K3 yang sama tanpa lapisan agen bekerja jauh lebih buruk.
Pertanyaan Umum
Apa itu agen harness?
Lapisan di sekitar model: alat, lingkungan eksekusi kode, memori langkah sebelumnya, penjadwal tugas. Modelnya tetap sama, namun bekerja menjadi lebih mudah — seperti seseorang mendapatkan meja yang tepat dengan peralatan yang tepat.
Bisakah pengguna biasa mencoba Kimi K3?
Ya, bebannya terbuka. Anda dapat mengobrol dengannya diObrolan NeuralSpacedan coba alur kerja bergaya agenKode.
Jadi apakah AI akan segera menulis makalah ilmiahnya sendiri?
Tidak secepat itu. Agen otonom bekerja dengan baik jika terdapat metrik yang jelas dan umpan balik yang cepat. Hipotesis, rasa, dan mengajukan pertanyaan yang tepat masih merupakan wilayah manusia. Namun infrastruktur di sekitar model ditingkatkan lebih cepat dari apa pun saat ini — patut untuk diperhatikan.