18 台の AI モデルが完全自律型リサーチ レースに参加 — 無差別級 Kimi K3 が危うく Claude に捕まりました
Prime Intellect は、異常な実験を行ったばかりです。Fable 5 や GPT-5.6 Sol からオープンウェイト Kimi K3 まで、18 のトップ言語モデルが、人間が決して介入しない自律的な研究実行に放たれました。結末は大音響でした。安価なエージェントのハーネスに接続されたオープンな中国語モデルが、Anthropic の最も高価な旗艦のすぐ近くまで近づいてきました。何が起こったのか、そしてAI の進捗状況を追跡する人にとってそれがなぜ重要なのかを以下に示します。
レース: できるだけ少ないステップでモデルをトレーニングする
このタスクは、Andrej Karpathy の有名な nanoGPT スピードラン プロジェクトから来ています。 1 億 2,400 万のパラメータを持つ小規模なモデルは、可能な限り少ないトレーニング ステップを使用して、検証損失 3.28 に達する必要があります。スターター レシピは 3,290 のステップを経て完成します。人間が管理した最高の値は 2,600 です。
エージェントはコード リポジトリ、短いルールブック、および 1 つの目標を受け取ります。その後は、オプティマイザを微調整し、実験を実行し、ランダム ノイズから実際の改善を判断し、次に何をテストするかを決定します。ハードウェア: 8 つの H200 GPU、すべてがオフライン サンドボックス内にロックされているため、モデルは既成の答えを検索できません。合計 153 回の完全自律走行が行われました。最長は8日間を超えた。
誰がどこで終わったのか
Anthropic の Fable 5 は 2,726 ステップで最も遠くまで到達し、ベースラインのレシピと人間の記録との差の約 82% を埋めました。フラッグシップ Claude オーパス 5 は 2,920 でラインを超えました。
その後、驚きが起こりました。マルチエージェント Prime Agent ハーネスを通過した Moonshot AI の無差別ウェイト Kimi K3 は、2,930 歩で停止しました。トークンあたりのコストが著しく高い旗艦よりも 10 歩遅れています。 GPT-5.6 Solはオープンモデルに次ぐ3,042位で終了した。

最も面白い部分: 誰も新しいものを発明しなかった
真に新規なメソッドを生成する実行は 1 つもありませんでした。賢い正規化、学習率スケジュール、加重平均など、実際に機能するものはすべて、何年も前の論文で説明されていました。すべてのモデルは、ほぼ同じアイデアの袋に収束しました。
違いは実行力でした。より強力なモデルは、1 回の悪いロールの後に仮説を葬り去ることはありません。条件が変化すると、ランダム シードを変更し、測定を繰り返し、古いアイデアを再考します。彼らは実際の進歩をノイズからより注意深く分離します。そして、彼らは独自のツールを構築しました。Kimi K3 は、損失曲線を比較するためのカスタム関数を作成し、ミニ数値ラボを組み立てて、実際のトレーニングに移す前におもちゃのケースでニュートン・シュルツ法を検証しました。
これが「AI AI の改善」スクリプトを凹ませる理由
古典的な再帰的自己改善のストーリーは次のようになります。最も賢い閉じたモデルが自らのアップグレードを開始し、他の全員が塵を食べる間に不可逆的に引き離されます。この実験はそのイメージを少しずつ削り取っていきます。アイデアがすぐになくなった場合、勝者は最も賢いプレイヤーではなく、「提案、テスト、破棄」のループのコストが低く、より速く回転するプレイヤーになります。優れたハーネスによって駆動されるオープン モデルは、1 ドルあたりにより多くの試行を実行します。そして、それは別のベンチマーク ポイントよりも重要であることがわかります。
キャッチ
公平を期すために言うと、これは非常に狭いタスクです。単一のトレーニング スクリプト、1 つの明確な指標、明確な成功基準 - 現実の科学ははるかに複雑に見えます。新しい手法も登場していないため、これは研究者を置き換えるのではなく、依然として研究者のルーチンを自動化することに関するものです。そして、結果はハーネス自体に大きく依存します。エージェント層を使用しない同じ Kimi K3 の動作は著しく悪化します。
よくある質問
エージェントハーネスとは何ですか?
モデルの周りのレイヤー: ツール、コード実行環境、前のステップのメモリ、タスク スケジューラ。モデルは変わりませんが、適切なツールを備えた適切な机を手に入れるのと同じように、作業がより簡単になります。
一般ユーザーはKimi K3を試すことができますか?
はい、ウェイトは開いています。でチャットできます NeuralSpace チャット でエージェント スタイルのワークフローを試してください コード.
それでは、AI はすぐに独自に科学論文を書くことになるでしょうか?
それほど速くはありません。自律型エージェントは、明確な指標と迅速なフィードバックがある場合にうまく機能します。仮説、センス、そして適切な質問は依然として人間の領域です。しかし、モデル周りのインフラストラクチャは現在、他の何よりも速くアップグレードされており、注目する価値があります。