← 모든 글

18개의 AI 모델이 완전 자율 연구 경쟁에 참가했습니다. 개방형 Kimi K3가 Claude를 거의 따라잡을 뻔했습니다.

18개의 AI 모델이 완전 자율 연구 경쟁에 참가했습니다. 개방형 Kimi K3가 Claude를 거의 따라잡을 뻔했습니다.

Prime Intellect는 방금 특이한 실험을 실행했습니다. Fable 5 및 GPT-5.6 Sol에서 개방형 Kimi K3에 이르기까지 18개의 최고 언어 모델이 인간이 절대 개입하지 않는 자율 연구 실행에 사용되었습니다. 결말은 시끄럽습니다. 값싼 에이전트 하네스에 연결된 개방형 중국 모델이 Anthropic의 가장 비싼 플래그십에 닿을 수 있는 거리에 들어왔습니다. 무슨 일이 일어났는지, 그리고 이것이 AI 진행 상황을 추적하는 모든 사람에게 중요한 이유는 다음과 같습니다.

경주: 가능한 한 적은 단계로 모델 훈련

이 작업은 Andrej Karpathy의 잘 알려진 nanoGPT speedrun 프로젝트에서 비롯되었습니다. 1억 2천 4백만 개의 매개변수를 가진 작은 모델은 가능한 한 적은 훈련 단계를 사용하여 3.28의 검증 손실에 도달해야 합니다. 스타터 레시피는 3,290단계를 거쳐 완성됩니다. 인간이 관리한 최고는 2,600이다.

에이전트는 코드 저장소, 짧은 규칙서 및 하나의 목표를 받습니다. 그 후에는 최적화 프로그램을 조정하고, 실험을 실행하고, 무작위 노이즈로부터 실제 개선 사항을 알려주고, 다음에 테스트할 항목을 결정하는 등의 작업을 자체적으로 수행합니다. 하드웨어: 8개의 H200 GPU, 모든 것이 오프라인 샌드박스 내에 잠겨 있으므로 모델이 준비된 답변을 찾을 수 없습니다. 전체적으로 153개의 완전 자율 실행이 있었습니다. 지난 8일 동안 가장 길었습니다.

누가 어디서 끝냈나

Anthropic's Fable 5는 2,726단계로 가장 멀리 나아갔으며, 기본 레시피와 인간 기록 사이의 격차를 약 82% 줄였습니다. 주력 제품인 Claude Opus 5는 2,920으로 선을 넘었습니다.

그러다가 놀랐습니다. 다중 에이전트 Prime Agent Harness를 통해 실행되는 Moonshot AI의 개방형 Kimi K3는 2,930걸음에서 멈췄습니다. 토큰당 비용이 눈에 띄게 더 높은 주력 제품보다 10단계 뒤쳐져 있습니다. GPT-5.6 Sol은 3,042로 마감되었습니다. — 오픈 모델 뒤에 있습니다.

Glowing glass modules linked by streams of data inside a dark arena of autonomous experiments

가장 재미있는 부분: 누구도 새로운 것을 발명하지 않았습니다.

단 한 번의 실행도 진정으로 새로운 방법을 만들어내지 못했습니다. 영리한 정규화, 학습률 일정, 가중치 평균화 등 실제로 효과가 있었던 모든 것은 몇 년 전 논문에 설명되어 있습니다. 모든 모델은 거의 동일한 아이디어로 수렴되었습니다.

차이점은 실행이었습니다. 더 강력한 모델은 한 번의 잘못된 결과 후에 가설을 묻어두지 않습니다. 즉, 무작위 시드를 변경하고, 측정을 반복하고, 조건이 바뀌면 오래된 아이디어를 다시 검토합니다. 그들은 실제 진행 상황과 소음을 더 조심스럽게 분리합니다. 그리고 그들은 자체 도구를 구축합니다. Kimi K3는 손실 곡선을 비교하기 위한 사용자 정의 기능을 작성하고 미니 수치 실험실을 구성하여 실제 교육으로 이동하기 전에 장난감 케이스에 대한 Newton-Schulz 방법을 검증했습니다.

이것이 "AI 개선 AI" 스크립트를 손상시키는 이유

고전적인 재귀적 자기 개선 이야기는 다음과 같습니다. 가장 똑똑한 폐쇄형 모델은 스스로 업그레이드를 시작하고 다른 사람들이 먼지를 먹는 동안 되돌릴 수 없게 물러납니다. 이 실험은 그 그림을 깎아내립니다. 아이디어가 빨리 소진되면 가장 똑똑한 플레이어가 아니라 "제안 - 테스트 - 폐기"의 루프가 비용이 적게 들고 회전 속도가 더 빠른 사람이 승자가 됩니다. 좋은 하네스로 구동되는 개방형 모델은 달러당 더 많은 시도를 실행하며 이는 다른 벤치마크 포인트보다 더 중요한 것으로 나타났습니다.

캐치

공평하게 말하면 이것은 매우 좁은 작업 중 하나입니다. 단일 훈련 스크립트, 하나의 명확한 지표, 명확한 성공 기준 — 실제 과학은 훨씬 더 복잡해 보입니다. 새로운 방법도 나오지 않았으므로 이는 여전히 연구원을 교체하기보다는 연구원의 일상을 자동화하는 것입니다. 그리고 결과는 하네스 자체에 크게 좌우됩니다. 에이전트 레이어가 없는 동일한 Kimi K3는 눈에 띄게 더 나쁩니다.

FAQ

에이전트 하네스란 무엇입니까?

모델 주변의 레이어: 도구, 코드 실행 환경, 이전 단계 메모리, 작업 스케줄러. 모델은 동일하게 유지되지만 사람이 적절한 도구와 적절한 책상을 얻는 것처럼 작업이 더 쉬워집니다.

일반 사용자가 Kimi K3를 사용해 볼 수 있나요?

예, 가중치는 열려 있습니다. 당신은 그것과 채팅할 수 있습니다NeuralSpace 채팅에이전트 스타일 워크플로를 사용해 보세요.암호.

그러면 AI가 곧 스스로 과학 논문을 작성하게 될까요?

그렇게 빠르지는 않습니다. 자율 에이전트는 명확한 지표와 빠른 피드백이 있는 곳에서 잘 작동합니다. 가설, 취향, 올바른 질문을 하는 것은 여전히 ​​인간의 영역입니다. 그러나 모델 주변의 인프라는 현재 그 어떤 것보다 빠르게 업그레이드되고 있으므로 계속 지켜볼 가치가 있습니다.