18 μοντέλα τεχνητής νοημοσύνης μπήκαν σε έναν πλήρως αυτόνομο ερευνητικό αγώνα — το ανοιχτό βάρος Kimi K3 παραλίγο να πιάσει τον Claude
Η Prime Intellect μόλις έκανε ένα ασυνήθιστο πείραμα: 18 μοντέλα κορυφαίων γλωσσών — από Fable 5 και GPT-5.6 Sol έως ανοιχτού βάρους Kimi K3 — κυκλοφόρησαν σε αυτόνομες ερευνητικές διαδρομές όπου δεν μπήκαν ποτέ άνθρωποι. Το τέλος είναι δυνατό: ένα ανοιχτό κινεζικό μοντέλο συνδεδεμένο σε φθηνό λουρί πρακτόρων έφτασε σε κοντινή απόσταση από την πιο ακριβή σημαία του Anthropic. Εδώ είναι τι συνέβη και γιατί έχει σημασία για όποιον παρακολουθεί την πρόοδο της τεχνητής νοημοσύνης.
Ο αγώνας: εκπαιδεύστε ένα μοντέλο σε όσο το δυνατόν λιγότερα βήματα
Η εργασία προέρχεται από το γνωστό project speedrun nanoGPT του Andrej Karpathy. Ένα μικρό μοντέλο 124 εκατομμυρίων παραμέτρων πρέπει να φτάσει σε απώλεια επικύρωσης 3,28 — χρησιμοποιώντας όσο το δυνατόν λιγότερα βήματα εκπαίδευσης. Η συνταγή εκκίνησης φτάνει εκεί σε 3.290 βήματα. Οι καλύτεροι άνθρωποι που έχουν καταφέρει είναι 2.600.
Ο πράκτορας λαμβάνει ένα αποθετήριο κωδικών, ένα σύντομο βιβλίο κανόνων και έναν στόχο. Μετά από αυτό είναι από μόνο του: προσαρμογή του βελτιστοποιητή, εκτέλεση πειραμάτων, ένδειξη πραγματικής βελτίωσης από τυχαίο θόρυβο, απόφαση για το τι θα δοκιμάσετε στη συνέχεια. Υλικό: οκτώ μονάδες GPU H200, όλα κλειδωμένα μέσα σε ένα sandbox εκτός σύνδεσης, ώστε το μοντέλο να μην μπορεί να αναζητήσει έτοιμες απαντήσεις. Συνολικά υπήρξαν 153 πλήρως αυτόνομες διαδρομές. η μεγαλύτερη διάρκεια των τελευταίων οκτώ ημερών.
Ποιος τελείωσε που
Το Fable 5 της Anthropic πήγε πιο μακριά στα 2.726 βήματα, κλείνοντας περίπου το 82% του χάσματος μεταξύ της βασικής συνταγής και του ανθρώπινου αρχείου. Η ναυαρχίδα Claude Opus 5 ξεπέρασε τα όρια στα 2.920.
Μετά ήρθε η έκπληξη. Το ανοιχτό βάρος Kimi K3 από το Moonshot AI, που διασχίζει το πολυπρακτορικό Prime Agent Harness, σταμάτησε στα 2.930 βήματα. Δέκα βήματα πίσω από μια ναυαρχίδα που κοστίζει αισθητά περισσότερο ανά κουπόνι. Το GPT-5.6 Sol τερμάτισε στα 3.042 — πίσω από το ανοιχτό μοντέλο.

Το πιο αστείο μέρος: κανείς δεν επινόησε κάτι νέο
Ούτε μια σειρά δεν παρήγαγε μια πραγματικά πρωτότυπη μέθοδο. Όλα όσα πραγματικά λειτούργησαν - έξυπνες κανονικοποιήσεις, χρονοδιαγράμματα ρυθμού μάθησης, μέσος όρος βάρους - περιγράφηκαν σε έγγραφα πριν από χρόνια. Κάθε μοντέλο συνέκλινε στην ίδια περίπου τσάντα ιδεών.
Η διαφορά ήταν η εκτέλεση. Τα ισχυρότερα μοντέλα δεν θάβουν μια υπόθεση μετά από μια κακή ζαριά: αλλάζουν τον τυχαίο σπόρο, επαναλαμβάνουν τις μετρήσεις, επισκέπτονται ξανά παλιές ιδέες μόλις αλλάξουν οι συνθήκες. Διαχωρίζουν την πραγματική πρόοδο από τον θόρυβο πιο προσεκτικά. Και κατασκεύασαν τα δικά τους εργαλεία: η Kimi K3 έγραψε προσαρμοσμένες λειτουργίες για τη σύγκριση καμπυλών απώλειας και συγκέντρωσε ένα μίνι αριθμητικό εργαστήριο, επικυρώνοντας τη μέθοδο Newton–Schulz σε θήκες παιχνιδιών πριν τη μεταφέρει σε πραγματική εκπαίδευση.
Γιατί αυτό μειώνει το σενάριο "AI βελτίωση της τεχνητής νοημοσύνης".
Η κλασική αναδρομική ιστορία αυτοβελτίωσης έχει ως εξής: το πιο έξυπνο κλειστό μοντέλο αρχίζει να αναβαθμίζεται και απομακρύνεται αμετάκλητα ενώ όλοι οι άλλοι τρώνε σκόνη. Αυτό το πείραμα εξαφανίζει αυτή την εικόνα. Όταν οι ιδέες εξαντλούνται γρήγορα, ο νικητής δεν είναι ο πιο έξυπνος παίκτης, αλλά αυτός του οποίου ο κύκλος "πρόταση - δοκιμή - απόρριψη" κοστίζει λιγότερο και περιστρέφεται πιο γρήγορα. Ανοιχτά μοντέλα που οδηγούνται από μια καλή ζώνη πραγματοποιούν περισσότερες προσπάθειες ανά δολάριο — και αυτό αποδεικνύεται ότι έχει μεγαλύτερη σημασία από ένα άλλο σημείο αναφοράς.
Το πιάσιμο
Για να είμαστε δίκαιοι: αυτό είναι ένα πολύ στενό έργο. Ένα ενιαίο σενάριο εκπαίδευσης, μια σαφής μέτρηση, ένα ξεκάθαρο κριτήριο επιτυχίας — η πραγματική επιστήμη φαίνεται πολύ πιο ακατάστατη. Δεν προέκυψαν επίσης νέες μέθοδοι, επομένως αυτό εξακολουθεί να αφορά την αυτοματοποίηση της ρουτίνας ενός ερευνητή αντί για την αντικατάσταση του ερευνητή. Και τα αποτελέσματα εξαρτώνται σε μεγάλο βαθμό από την ίδια την πλεξούδα: το ίδιο Kimi K3 χωρίς το στρώμα παράγοντα λειτουργεί αισθητά χειρότερα.
FAQ
Τι είναι η ζώνη πράκτορα;
Ένα επίπεδο γύρω από το μοντέλο: εργαλεία, περιβάλλον εκτέλεσης κώδικα, μνήμη προηγούμενων βημάτων, προγραμματιστής εργασιών. Το μοντέλο παραμένει το ίδιο, αλλά η εργασία γίνεται πιο εύκολη — όπως ένα άτομο που παίρνει ένα κατάλληλο γραφείο με τα κατάλληλα εργαλεία.
Μπορούν οι τακτικοί χρήστες να δοκιμάσουν το Kimi K3;
Ναι, τα βάρη είναι ανοιχτά. Μπορείτε να συνομιλήσετε μαζί τουNeuralSpace Chatκαι δοκιμάστε ροές εργασίας τύπου πράκτοραΚώδικας.
Άρα η τεχνητή νοημοσύνη θα γράψει σύντομα επιστημονικές εργασίες μόνη της;
Όχι τόσο γρήγορα. Οι αυτόνομοι πράκτορες τα καταφέρνουν καλά όπου υπάρχει σαφής μέτρηση και γρήγορη ανατροφοδότηση. Οι υποθέσεις, το γούστο και οι σωστές ερωτήσεις εξακολουθούν να είναι ανθρώπινο έδαφος. Αλλά η υποδομή γύρω από τα μοντέλα αναβαθμίζεται γρηγορότερα από οτιδήποτε άλλο αυτή τη στιγμή — αξίζει να παρακολουθείτε.