← Svi članci

Otvoreni 9B model ZDTaichu5.0-9B osvaja 8 od 9 prostornih mjerila bez gubitka općih vještina

Otvoreni 9B model ZDTaichu5.0-9B osvaja 8 od 9 prostornih mjerila bez gubitka općih vještina

Kineski tim izdao je ZDTaichu5.0-9B s otvorenim težinama: 9 milijardi parametara, kontekstni prozor od 128K i tekst, slike i video na ulaznoj strani. Veličina nije priča. Na osam od devet međunarodnih mjerila prostornog rasuđivanja pobjeđuje svaki model ispod 10B, uključujući Qwen3.5-9B i STEP3-VL-10B, a na MindCube-tiny postiže 78,27 naspram 70,87 za Gemini 3 Pro i 63,56 za Grok 4. I to bez uobičajenih kompromisa — OCR, matematika i kod ostaju na razini vodećih u svojoj klasi.

Zašto je razumijevanje prostora sama po sebi glavobolja

Multimodalni modeli već neko vrijeme pristojno opisuju slike: što je na njima, tko gdje stoji, što piše na znaku. Sada zamolite jednog od njih da prerasporedi predmete u sobi i stvari će se raspasti. Gdje je točno drška za šalicu? Na koju će stranu biti ormarić ako se okrenete prema sofi? Je li prostor s desne strane ploče slobodan?

Ovo su različite vrste zadataka. Ne trebate "prepoznati objekt" — trebate izgraditi trodimenzionalnu scenu u svojoj glavi, pomaknuti referentni okvir i shvatiti što bi ruka zapravo mogla učiniti. Roboti se spotiču upravo zbog toga, a ne zbog prepoznavanja.

Postoji i druga zamka: modeli se obično guraju u jednom smjeru. Napunite ih prostornim podacima, matematikom i OCR-om. ZDTaichu5.0-9B postavljen je kao pokušaj sjedenja na obje stolice odjednom.

Što radi u praksi

Demo snimke prikazuju tri svakodnevna zadatka koja su za robota sve samo ne svakodnevica.

Prvi je "pronađi drugu srebrnu kutiju s lijeva na desno" na pretrpanom stolu. Model mora istovremeno sadržavati atribut "srebrni", tip objekta "kutija" i redoslijed "drugi slijeva". Vraća normalizirane koordinate (237, 226) — točno unutar ciljne regije.

Drugi daje tri snimke jedne sobe. Model mora zamisliti kako hoda do zelene zavjese, okreće se prema plavoj sofi, a zatim kaže gdje se nalazi crveni ormarić u odnosu na njega. Odgovor - prednji desni - je točan. To više nije prepoznavanje, to je promjena referentnog okvira.

Treći traži slobodan prostor pored drške krajnje desne šalice. Prvo provjerite gdje je ručka, a zatim provjerite je li prostor pored nje zauzet. Još jedan pogodak.

Glowing glass geometric bodies floating in a dark volume, linked by blue lines into a spatial grid

Zatim dolaze duži scenariji: ruka robota vraća pomoćni nož u ladicu, dvije ruke prenose epruvete u stalak, manipulator podiže obradak s police i postavlja ga na stol. U svakom slučaju model prati ne samo trenutni okvir, već i ono što se promijenilo nakon prethodne akcije.

Brojke

Set za usporedbu su otvoreni modeli Qwen3.5-9B, STEP3-VL-10B i gemma4-8B-E4B, plus zatvoreni Gemini 3 Pro, Grok 4 i GPT-5.2.

Prostorna mjerila: MindCube-tiny 78,27 (Gemini 3 Pro 70,87, Grok 4 63,56, gemma4-8B-E4B 48,85). ViewSpatial 62,50 naspram 48,20 za Qwen3.5-9B. MMSI-klupa 47,20 protiv 38,70. VSI-Klupa 59.69. SparBench 51.82. RoboSpatial 56.00. ERQA 48,00. 3DSRBench 60.96. Jedna referentna vrijednost na kojoj gubi unutar vlastite klase je CV-Bench: 86,82 naspram 87,19 za Qwen3.5-9B. Otuda "osam od devet".

Opći vid: AI2D 91.48 (Gemini 3 Pro 94.10, GPT-5.2 92.20), MathVista Mini 84.50, WeMath 75.90, OCRBench 85.50, MMStar 76.80.

Agent i tekstualni zadaci: TAU2-Bench 87.70, Claw-Eval 71.40, IFEval 93.70, LiveCodeBench v6 73.40, AIME 2025 86.70.

No pogledajte namaz. Na MMLU-Pro model jasno zaostaje (77,20 prema 89,80 za Gemini 3 Pro), a također i na OCRBenchu ​​(85,50 prema 90,40). Ovo nije univerzalni prvak. Radi se o modelu s jakim nagibom prema prostoru i solidnom, ali ne vodećom općom razinom.

Kako se gradi

Dvije polovice: podaci i zaključivanje.

Na temelju podataka, tim opisuje trostupanjski cjevovod. Prvo, prethodna obuka za otvorene parove slika-tekst, web-dokumente, video s više okvira i sintetičke 3D scene, s deduplikacijom i filtriranjem smeća. Zatim nadzirano fino podešavanje uputa, stvarnih pitanja, prostornih primjera i tragova poziva alata. Naposljetku, izbor najinformativnijih uzoraka i učenje s potkrepljenjem gdje se nagrada izračunava automatski: točan odgovor, koordinate na meti, poštivanje formata.

Jedan lijep detalj: za primjere koji uključuju fizičke radnje, cjevovod provjerava da li se slika, pitanje, objektni odnosi i ograničenja akcije slažu. Ako je ladica zatvorena u okviru, model ne smije biti uvježban da kaže "stavi ga unutra".

Druga polovica je adaptivno ponavljajuće zaključivanje. Nakon standardnog prolaza naprijed, model gleda na entropiju distribucije za trenutni token. Niska entropija — token ide ravno van. Visoka entropija — međublok se ponovno pokreće, skrivena stanja se pročišćavaju u latentnom prostoru, a tvrdi token dobiva više računanja. Zaustavljanjem upravljaju dva signala odjednom, KL divergencija između distribucija i reziduala skrivenog stanja, a očitavanje putanje odabire stanje s najmanjim rizikom, vraćajući se prema potrebi.

Ideja nije jedinstvena: sličan princip "povećajte napor na teškim zadacima, smanjite na lakima" nedavno se pojavio u GPT-6 Astri. Međutim, među otvorenim modelima ove veličine, ovo izgleda kao prva implementacija.

Gdje je kvaka

Prvo, svaki broj dolazi s bloga o izdanju tima. Još nema neovisnih vožnji, a mjerila za prostorno razmišljanje su mlada i lako ih je pretjerati.

Drugo, 9B je 9B. Što se tiče znanja i općeg razmišljanja, model iskreno gubi od vodećih brodova, au stvarnoj robotici njegov je posao sloj planiranja na visokoj razini, a ne zamjena za cijeli kontrolni skup.

Treće, demonstracije su odabrani uspjesi. Koliko često od deset ruka zapravo vrati nož u ladicu nije vidljivo iz otpuštanja.

Što učiniti s tim

Težine su otvorene: GitHub repozitorij, kartice modela na Hugging Face i ModelScope i zasebno mjesto s referentnim vrijednostima. Tim kaže da ga možete fino podesiti na vlastitim podacima — snimci tvornice, zapisima eksperimenata, simulacijama.

Ako samo želite vidjeti kako modeli poput ovog odgovaraju na pitanja o slikama, možete to isprobatiNeuralSpace Chat. Za video zadatke postojiVideoodjeljak, a za stvaranje slike —Slike.

Izvor:量子位 (QbitAI)islužbeni blog o izdanju modela.