Открытая 9B-модель ZDTaichu5.0-9B взяла 8 из 9 пространственных тестов и не растеряла общие навыки
Китайская команда ZDTaichu выложила в открытый доступ мультимодальную модель ZDTaichu5.0-9B: 9 миллиардов параметров, контекст до 128 тысяч токенов, на входе текст, картинки и видео. Главное не в размере. В восьми из девяти международных тестов на пространственное понимание она обошла все модели до 10B — включая Qwen3.5-9B и STEP3-VL-10B, — а на MindCube-tiny набрала 78,27 против 70,87 у Gemini 3 Pro и 63,56 у Grok 4. И без привычного компромисса: распознавание текста, математика и код остались на уровне лидеров своего класса.
Почему «понимать пространство» — отдельная головная боль
Мультимодальные модели давно сносно описывают картинку: что на ней, кто где стоит, что написано на вывеске. Но попроси такую модель переставить предметы в комнате — и начинается. Где именно ручка чашки? С какой стороны окажется шкаф, если повернуться к дивану? Свободно ли место справа от тарелки?
Это задачи другого типа. Тут нужно не «узнать объект», а построить в голове трёхмерную сцену, пересчитать систему координат и понять, что вообще можно сделать руками. Роботы спотыкаются именно на этом, а не на распознавании.
Есть и вторая ловушка: обычно модель прокачивают в одну сторону. Накачали пространственными данными — просела математика и распознавание текста. ZDTaichu5.0-9B заявляется как попытка усидеть на двух стульях сразу.
Что она умеет на практике
В демонстрациях команда показывает три бытовые задачи, которые для робота совсем не бытовые.
Первая — «найди второй серебряный бокс слева направо» на заваленном столе. Модель должна одновременно удержать признак «серебряный», тип объекта «бокс» и порядок «второй слева». Она выдаёт нормализованные координаты (237, 226) — точно внутри нужной области.
Вторая — три снимка одной комнаты. Нужно мысленно переместиться к зелёной шторе, повернуться к синему дивану и сказать, где относительно тебя окажется красный шкаф. Ответ «справа впереди» — верный. Это уже не распознавание, а смена системы отсчёта.
Третья — найти свободное место рядом с ручкой самого правого стакана. Сначала надо понять, где ручка, потом проверить, не занято ли место рядом. Тоже попадание.

Дальше сценарии подлиннее: роборука убирает канцелярский нож в ящик, две руки передают пробирки в штатив, манипулятор снимает заготовку с полки и кладёт на стол. В каждом случае модель держит в голове не только текущий кадр, но и то, что изменилось после предыдущего действия.
Цифры
Сравнивают её с открытыми Qwen3.5-9B, STEP3-VL-10B и gemma4-8B-E4B, а также с закрытыми Gemini 3 Pro, Grok 4 и GPT-5.2.
Пространственные тесты: MindCube-tiny — 78,27 (у Gemini 3 Pro 70,87, у Grok 4 63,56, у gemma4-8B-E4B 48,85). ViewSpatial — 62,50 против 48,20 у Qwen3.5-9B. MMSI-Bench — 47,20 против 38,70. VSI-Bench — 59,69. SparBench — 51,82. RoboSpatial — 56,00. ERQA — 48,00. 3DSRBench — 60,96. Единственный тест, где модель уступила в своём классе, — CV-Bench: 86,82 против 87,19 у Qwen3.5-9B. Отсюда и «восемь из девяти».
Общие способности: AI2D — 91,48 (у Gemini 3 Pro 94,10, у GPT-5.2 92,20), MathVista Mini — 84,50, WeMath — 75,90, OCRBench — 85,50, MMStar — 76,80.
Агентские и текстовые: TAU2-Bench — 87,70, Claw-Eval — 71,40, IFEval — 93,70, LiveCodeBench v6 — 73,40, AIME 2025 — 86,70.
Но посмотрите на разброс. По MMLU-Pro модель заметно позади (77,20 против 89,80 у Gemini 3 Pro), по OCRBench тоже (85,50 против 90,40). Это не универсальный чемпион, а модель с сильным уклоном в пространство и приличным, но не лучшим общим уровнем.
Как это сделано
Две части: данные и инференс.
По данным команда описывает конвейер из трёх ступеней. Сначала предобучение на открытых парах «картинка — текст», веб-документах, многокадровых видео и синтетических 3D-сценах, с дедупликацией и отсевом мусора. Потом дообучение на инструкциях, реальных вопросах, пространственных примерах и траекториях вызова инструментов. В конце — отбор самых информативных примеров и обучение с подкреплением, где награда считается автоматически: верный ответ, попадание в координаты, соблюдение формата.
Любопытная деталь: для примеров с действиями в физическом мире конвейер проверяет согласованность картинки, вопроса, отношений объектов и ограничений на действие. Если на кадре ящик закрыт, модель не должна учиться команде «положи внутрь».
Вторая часть — адаптивное рекуррентное рассуждение. После обычного прямого прохода модель смотрит на энтропию распределения для текущего токена. Низкая — токен выдаётся сразу. Высокая — включается повторный прогон через промежуточный блок: скрытые состояния уточняются в латентном пространстве, и на трудный токен уходит больше вычислений. Останавливается процесс по двум сигналам сразу — расхождению KL между распределениями и остатку скрытого состояния, а из накопленной траектории выбирается вариант с наименьшим риском, с откатом назад при необходимости.
Идея не уникальна: похожий принцип «подними усилие на сложной задаче, опусти на простой» недавно появился и в GPT-6 Astra. Но среди открытых моделей такого размера это, похоже, первая реализация.
Где подвох
Во-первых, все цифры — из собственного релизного блога команды. Независимых прогонов пока нет, а бенчмарки на пространственное мышление молодые и легко переобучаются.
Во-вторых, 9B — это 9B. По знаниям и общему рассуждению модель честно проигрывает флагманам, и в реальной робототехнике её место — верхний уровень планирования, а не замена всей системы управления.
В-третьих, демонстрации — это отобранные удачные примеры. Сколько раз из десяти роборука правильно убирает нож в ящик, из релиза не видно.
Что с этим делать
Веса открыты: репозиторий на GitHub, карточки на Hugging Face и ModelScope, отдельный сайт с бенчмарками. Команда обещает, что на этой базе можно дообучать модель на своих данных — записях цеха, протоколах экспериментов, симуляциях.
Если просто хочется посмотреть, как такие модели отвечают на вопросы по картинкам, это можно сделать в чате NeuralSpace. Для задач с видео есть раздел «Видео», для генерации картинок — «Картинки».
Источник: 量子位 (QbitAI) и официальный релизный блог модели.