← Все статьи

Команда Каймина Хе показала: нейросеть, предобученная на кошках, решает задачи ARC почти как LLM

Светящиеся стеклянные панели с цветными клетками, часть клеток подсвечена

Команда Каймина Хе — автора ResNet и Masked Autoencoder, ныне профессора MIT — выпустила статью к ECCV 2026, в которой визуальная модель, предобученная на обычных фотографиях из ImageNet (кошки, собаки, цветы), решает задачи абстрактного теста ARC: 63,4% pass@2 у одиночной модели и 70,2% у ансамбля. В этой модели нет ни текста, ни языка — только «зрение», перенесённое с реальных фотографий на абстрактные цветные сетки. Это первый случай, когда чисто визуальный подход вплотную подошёл к специализированным LLM-системам, и сделал он это с четвертью их параметров.

Что такое ARC и почему он тяжёлый

ARC (Abstraction and Reasoning Corpus) придумал Франсуа Шолле, создатель Keras, в 2019 году. Формат одинаковый: сетка до 30×30 клеток, до 10 цветов, от 2 до 5 пар «вход — выход». По примерам нужно угадать скрытое правило преобразования и применить его к новой сетке. Звучит как детская задачка «найди закономерность», но для машины это один из самых жёстких тестов абстрактного мышления: правило каждый раз новое, шаблон не выучишь, а примеров всего два-три.

Как ARC решают сейчас

Доминируют языковые модели: сетку переводят в текст или символьную последовательность и отдают LLM на рассуждение. Визуальная ветка долго отставала, но именно она дала самое интересное движение. Тот же MIT-коллектив в прошлой работе VARC переопределил ARC как условный перевод «картинка в картинку» и довёл 19-миллионную модель до 54%. Дальше пошли надстройки: LoopViT с циклическим рассуждением — 18 млн параметров и 65,8%, Loop-OWM с видеопредобучением — 10,6 млн и 68,5%. Параметров на порядки меньше, чем у LLM-систем, а результаты уже рядом.

Чего визуальным моделям не хватало — предобучения. Языковые модели растут на масштабе потому, что предварительно обучены на гигантских корпусах текста, а визуальные решения для ARC стартовали с случайной инициализации и этого бонуса не получали.

NAT-ARC: предобучение на кошачьих фото

NAT-ARC вставляет перед визуальным конвейером VARC шаг MAE-предобучения на ImageNet — датасете примерно из 1,3 млн природных фотографий. MAE (Masked Autoencoder) — метод самого Хе, предложенный в 2022 году: модель закрывает большую часть изображения и учится восстанавливать оригинал по оставшимся фрагментам, попутно понимая формы, структуру и пространственные отношения.

Практичная деталь: исследователи взяли готовый публичный чекпоинт MAE и не потратили на предобучение ни цента. Чекпоинт рассчитан на крупные картинки ImageNet, а сетки ARC — всего 64×64 пикселя, поэтому от него оставили только backbone, выбросили patch embedding и позиционные кодировки и поставили вместо них гибкий 2D RoPE.

Светящиеся стеклянные панели с цветными клетками, часть клеток подсвечена

Почему кошки помогают решать абстрактные задачи

Авторы поставили три модели с разной инициализацией — без предобучения, с ImageNet MAE и с ARC-стилем MAE — перед задачами ARC ещё до всякого обучения и посмотрели на распределение внимания. У случайной модели оно размазано равномерно, без фокуса. У модели с ImageNet-предобучением внимание уже само собирается на осмысленных областях: она умеет отделять объект от фона, хотя ни одной сетки ARC не видела.

Исследователи отобрали 15 задач, где предобучение дало заметный прирост, и вручную их разобрали. Шесть оказались задачами типа «найди и скопируй» — распознать объект, цвет или узор и перенести структуру в выход. Ещё шесть — рассуждением о связных областях: выделить, закрасить или перекрасить связный кусок сетки. «Отдели кота от травы» в ARC превращается в «отдели связную цветную область от фона» — визуальный и абстрактный миры делят одну и ту же базовую механику.

Цифры: 0,6 млрд параметров против 8 млрд

На ARC-1 лучшая одиночная модель NAT-ARC в масштабе huge — 0,6 млрд параметров — набрала 63,4±0,7% pass@2. Ансамбль из трёх моделей с разными стратегиями предобучения (голосование большинством, суммарно около 2 млрд параметров) дошёл до 70,2±0,6%. Для сравнения: лучшая специализированная LLM-система The ARChitects показывает 71,6%, но на 8-миллиардной языковой модели. Визуальная ветка подобралась к ней с четвертью параметров.

Предобучение починило scaling

Второй важный результат — про то, как растут модели. Без предобучения кривая ломается: от base к large точность растёт, а от large к huge падает — модель больше, а результата нет, потому что данных в ARC слишком мало и ёмкость уходит в переобучение. С ImageNet-предобучением кривая выравнивается: все три масштаба растут вместе с размером. Именно это и есть разблокированный scaling для визуальной ветки.

Красивое доказательство авторы получили с обратной стороны: автоэнкодер переводит обычное фото из ImageNet в дискретную сетку 60×60 с 10 цветами — по сути «переводит кота на язык ARC». NAT-ARC применяет к этой сетке выученные преобразования — поворот на 180°, синюю рамку — и декодирует обратно в пиксели. Кот действительно повернулся, рамка появилась. Абстрактные правила и зрительные представления живут в одном пространстве.

Кто за этим стоит

Первая авторша — Сяоман Динг из MIT CSAIL, группа Хе; она же вела и прошлую VARC. Дальше Кейя Ху, Кейтлин Ган и Виктор Йин — тоже MIT. Соавтор и контактное лицо — сам Каймин Хе, человек, через ResNet и MAE можно прошить почти десять лет визуального ИИ. Забавно, что в новой работе он использует собственный метод четырёхлетней давности как инструмент: старым оружием пробита новая дорога.

Что это значит на практике

Главный вывод: размер — не всё, решает предобучение. Компактная модель с хорошей предварительной подготовкой догоняет систему в четыре раза больше себя. В практике генерации изображений та же логика: побеждает не самая крупная модель, а та, что лучше обучена под задачу и дешевле. По данным нашего сервиса, за последние 30 дней (по 11 177 попыткам генерации изображений со 2 сентября по 1 октября 2026) наибольшим спросом пользовалась отнюдь не самая тяжёлая модель — на nano-banana-2 пришлось 2560 завершённых генераций, около 23% всех, при средней себестоимости около $0,05 за картинку (таблица generation_costs за тот же период). Надёжность у компактных моделей вполне рабочая: за тот же месяц до результата не дошла примерно каждая тринадцатая попытка — 829 отказов из 11 177.

Оговорка честная: ARC-1 — один бенчмарк, и до универсального визуального рассуждения далеко. Но направление задано ясно: вместо того чтобы бесконечно увеличивать языковые модели, можно учить зрение на реальном мире и переносить его на абстракции.

Частые вопросы

Что такое ARC?

Тест абстрактного рассуждения от создателя Keras Франсуа Шолле: по 2–5 примерам «вход — выход» на цветной сетке нужно угадать скрытое правило и применить его к новой сетке. Считается одним из самых сложных бенчмарков для ИИ.

Почему именно кошки?

Суть не в кошках, а в предобучении на природных изображениях — ImageNet ими как раз полон. Модель, научившаяся отделять объекты от фона на фотографиях, переносит эту способность на абстрактные сетки.

Можно ли попробовать генерацию изображений?

Да, в разделе генерации изображений NeuralSpace — там собраны модели разных классов, от быстрых до максимально качественных.