DeepSeek ускорили в 6,87 раза на PCIe-картах без замены железа
Китайский оператор вычислительных мощностей 是石科技 (METASTONE) опубликовал результаты своего движка для вывода нейросетей Meta-Infer. На машине из восьми PCIe-видеокарт — то есть без быстрой связи NVLink между ускорителями, на заметно более дешёвом железе — пропускная способность DeepSeek-V4.1-Flash на приёме запросов выросла с 1932 до 13274 токенов в секунду. Это 6,87 раза, и всё — только за счёт программной оптимизации: веса и архитектура модели не менялись. Похожие приёмы дали ускорение в 1,55 раза для DeepSeek-V4-Flash, 1,92 раза для GLM 5.3 и до 5,33 раза для генерации видео в MiniMax H3.
Почему это вообще проблема
Спрос на вычисления для больших моделей растёт, а топовые ускорители стоят дорого и их не хватает. Поэтому многие берут карты попроще: у них часто нет NVLink — скоростного канала между ускорителями — и они не входят в официальный список проверенного железа популярных открытых фреймворков.
Формально это не мешает: модель загружается, сервер поднимается. Но под капотом фреймворк молча уходит на медленный общий путь. Часть операторов откатывается к универсальным, но неэффективным реализациям, параметры обмена между картами берутся от NVLink, а настройки памяти и параллелизма — от другого железа. Карты простаивают в ожидании друг друга. Потенциал железа остаётся запертым в программной несовместимости, а не в самих чипах.
Что делает Meta-Infer
Работа идёт по четырём направлениям.
Заполнение пробелов в ядрах. Для железа вне списка проверенных фреймворк не падает и не пишет об ошибке — он тихо обходит быстрые пути. Команда включает их вручную: открывает быстрый путь обработки длинного входа (sparse-MLA Prefill), меняет медленное ядро матричных умножений на более производительное и расширяет покрытие быстрого канала обмена между картами.
Оптимизация операторов и перестройка обмена. Ключевые операторы объединяют, чтобы сократить время одного шага; вычисления и обмен данными совмещают по времени, чтобы карты не ждали друг друга; логику коллективных обменов переписывают под реальную пропускную способность PCIe, а не под NVLink.
Настройка параллелизма и памяти. Для предзаполнения (Prefill) и генерации (Decode) подбирают разные схемы распараллеливания, динамически меняют размер кэша ключей и значений и долю статической памяти, чтобы не упираться в переполнение и откат на медленные пути.
Переиспользование кэша. Для длинных текстов и видео применяют повторное использование уже посчитанного кэша с оценкой риска: где можно взять готовое, а где кэш надо обновить, не теряя качества ответа.

Цифры
Все замеры сделаны на одном и том же железе, без изменения весов и структуры моделей.
DeepSeek-V4.1-Flash: базовая версия «дня ноль» из сообщества давала 1932 токена в секунду на приёме. После адаптации под железо — 5850. После полной настройки — 13274 токена в секунду, то есть рост в 6,87 раза, с поддержкой контекста до 1 миллиона токенов.
DeepSeek-V4-Flash: с 14546 до 22584 токенов в секунду (1,55 раза).
GLM 5.3: с 3236,78 до 6222,72 токена в секунду (1,92 раза). Задержка первого токена по 95-му процентилю упала с 141,6 до 46,6 секунды, а поддерживаемый контекст вырос с 270 тысяч до 1,05 миллиона токенов.
Видеомодель MiniMax H3: генерация 15-секундного ролика из референсного изображения ускорилась в 2,48 раза при том же пиковом расходе видеопамяти, а на восьмикарточной машине пропускная способность выросла до 5,33 раза для текста-в-видео и 4,98 раза для картинки-в-видео.
Отдельно отмечают эффект от одной лишь смены схемы: когда общие и маршрутизируемые эксперты модели стали подаваться параллельно, в 35 парных тестах это дало прибавку 11,26%.
Насколько это близко к топовому железу
Разрыв с флагманом оказался меньше, чем можно подумать. В пересчёте на целую машину (восемь карт, ролик 5 секунд, 768p, 16:9) такая сборка выдаёт 296 роликов в час против 439 у топового B300 — около 67%. Для картинки-в-видео — 131 против 225 в час, около 58%. Чтобы сравняться по пропускной способности, по оценке авторов, нужно примерно 2,6–2,9 таких машины на одну B300, а с дополнительными приёмами кэширования и облегчённой дообученной надстройки — уже 1,5–1,7 машины.
Иными словами, разница в железе никуда не делась, но значительная часть видимого отставания — это не физика чипов, а неготовность софта.
Где подвох
Первое: все цифры — из материалов самой компании, независимого воспроизведения пока нет. Замеры сделаны на конкретной конфигурации и конкретных версиях фреймворка, и на другом железе результат будет другим.
Второе: PCIe-карты всё равно обмениваются данными медленнее, чем NVLink. Софт может сократить простой, но не может расширить канал. На задачах, где обмен между картами критичен, разрыв останется.
Третье: ускорение считали по пропускной способности на приёме, а не по полной стоимости владения. Экономию от дешёвых карт может частично съедать большее число машин и энергопотребление.
Что это значит для пользователя
Главный вывод простой: стоимость вывода моделей всё больше определяется не только ценой чипов, но и качеством программного стека. Если такие оптимизации распространятся, тот же объём вычислений будет стоить дешевле — а значит, у сервисов появится пространство для снижения цен и для большего числа запросов на том же железе.
Посмотреть, как работают современные модели, можно в чате NeuralSpace. Для генерации картинок есть раздел «Картинки», для видео — «Видео».
Источник: 量子位 (QbitAI).