← Все статьи

DeepSeek ускорили в 6,87 раза на PCIe-картах без замены железа

Серверный зал: ряд тусклых графических ускорителей и ряд ярко светящихся синим, между ними поток светящихся частиц

Китайский оператор вычислительных мощностей 是石科技 (METASTONE) опубликовал результаты своего движка для вывода нейросетей Meta-Infer. На машине из восьми PCIe-видеокарт — то есть без быстрой связи NVLink между ускорителями, на заметно более дешёвом железе — пропускная способность DeepSeek-V4.1-Flash на приёме запросов выросла с 1932 до 13274 токенов в секунду. Это 6,87 раза, и всё — только за счёт программной оптимизации: веса и архитектура модели не менялись. Похожие приёмы дали ускорение в 1,55 раза для DeepSeek-V4-Flash, 1,92 раза для GLM 5.3 и до 5,33 раза для генерации видео в MiniMax H3.

Почему это вообще проблема

Спрос на вычисления для больших моделей растёт, а топовые ускорители стоят дорого и их не хватает. Поэтому многие берут карты попроще: у них часто нет NVLink — скоростного канала между ускорителями — и они не входят в официальный список проверенного железа популярных открытых фреймворков.

Формально это не мешает: модель загружается, сервер поднимается. Но под капотом фреймворк молча уходит на медленный общий путь. Часть операторов откатывается к универсальным, но неэффективным реализациям, параметры обмена между картами берутся от NVLink, а настройки памяти и параллелизма — от другого железа. Карты простаивают в ожидании друг друга. Потенциал железа остаётся запертым в программной несовместимости, а не в самих чипах.

Что делает Meta-Infer

Работа идёт по четырём направлениям.

Заполнение пробелов в ядрах. Для железа вне списка проверенных фреймворк не падает и не пишет об ошибке — он тихо обходит быстрые пути. Команда включает их вручную: открывает быстрый путь обработки длинного входа (sparse-MLA Prefill), меняет медленное ядро матричных умножений на более производительное и расширяет покрытие быстрого канала обмена между картами.

Оптимизация операторов и перестройка обмена. Ключевые операторы объединяют, чтобы сократить время одного шага; вычисления и обмен данными совмещают по времени, чтобы карты не ждали друг друга; логику коллективных обменов переписывают под реальную пропускную способность PCIe, а не под NVLink.

Настройка параллелизма и памяти. Для предзаполнения (Prefill) и генерации (Decode) подбирают разные схемы распараллеливания, динамически меняют размер кэша ключей и значений и долю статической памяти, чтобы не упираться в переполнение и откат на медленные пути.

Переиспользование кэша. Для длинных текстов и видео применяют повторное использование уже посчитанного кэша с оценкой риска: где можно взять готовое, а где кэш надо обновить, не теряя качества ответа.

Серверный зал: ряд тусклых графических ускорителей и ряд ярко светящихся синим, между ними поток светящихся частиц

Цифры

Все замеры сделаны на одном и том же железе, без изменения весов и структуры моделей.

DeepSeek-V4.1-Flash: базовая версия «дня ноль» из сообщества давала 1932 токена в секунду на приёме. После адаптации под железо — 5850. После полной настройки — 13274 токена в секунду, то есть рост в 6,87 раза, с поддержкой контекста до 1 миллиона токенов.

DeepSeek-V4-Flash: с 14546 до 22584 токенов в секунду (1,55 раза).

GLM 5.3: с 3236,78 до 6222,72 токена в секунду (1,92 раза). Задержка первого токена по 95-му процентилю упала с 141,6 до 46,6 секунды, а поддерживаемый контекст вырос с 270 тысяч до 1,05 миллиона токенов.

Видеомодель MiniMax H3: генерация 15-секундного ролика из референсного изображения ускорилась в 2,48 раза при том же пиковом расходе видеопамяти, а на восьмикарточной машине пропускная способность выросла до 5,33 раза для текста-в-видео и 4,98 раза для картинки-в-видео.

Отдельно отмечают эффект от одной лишь смены схемы: когда общие и маршрутизируемые эксперты модели стали подаваться параллельно, в 35 парных тестах это дало прибавку 11,26%.

Насколько это близко к топовому железу

Разрыв с флагманом оказался меньше, чем можно подумать. В пересчёте на целую машину (восемь карт, ролик 5 секунд, 768p, 16:9) такая сборка выдаёт 296 роликов в час против 439 у топового B300 — около 67%. Для картинки-в-видео — 131 против 225 в час, около 58%. Чтобы сравняться по пропускной способности, по оценке авторов, нужно примерно 2,6–2,9 таких машины на одну B300, а с дополнительными приёмами кэширования и облегчённой дообученной надстройки — уже 1,5–1,7 машины.

Иными словами, разница в железе никуда не делась, но значительная часть видимого отставания — это не физика чипов, а неготовность софта.

Где подвох

Первое: все цифры — из материалов самой компании, независимого воспроизведения пока нет. Замеры сделаны на конкретной конфигурации и конкретных версиях фреймворка, и на другом железе результат будет другим.

Второе: PCIe-карты всё равно обмениваются данными медленнее, чем NVLink. Софт может сократить простой, но не может расширить канал. На задачах, где обмен между картами критичен, разрыв останется.

Третье: ускорение считали по пропускной способности на приёме, а не по полной стоимости владения. Экономию от дешёвых карт может частично съедать большее число машин и энергопотребление.

Что это значит для пользователя

Главный вывод простой: стоимость вывода моделей всё больше определяется не только ценой чипов, но и качеством программного стека. Если такие оптимизации распространятся, тот же объём вычислений будет стоить дешевле — а значит, у сервисов появится пространство для снижения цен и для большего числа запросов на том же железе.

Посмотреть, как работают современные модели, можно в чате NeuralSpace. Для генерации картинок есть раздел «Картинки», для видео — «Видео».

Источник: 量子位 (QbitAI).