DeepSeek выложил в open source DSpark — компонент, ускоряющий ответы ИИ почти вдвое

2 мин
DeepSeek выложил в open source DSpark — компонент, ускоряющий ответы ИИ почти вдвое

Организация DeepSeek совместно с Пекинским университетом выпустила DSpark — компонент, который ускоряет выдачу ответов нейросети, не меняя саму модель. На боевых серверах превью-версий DeepSeek-V4-Flash и V4-Pro скорость генерации для каждого пользователя выросла до +85%. Исходник и технический отчет организация опубликовала на GitHub.

Техника относится к классу спекулятивного декодирования и ускоряет ответы без потери качества — итоговый текст остается математически идентичным обычной генерации. Прирост измеряли по сравнению с прежнего рабочего варианта под названием MTP-1.

Под капотом — две идеи. Сама модель спекулятивного декодирования устроена так: легкая модель-черновик забегает вперед и быстро набрасывает сразу несколько токенов (слов или их частей), а большая схема проверяет весь блок за один проход — это дешевле, чем генерировать те же токены по одному. Совпавший отрезок с начала блока принимается целиком, и пользователь получает некоторое количество слов за время одного шага. Загвоздка — в качестве черновика: если набрасывать токены блока разом и независимо друг от друга, они плохо стыкуются, и схема легко склеит начало одной фразы с концом иной. Чем дальше от начала блока, тем больше такого брака и тем больше токенов в итоге отвергается. DeepSeek оставил оперативный параллельный черновик, но внедрил к нему крошечный последовательный компонент, который перед каждым следующим токеном оглядывается на уже выбранные. Склейка перестает разваливаться, а скорость черновика почти не страдает.

Вторая идея — не проверять лишнего. Тест блока не бесплатна: под высокой нагрузкой каждый лишний токен занимает в очереди место, которое могло бы достаться другому пользователю, а токены в хвосте блока все равно чаще отвергаются. Поэтому DSpark заранее оценивает для каждого токена шанс пройти проверку, а отдельный планировщик в реальном времени смотрит на загрузку видеокарт: пока ресурсы свободны, он расширяет проверку с прежних двух токенов до пяти-шести, а под пиковой нагрузкой обрезает блок до самых надежных. Так ускорение не оборачивается перегрузкой серверов в час пик.

Одновременно DeepSeek открыл DeepSpec — цельный набор инструментов для обучения таких моделей-черновиков. Внутри сразу три алгоритма, включая DSpark, а равным образом сопровождение чужих моделей — Qwen3 от Alibaba и Gemma от Google. То есть ускорять этим методом можно не только продукты самой DeepSeek, но и сторонние нейросети.

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.

Читают сейчас

Астрономы обнаружили маленькие красные точки, готовящиеся к слиянию

25 минут назад

Астрономы обнаружили маленькие красные точки, готовящиеся к слиянию

Существует мнение, что в крупных галактиках современной Вселенной находятся сверхмассивные чёрные дыры (СМЧД). Тем не менее точно неизвестно, как именно эти чёрные дыры стали столь массивными, хотя ас

Вышел альфа-релиз Paint.NET 5.2 с экспериментальной поддержкой Wine/Linux

2 часа назад

Вышел альфа-релиз Paint.NET 5.2 с экспериментальной поддержкой Wine/Linux

1 сентября 2026 года состоялся выпуск альфа-версии графического редактора с открытым исходным кодом Paint.NET 5.2 для Windows 10/11 (64-бита) и с экспериментальной поддержкой Wine/Linux (Wine 11.14, U

2 часа назад

Операционная платформа «Альт Образование» бесплатна для школ — акция от «Базальт СПО»

Операционная платформа «Альт Образование» бесплатна для школ — акция от «Базальт СПО» Организация «Базальт СПО» запускает специальное предложение для школ: операционная система «Альт Образование» 11 п

Google добавила агентный аналитика видео в Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite

2 часа назад

Google добавила агентный аналитика видео в Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite

Google запустила агентный анализ видео для Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Теперь модель анализирует видео не как последовательность кадров с фиксированной частотой, а сама решает, какие

Апдейт платформы «Октопус» от ГК «Юзтех»: историческая анализ и расширенная сопровождение инфраструктур

3 часа назад

Апдейт платформы «Октопус» от ГК «Юзтех»: историческая анализ и расширенная сопровождение инфраструктур

В новых версиях «Октопус» мы сфокусировались на трёх направлениях: расширении возможностей управления ИТ-инфраструктурой, повышении производительности и развитии интеграций. Система получила новые сце