DeepSeek V4.1-Flash: новая архитектура, 552 млрд параметров и агентные тесты

4 мин
DeepSeek V4.1-Flash: новая архитектура, 552 млрд параметров и агентные тесты

DeepSeek вывела V4.1-Flash — младшую модель новой архитектурной линейки компании. Это MoE-модель на 552 млрд параметров с нативной поддержкой изображений, контекстом до 1 млн токенов и отдельными режимами reasoning.

Наиболее интересная часть релиза — архитектурные изменения. DeepSeek перешла к асимметричной схеме Causal Encoder–Decoder: при prefill активируется около 8 млрд параметров на токен, а при decode — 16 млрд. То есть вычислительный бюджет для обработки входа и генерации намеренно сделали разным.

В модели равным образом используется свежий Engram-модуль на 196 млрд параметров для работы с N-граммами. В сочетании с MoE это позволяет разделить часть знаний и вычислений между параметрами, которые не нужно прогонять через основную сеть на каждом токене.

Отдельно DeepSeek переработала работу с KV-cache. Для длинного контекста это одна из ключевых оптимизаций V4.1-Flash: компания заявляет заметное падение memory footprint по сравнению с предыдущим поколением. В документации схема равным образом использует QAT для KV-cache и FP4-квантизацию, что дополнительно снижает требования к памяти при инференсе.

В агентных тестах — рядом с Opus 5 и GPT-5.6 Sol

На DeepSWE v1.1 итог V4.1-Flash составляет 74,2% — это практически уровень заявленного результата Claude Opus 5 (74%) и выше показателя GPT-5.6 Sol (73%).

В Terminal-Bench 2.1 схема набирает 90,6%, а в Automation-Bench — 54,8%. В таблице DeepSeek оба результата стоят выше показателей конкурирующих моделей, с которыми организация сравнивает Flash.

При этом универсальным лидером V4.1-Flash назвать нельзя. На Terminal-Bench 3.0 и Terminal-Bench 4.0 модель получает только 30,0% и 31,2% соответственно.

Важная оговорка: опубликованные цифры — результаты самой DeepSeek.
Важная оговорка: опубликованные цифры — результаты самой DeepSeek.

Что интересно в архитектуре

V4.1-Flash выглядит продолжением той же линии, которую DeepSeek развивает с предыдущими V4-моделями: снижать стоимость инференса не за счет упрощения модели, а за счет переработки самой вычислительной схемы.

Асимметричный prefill/decode здесь особенно показателен. 8 млрд активных параметров на входе и 16 млрд на выходе — вполне необычная настройка для LLM. Она заточена под сценарии, где входной контекст может быть огромным, а генерация идет короткими последовательными шагами, как в coding agent.

Вторая интересная часть — Engram. Модель сочетает большую MoE-часть с отдельным N-граммным хранилищем параметров. Это еще один вариант вынесения части информации из основной вычислительной цепочки: некоторые закономерности можно получать через lookup-механизм, а не заставлять каждый раз восстанавливать их через глубокий проход сети.

В результате V4.1-Flash — это довольно большая схема по числу параметров, но с гораздо меньшим активным вычислительным графом на определённый токен.

Reasoning, мультимодальность и миллионный контекст

V4.1-Flash получила нативное мультимодальное понимание изображений и контекстное окно до 1 млн токенов.

Для программный интерфейс DeepSeek предлагает три уровня reasoning — low, high и max. Это уже скорее инструмент управления стоимостью агентного запуска, чем просто переключатель качества: одна и та же модель может функционировать с разным бюджетом рассуждения зависимо от сложности задачи.

Миллионный контекст при этом имеет смысл рассматривать вместе с оптимизацией KV-cache. Для агентных нагрузок длинная история — один из основных источников роста memory и latency, следовательно сам размер окна без изменений в attention-механике был бы куда менее интересен.

Цена

В непиковые часы программный интерфейс стоит $0,15 за 1 млн входных токенов без cache hit и $0,60 за 1 млн выходных. Для уже закэшированного входа тариф составляет $0,003 за 1 млн токенов. В пиковые часы цены удваиваются.

То есть DeepSeek одновременно пытается занять две позиции: дать фронтир-модель по отдельным агентным тестам и сделать сам инференс в достаточной степени дешевым для постоянных многошаговых вызовов.

Отдельно компания собирается заменить через V4.1-Flash текущий V4 Pro в api до выхода следующей Pro-версии. Это важнее обычного обновления каталога: Flash становится не просто более дешевой моделью, а практическим рабочим уровнем DeepSeek для части продакшн-нагрузок.

Открытые веса

V4.1-Flash опубликована на Hugging Face с лицензией MIT. Одновременно с релизом DeepSeek выложила техническую документацию и материалы для самостоятельного развёртывания.

Читают сейчас

Claude по одному промпту и за некоторое количество переделок создала печатную плату в KiCad с нуля, ПО для MCU тоже создал текст ИИ

7 часов назад

Claude по одному промпту и за некоторое количество переделок создала печатную плату в KiCad с нуля, ПО для MCU тоже создал текст ИИ

Потребитель Reddit под ником a6m–zero рассказал, что решил с помощью Claude Fable 5 практически за один промпт спроектировать печатную плату с нуля, причём от схемы и ПО до готового устройства. В проц

Глава Anthropic призвал замедлить развитие ИИ

9 часов назад

Глава Anthropic призвал замедлить развитие ИИ

Глава Anthropic Дарио Амодеи опубликовал эссе We Must Pace the Frontier, в котором предложил замедлить увеличение возможностей передовых ИИ-моделей. По его мнению, исследования безопасности перестают

Выпуск OpenRGB 1.0 — открытого проекта для управления RGB-подсветкой периферии

12 часов назад

Выпуск OpenRGB 1.0 — открытого проекта для управления RGB-подсветкой периферии

12 сентября 2026 года состоялся первый мажорный выпуск открытой утилиты OpenRGB. Проект даёт возможность управлять RGB-подсветкой материнских плат, видеокарт, клавиатур, кулеров, светодиодных лент и д

Что нового в PHPUnit 13.3

14 часов назад

Что нового в PHPUnit 13.3

PHPUnit на данный момент является де-факто стандартом для написания тестов в экосистеме PHP. Он относится к семейству фреймворков xUnit (как JUnit или NUnit) и предоставляет инструменты для написания

Пополнение в семействах Zen 4 и Zen 3: новые процессоры Ryzen 5 7500 и Ryzen 5 5500F

15 часов назад

Пополнение в семействах Zen 4 и Zen 3: новые процессоры Ryzen 5 7500 и Ryzen 5 5500F

AMD без громких анонсов обновила официальный каталог продукции, добавив в него два новых 6-ядерных решения начального уровня: Ryzen™ 5 7500 на базе архитектуры Zen™ 4 и Ryzen™ 5 5500F на базе архитект