DeepSeek выпустила обновление V4-Flash-0731: заметный прогресс в агентных и программных задачах
Компания DeepSeek выпустила обновлённый чекпоинт DeepSeek-V4-Flash-0731. Модель поставляется с подключённым модулем спекулятивного декодирования DSpark, что соответствует структуре DeepSeek-V4-Flash-DSpark. По данным Hugging Face, репозиторий насчитывает 304 миллиарда параметров — в эту цифру входит и сам черновой модуль, добавленный поверх базовой модели на 284 миллиарда параметров.
На стороне API модель deepseek-v4-flash теперь нативно поддерживает формат Responses API и адаптирована для работы с Codex. При этом API V4-Pro, а также модели для приложений и веб-версий в рамках этого обновления не менялись.
Через API модель доступна практически любому разработчику: на странице цен DeepSeek указано $0,14 за 1 миллион входных токенов при промахе кэша, $0,0028 при попадании в кэш и $0,28 за 1 миллион выходных токенов, с лимитом 2500 одновременных запросов. Это примерно втрое дешевле вывода deepseek-v4-pro, который стоит $0,87 за миллион выходных токенов. При такой цене стартапы на посевной стадии, независимые разработчики и внутренние платформенные команды могут запускать полноценные агентные циклы без отдельного бюджета на GPU.
Для самостоятельного размещения порог входа заметно выше: веса распространяются по лицензии MIT без ограничений, однако все эксперты остаются постоянно загруженными в память, даже несмотря на то, что на каждый токен активируется лишь 13 миллиардов параметров. Пример от DeepSeek на vLLM обслуживает модель на одном узле 4×GB300. Динамические GGUF-сборки от Unsloth дают без потерь 8-битную версию размером 162 ГБ и 3-битную — 103 ГБ; для работы потребуется примерно 110 ГБ суммарно RAM и VRAM. Таким образом, самостоятельный запуск подходит средним и крупным предприятиям с собственным кластером обслуживания либо одной мощной рабочей станции при агрессивном квантовании.
Согласно техническому отчёту DeepSeek-V4, V4-Flash — это модель типа MoE (смесь экспертов) на 284 миллиарда параметров с 13 миллиардами активных параметров на токен и контекстным окном в 1 миллион токенов. Каждый MoE-слой содержит один общий эксперт и 256 маршрутизируемых экспертов с промежуточной размерностью 2048; на каждый токен срабатывают 6 маршрутизируемых экспертов. Первые три MoE-слоя используют хеш-маршрутизацию. Глубина многотокенного предсказания равна 1.
Внимание в модели гибридное: сочетаются Compressed Sparse Attention (CSA) и Heavily Compressed Attention (HCA). Вместо традиционных остаточных связей применяются Manifold-Constrained Hyper-Connections (mHC) с коэффициентом расширения 4 и 20 итерациями алгоритма Синкхорна–Кноппа. Предобучение проводилось на более чем 32 триллионах токенов с использованием оптимизатора Muon. Ключевой показатель эффективности из статьи — 27% вычислительных затрат на инференс одного токена и 10% KV-кэша по сравнению с DeepSeek-V3.2 при контексте в 1 миллион — относится к V4-Pro, а не к Flash.
По материалам MarkTechPost
