DeepSeek V4.1 Flash: новая архитектура, нативная мультимодальность и полное превосходство над V4 Pro
1. Объявление о выходе
9 сентября 2026 года платформа DeepSeek опубликовала уведомление о планах официально выпустить новую модель DeepSeek V4.1 Flash около 10 сентября 2026 года по пекинскому времени. Накануне, 8 сентября, в официальном чате разработчиков уже началось ограниченное внутреннее тестирование промежуточной версии V4.1 Flash.
Тестовый идентификатор модели – deepseek-v4.1-flash-expires-on-0910. Дата в названии означает, что этот промежуточный билд автоматически прекратит работу 10 сентября. Разработчикам не нужно менять base_url – достаточно указать этот ID в поле model, при этом на каждый аккаунт действует лимит 20 одновременных запросов.
В сопутствующем опроснике DeepSeek прямо спрашивает пользователей: «Может ли промежуточная версия V4.1 Flash полностью заменить текущую V4 Pro?» Это намёк на то, что компания не просто обновляет линейку Flash, а нацелена на то, чтобы новая модель со скоростью и ценой Flash догнала и перегнала по возможностям флагманскую V4 Pro.
2. Ключевые особенности
2.1. Совершенно новая архитектура
V4.1 Flash построена на принципиально новой архитектуре. В отличие от предыдущих итераций, это не просто дообучение, а глубокая переработка базового слоя модели.
2.2. Нативная мультимодальность
Одно из самых важных улучшений – встроенная поддержка нескольких модальностей. Раньше в V4 Flash Vision Exp использовался «внешний» визуальный модуль: отдельный блок обрабатывал изображения, а затем конвертировал их для текстовой модели. V4.1 Flash обрабатывает текст и изображения (а по некоторым данным – и другие типы данных) в единой архитектуре без внешних конвертеров и «склеек».
Тесты подтверждают колоссальный рост эффективности:
- Описание одного и того же изображения: V4.1 Flash – ~5,7 секунды, старая V4 Flash – 200 секунд.
- В другом тесте: 7,6 секунды против 751 секунды (более 12 минут).
2.3. Одновременное улучшение трёх параметров
DeepSeek заявляет, что V4.1 Flash превосходит V4 Pro по всем ключевым метрикам: производительность, стоимость, скорость и общее время выполнения задач. Внутренние и внешние тесты это подтверждают.
3. Результаты реальных тестов
3.1. Скорость генерации
Скорость – самое яркое преимущество V4.1 Flash. Данные из разных источников:
| Источник | Скорость выдачи токенов | Примечание |
|---|---|---|
| Тест разработчика в соцсети X | 507 токен/с | максимальный зафиксированный показатель |
| Начальные тесты | 420 токен/с | непрерывная генерация 71 000+ токенов менее чем за 3 минуты |
| Тяжёлый длинный контекст | 420 токен/с | сквозная пропускная способность 409,5 токен/с |
| Усреднённые данные | ~284 токен/с | почти в 3 раза быстрее старой V4 (~97 токен/с) |
| Сравнение с V4 Pro | 355 против 63 токен/с | разница в пропускной способности ~5,7 раза |
В конкретном примере разработчик попросил модель создать HTML-страницу с 2D-анимацией пеликана на велосипеде (с использованием SVG). V4.1 Flash справилась за 75,4 секунды, выдав скорость 328 токен/с. В другом испытании модель показала ускорение в 5,2 раза при поиске в 49 тыс. токенов контекста и в 6 раз при генерации SVG-кода.
3.2. Задержка до первого токена (TTFT)
Показатель TTFT у V4.1 Flash составляет всего 178 мс, тогда как у V4 Pro – 766 мс. Один из тестеров отметил, что на ответ на слово «привет» модели потребовалось всего 0,3 секунды на «размышление», а полный цикл диалога занял 0,8 секунды.
3.3. Мультимодальность и самокоррекция
V4.1 Flash не просто «понимает» картинки – она способна самостоятельно проверять и исправлять свои же результаты. В задаче с пеликаном модель заметила, что нарисованная птица больше похожа на «лебедя с миской», и сама скорректировала голову, клюв и позу. В другой задаче с медвежонком она обнаружила, что шея слишком длинная, а голова слишком маленькая – «как у ламы», и исправила рисунок.
3.4. Особенности для сложных задач
Однако в сложных сценариях есть нюансы: хотя V4.1 Flash генерирует токены быстрее, при необходимости вызывать инструменты для проверки или запускать несколько агентских подзадач общее время выполнения может быть дольше, а расход токенов – выше.
4. Цены и тарификация
DeepSeek вводит новые цены для модели V4.1 Flash, которые вступят в силу 10 сентября 2026 года в 04:00 UTC (то есть в 07:00 по Москве). Все цены указаны в долларах США; рядом – пересчёт в рубли по курсу ~90 ₽ за 1 USD.
| Позиция | Цена вне пика (USD) | Цена в пик (USD) | В рублях (вне пика) | В рублях (пик) |
|---|---|---|---|---|
| 1M входных токенов (попадание в кеш) | $0,003 | $0,006 | ~0,27 ₽ | ~0,54 ₽ |
| 1M входных токенов (промах кеша) | $0,15 | $0,30 | ~13,5 ₽ | ~27 ₽ |
| 1M выходных токенов | $0,60 | $1,20 | ~54 ₽ | ~108 ₽ |
Пиковые цены ровно вдвое выше внепиковых.
5. Пиковые и внепиковые часы
В уведомлении указаны пиковые часы по UTC:
- Пик (UTC): 01:00–04:00 и 06:00–10:00, с понедельника по пятницу.
Перевод на московское время (UTC+3):
| Период | Время по Москве (пн–пт) |
|---|---|
| Утренний пик | 04:00 – 07:00 |
| Дневной пик | 09:00 – 13:00 |
| Внепиковое время | все остальные часы, а также круглосуточно в субботу и воскресенье |
6. Резюме
DeepSeek V4.1 Flash – это важный шаг в развитии моделей компании. Её главные преимущества:
- Новая архитектура + нативная мультимодальность – больше никаких внешних визуальных модулей, всё обрабатывается внутри единой сети.
- Революционная скорость – на практике 300–500 токен/с, что в разы быстрее V4 Pro.
- Существенное снижение цен – попадание в кеш подешевело на 60%, выходные токены – примерно на 11%.
- Амбициозная цель – компания всерьёз рассматривает замену Pro-модели на Flash.
На данный момент DeepSeek не раскрыла точный размер параметров, длину контекста и официальные бенчмарки V4.1 Flash. Эти детали, скорее всего, появятся вместе с финальным релизом 10 сентября. Тем не менее, уже сейчас очевидно, что новая модель задаёт новый стандарт в соотношении цена/скорость/качество.
