DeepSeek V4 Flash 0731: рост на DeepSWE с 12,8 до 54,4 балла | AI Радар
Продукт

DeepSeek V4 Flash 0731 обошёл собственный флагман V4 Pro на всех агентных бенчмарках

📅 4 августа 2026 ✍️ Александр Григорьев 🏷 DeepSeek · LLM · Открытые модели
DeepSeek выпустила финальную версию V4 Flash 0731: результат на DeepSWE вырос с 12,8 до 54,4 балла, на Terminal-Bench 2.1 — до 82,7. Модель на 284 млрд параметров (13 млрд активных) обходит более крупный V4 Pro Preview по всем девяти опубликованным агентным бенчмаркам при цене от $0,14 за миллион входных токенов.
54,4
Балл DeepSWE
было 12,8 у V4-Pro
82,7
Terminal-Bench 2.1
было 72,1
$0,14
За млн вход. токенов
треть цены V4-Pro

Что выпустила DeepSeek

31 июля 2026 года китайская лаборатория DeepSeek официально вывела из препрев-статуса модель V4-Flash-0731 — облегчённую версию своего флагмана V4 с архитектурой mixture-of-experts на 284 млрд параметров, из которых на каждый токен активируется лишь 13 млрд. Контекстное окно достигает 1 млн токенов, а сам роутинг задействует 256 экспертов, что позволяет держать инференс дешёвым при сохранении качества крупной модели.

Ключевая особенность релиза в том, что архитектура не изменилась по сравнению с апрельским препревью — компания заново переобучила модель именно под агентные сценарии, сделав акцент на самостоятельном выполнении многошаговых задач, работе с инструментами и написании кода без постоянного участия человека.

Бенчмарки: обгон собственного флагмана

По опубликованным DeepSeek данным, V4-Flash-0731 обходит более крупную и на бумаге более мощную модель V4-Pro Preview по всем девяти агентным и код-бенчмаркам, которые компания раскрыла. Разрыв особенно заметен на DeepSWE — тесте на решение реальных задач из открытых репозиториев: результат вырос с 12,8 до 54,4 балла, то есть более чем в четыре раза. На Terminal-Bench 2.1, где модель должна автономно работать в командной строке, показатель поднялся с 72,1 до 82,7. На NL2Repo — с 38,5 до 54,2, на Cybergym (безопасность и эксплойты) — с 52,7 до 76,7.

По методологии независимого ресурса Artificial Analysis, V4-Flash-0731 в режиме максимального рассуждения набирает 50 баллов в интегральном Intelligence Index — при медиане 25 среди открытых моделей сопоставимого размера. На бенчмарке агентных рабочих задач GDPval-AA v2 рейтинг Эло вырос с 1189 у предыдущей версии Flash до 1559. При этом стоит держать в уме, что все цифры — собственные данные DeepSeek на пока не выпущенном публично тестовом наборе, поэтому независимая верификация ещё впереди.

Экономика: цена в разы ниже конкурентов

API модели стоит $0,14 за миллион входных токенов (при попадании в кэш — всего $0,0028) и $0,28 за миллион выходных — это примерно треть от цены собственного V4-Pro Preview и на порядок дешевле топовых закрытых моделей американских лабораторий. Для агентных сценариев, где модель совершает десятки последовательных вызовов инструментов внутри одной задачи, разница в цене за токен напрямую конвертируется в разницу в стоимости выполнения всей задачи целиком.

Такая ценовая политика продолжает стратегию DeepSeek на демпинг рынка инференса, которую компания проводит с начала 2025 года: каждый новый релиз выходит одновременно сильнее и дешевле предыдущего, вынуждая конкурентов — как китайских, так и американских — снижать цены следом.

AI Радар — Аналитический дашборд
Полная картина рынка ИИ России и мира
520 млрд ₽рынок ИИ России
+24%рост г/г
800+AI-компаний
$3.68 трлнпрогноз мир к 2030
На главную

Что это значит для российского рынка ИИ

Для российских разработчиков и компаний, использующих открытые модели из-за санкционных ограничений на доступ к закрытым API американских лабораторий, релиз V4-Flash-0731 расширяет выбор в сегменте, где качество агентных сценариев ещё недавно было слабым местом открытых моделей. Веса модели доступны для скачивания и локального развёртывания, что снимает вопрос трансграничной передачи данных — критичный фактор для компаний, работающих с закону №152-ФЗ о персональных данных.

Одновременно релиз усиливает конкурентное давление на отечественные модели вроде GigaChat и YandexGPT: DeepSeek предлагает открытые веса сопоставимого или превосходящего агентного качества практически бесплатно для локального инференса, что снижает экономические стимулы разработки альтернатив внутри страны для задач, не требующих обязательной локализации.

Как это укладывается в стратегию DeepSeek

С момента прорывного релиза V3 в начале 2025 года DeepSeek придерживается последовательной модели: выпускать сначала «тяжёлую» флагманскую версию, а затем облегчённый вариант Flash, который переобучается под конкретный класс задач и почти всегда оказывается сильнее в узкой области, чем более крупный предшественник. V4-Flash-0731 продолжает эту логику — компания сознательно жертвует универсальностью ради максимальной эффективности в агентных и код-сценариях, которые сейчас определяют коммерческий спрос на LLM у бизнеса.

Такой подход контрастирует со стратегией американских лабораторий, которые чаще делают ставку на единую флагманскую модель с широким охватом задач. Для корпоративных заказчиков, оптимизирующих расходы на инференс, специализированные и дешёвые модели вроде V4-Flash-0731 становятся всё более привлекательной альтернативой универсальным, но дорогим системам — особенно там, где задача заранее известна и не требует широкой энциклопедической эрудиции модели.

📎 Первоисточник: MarkTechPost · 31 июля 2026 ↗