31 июля 2026 года китайская лаборатория DeepSeek официально вывела из препрев-статуса модель V4-Flash-0731 — облегчённую версию своего флагмана V4 с архитектурой mixture-of-experts на 284 млрд параметров, из которых на каждый токен активируется лишь 13 млрд. Контекстное окно достигает 1 млн токенов, а сам роутинг задействует 256 экспертов, что позволяет держать инференс дешёвым при сохранении качества крупной модели.
Ключевая особенность релиза в том, что архитектура не изменилась по сравнению с апрельским препревью — компания заново переобучила модель именно под агентные сценарии, сделав акцент на самостоятельном выполнении многошаговых задач, работе с инструментами и написании кода без постоянного участия человека.
По опубликованным DeepSeek данным, V4-Flash-0731 обходит более крупную и на бумаге более мощную модель V4-Pro Preview по всем девяти агентным и код-бенчмаркам, которые компания раскрыла. Разрыв особенно заметен на DeepSWE — тесте на решение реальных задач из открытых репозиториев: результат вырос с 12,8 до 54,4 балла, то есть более чем в четыре раза. На Terminal-Bench 2.1, где модель должна автономно работать в командной строке, показатель поднялся с 72,1 до 82,7. На NL2Repo — с 38,5 до 54,2, на Cybergym (безопасность и эксплойты) — с 52,7 до 76,7.
По методологии независимого ресурса Artificial Analysis, V4-Flash-0731 в режиме максимального рассуждения набирает 50 баллов в интегральном Intelligence Index — при медиане 25 среди открытых моделей сопоставимого размера. На бенчмарке агентных рабочих задач GDPval-AA v2 рейтинг Эло вырос с 1189 у предыдущей версии Flash до 1559. При этом стоит держать в уме, что все цифры — собственные данные DeepSeek на пока не выпущенном публично тестовом наборе, поэтому независимая верификация ещё впереди.
API модели стоит $0,14 за миллион входных токенов (при попадании в кэш — всего $0,0028) и $0,28 за миллион выходных — это примерно треть от цены собственного V4-Pro Preview и на порядок дешевле топовых закрытых моделей американских лабораторий. Для агентных сценариев, где модель совершает десятки последовательных вызовов инструментов внутри одной задачи, разница в цене за токен напрямую конвертируется в разницу в стоимости выполнения всей задачи целиком.
Такая ценовая политика продолжает стратегию DeepSeek на демпинг рынка инференса, которую компания проводит с начала 2025 года: каждый новый релиз выходит одновременно сильнее и дешевле предыдущего, вынуждая конкурентов — как китайских, так и американских — снижать цены следом.
Для российских разработчиков и компаний, использующих открытые модели из-за санкционных ограничений на доступ к закрытым API американских лабораторий, релиз V4-Flash-0731 расширяет выбор в сегменте, где качество агентных сценариев ещё недавно было слабым местом открытых моделей. Веса модели доступны для скачивания и локального развёртывания, что снимает вопрос трансграничной передачи данных — критичный фактор для компаний, работающих с закону №152-ФЗ о персональных данных.
Одновременно релиз усиливает конкурентное давление на отечественные модели вроде GigaChat и YandexGPT: DeepSeek предлагает открытые веса сопоставимого или превосходящего агентного качества практически бесплатно для локального инференса, что снижает экономические стимулы разработки альтернатив внутри страны для задач, не требующих обязательной локализации.
С момента прорывного релиза V3 в начале 2025 года DeepSeek придерживается последовательной модели: выпускать сначала «тяжёлую» флагманскую версию, а затем облегчённый вариант Flash, который переобучается под конкретный класс задач и почти всегда оказывается сильнее в узкой области, чем более крупный предшественник. V4-Flash-0731 продолжает эту логику — компания сознательно жертвует универсальностью ради максимальной эффективности в агентных и код-сценариях, которые сейчас определяют коммерческий спрос на LLM у бизнеса.
Такой подход контрастирует со стратегией американских лабораторий, которые чаще делают ставку на единую флагманскую модель с широким охватом задач. Для корпоративных заказчиков, оптимизирующих расходы на инференс, специализированные и дешёвые модели вроде V4-Flash-0731 становятся всё более привлекательной альтернативой универсальным, но дорогим системам — особенно там, где задача заранее известна и не требует широкой энциклопедической эрудиции модели.