Google выпустил сразу три модели линейки Flash: Gemini 3.6 Flash — основной рабочий вариант для агентных и разработческих сценариев, Gemini 3.5 Flash-Lite — облегчённую версию по $0,30 за миллион входных и $2,50 за миллион выходных токенов для задач с высокой нагрузкой, и Gemini 3.5 Flash Cyber — модель с ограниченным доступом, ориентированную на задачи кибербезопасности для государственных заказчиков.
Ключевое изменение в 3.6 Flash — не просто прирост качества, а резкое повышение эффективности использования токенов. По данным Google, модель тратит на 65% меньше выходных токенов на сопоставимую задачу, что напрямую снижает стоимость эксплуатации в агентных сценариях, где модель совершает десятки последовательных вызовов инструментов.
Среди первых пользователей новой модели Google называет юридический сервис Harvey и аналитическую платформу Hebbia. Отдельно объявлено, что инструмент для автоматического исправления уязвимостей CodeMender вошёл в закрытое тестирование с участием Salesforce, Robinhood и Palo Alto Networks.
DeepSWE — бенчмарк агентной разработки от Datacurve, оценивающий способность модели самостоятельно находить и устранять ошибки в реальных репозиториях. Рост результата с 37% до 49% — один из самых заметных скачков среди Flash-моделей Google за последний год и ставит 3.6 Flash в один ряд с более дорогими моделями конкурентов по соотношению цена/качество.
Запуск укладывается в общий тренд лета 2026 года: одновременно с падением цены на выходные токены у Google усиливается конкуренция со стороны открытых китайских моделей — DeepSeek и Moonshot AI на этой неделе также объявляли о резком росте спроса на свои модели. Ценовое давление сверху и снизу заставляет всех крупных игроков снижать стоимость инференса быстрее, чем растут вычислительные мощности.
Прямой доступ к API Google из России ограничен, поэтому большинство российских разработчиков используют Gemini через посреднические сервисы и прокси-биллинг — снижение официальной цены на 3.6 Flash в перспективе транслируется и в удешевление таких схем доступа. Для команд, которые тестируют мультивендорные agentic-конвейеры (одновременно дергая GigaChat, YandexGPT и зарубежные модели), появление более дешёвого и точного варианта Flash расширяет пространство для сравнения по цене за единицу качества.
Косвенно запуск бьёт и по позиционированию российских моделей: GigaChat и YandexGPT конкурируют с зарубежными LLM в первую очередь на локальных, специализированных под русский язык задачах и требованиях по локализации данных — там, где цена по $/1M токенов не единственный критерий выбора. Но в сегменте агентных сценариев для разработки, где важна именно стоимость большого числа последовательных вызовов, снижение цены у Google повышает планку, с которой сравнивают отечественные продукты.
Google уже анонсировал, что готовит Gemini 4, а линейка Flash продолжит получать промежуточные обновления в течение осени — компания явно делает ставку на частые итерации вместо редких крупных релизов, как это происходит у OpenAI и Anthropic. Для рынка это означает дальнейшее продолжение ценовой войны: снижение стоимости токена становится таким же полем конкуренции, как и абсолютное качество моделей на бенчмарках.