В июле 2026 года редакция AI Радар провела первый раунд собственной методики оценки ИИ-моделей — Полярный тест (PT-1), ориентированный не на абстрактные академические задачи, а на реальные потребности российского бизнеса: доступность без VPN, рублёвые тарифы, соответствие 152-ФЗ и качество работы с российским деловым контекстом. В тесте участвовали три модели: GigaChat, YandexGPT Pro 5.1 и Claude Sonnet 4.6 — каждая проходила испытание по шести блокам на общую сумму 115 баллов.
YandexGPT Pro 5.1 занял первое место с результатом 89 баллов из 115, опередив Claude Sonnet 4.6 (84 балла) и GigaChat, который набрал 67 баллов — заметно отстав от лидеров. Блоки теста: русский язык (20 баллов), российский контекст (20), бизнес-задачи (25), скорость и стоимость (20), надёжность для России (15) и прикладная математика (15).
В блоке «Прикладная математика» (расчёт unit-экономики, интерпретация данных, расчёт ROI) YandexGPT Pro и Claude Sonnet набрали максимальные баллы по каждой из трёх задач, а у GigaChat в этом же блоке обнаружена ошибка в расчёте ROI, а также отдельная фактическая ошибка в другом блоке теста — это и стало основной причиной отставания в итоговом счёте.
Важная оговорка: это результат одного раунда одной независимой методики на момент июля 2026 года, а не универсальный вердикт по всем задачам и версиям моделей — обе компании регулярно обновляют модели, и результат может измениться в следующих раундах.
YandexGPT глубже завязана на продукты Яндекса — Алису, Браузер, Поиск и сервис 300.ya.ru, а для бизнеса доступна через Yandex Cloud с оплатой по токенам и той же логикой, что и остальные облачные продукты компании. GigaChat от Сбербанка активнее продвигается как самостоятельный API для сторонних интеграторов — не завязанный на конкретную экосистему, с отдельным порталом разработчиков developers.sber.ru.
Если компания уже работает в контуре Yandex Cloud или продукт должен встраиваться в сервисы Яндекса (Алиса, Браузер, Поиск) — логичнее начать с YandexGPT, тем более что по итогам PT-1 модель показала более надёжный результат на бизнес-задачах и без ошибок в расчётах. Если приоритет — самостоятельный API без привязки к конкретной экосистеме и уже есть инфраструктурные связи со Сбером — стоит тестировать GigaChat, но для задач с точными расчётами (ROI, unit-экономика) результаты PT-1 говорят в пользу дополнительной проверки выходных данных, а не безусловного доверия.
Обе модели периодически выпускают новые версии — на момент этого раунда PT-1 тестировалась линейка GigaChat 3.x, актуальные версии стоит уточнять на карточке GigaChat и карточке YandexGPT.