Полярный Тест: методология сравнения ИИ для российского рынка
Открытая система оценки языковых моделей, созданная специально для задач российского бизнеса — с учётом языка, контекста, стоимости и доступности без VPN.
6 моделей в раунде PT-2
6 блоков оценки
115 баллов максимум
Август 2026 — дата замера PT-2
Методология
Западные бенчмарки (MMLU, MT-Bench, Chatbot Arena) заточены под английский язык и академические задачи. Полярный Тест оценивает то, что реально важно для компании в России: качество русского языка, знание российских реалий, скорость, стоимость в рублях и доступность без VPN.
01
Русский язык
Перефраз, деловые письма, объяснение сложного простым языком
Новостные лиды, аналитика, копирайтинг, структурирование данных
25 баллов
04
Скорость и стоимость
Токены в секунду, цена за 1М токенов в рублях, задержка первого токена
20 баллов
05
Надёжность для России
Доступность без VPN, рублёвый биллинг, хранение данных в РФ
15 баллов
06
Прикладная математика
Unit-экономика, интерпретация данных, расчёт ROI — реальные бизнес-задачи с проверяемым ответом
15 баллов
Сравнительная таблица
Раунд 2 · Август 2026 · Тестовые промпты одинаковы для всех моделей · Зелёный = лидер метрики · Максимум 115 баллов
Цены на токены: GigaChat — тариф для физлиц (developers.sber.ru), входящие 0.065 ₽ / исходящие 0.50 ₽ за 1К. YandexGPT Pro 5.1 — yandex.cloud, 0.40 ₽ за 1К. Claude Sonnet — $3 / $15 за 1М токенов, пересчёт по курсу 90 ₽/$. Nemotron 3 Ultra/Super и MiniMax M3 протестированы напрямую через API OpenRouter, бесплатный тариф (":free") — 0 ₽ на момент теста, но это не производственный тариф: лимит 50 запросов в день на аккаунт, периодические ошибки 429 при перегрузке.
Ещё две модели — GLM 5.2 и Gemma 4 31B — тестировались тем же методом, но не прошли полный набор из 6 задач: свободный лимит запросов оказался исчерпан платформой ещё до нашего теста (постоянная ошибка 429 даже после трёх повторов с паузами до 100 секунд). Не включены в таблицу, чтобы не давать оценку по неполным данным — сама по себе эта перегрузка является наблюдением о надёжности бесплатного тарифа.
Метрика
GigaChat
Сбер
YandexGPT Pro
Яндекс · 5.1
Claude Sonnet
Anthropic · 4.6
Nemotron 3 Ultra
NVIDIA · via OpenRouter
Nemotron 3 Super
NVIDIA · via OpenRouter
MiniMax M3
MiniMax · via OpenRouter
Русский язык
14/20
18/20Лидер
16/20
12/20
17/20
17/20
Российский контекст
13/20
16/20
19/20Лидер
17/20
12/20
18/20
Бизнес-задачи
16/25
21/25Лидер
21/25Лидер
20/25
19/25
20/25
Скорость (короткие задачи)
0.5сЛидер
1.1с
2–3с
106,6с
49,3с
18,1с
Скорость (длинные задачи)
3.4с
8.9с
3–5сЛидер
170,8с
76,7с
31,3с
Доступность в РФ без VPN
ДаЛидер
ДаЛидер
VPN
VPN
VPN
VPN
Рублёвый биллинг
ДаЛидер
ДаЛидер
$
$
$
$
Хранение данных в РФ
ДаЛидер
ДаЛидер
США/EU
США
США
США/КНР
СТОИМОСТЬ · АВГУСТ 2026
Входящие токены / 1 000
0.065 ₽
0.40 ₽
$0.003 ≈ 0.27 ₽
0 ₽*
0 ₽*
0 ₽*
Исходящие токены / 1 000
0.50 ₽
0.40 ₽
$0.015 ≈ 1.35 ₽
0 ₽*
0 ₽*
0 ₽*
Валюта биллинга
₽ рублиЛидер
₽ рублиЛидер
$ USD
$ USD*
$ USD*
$ USD*
Фактическая точность
Ошибки
Хорошо
ОтличноЛидер
Хорошо
Языковой баг**
Хорошо
Unit-экономика (T, LTV/CAC)
2/5
5/5Лидер
5/5Лидер
4/5
5/5Лидер
5/5Лидер
Интерпретация данных
4/5
5/5Лидер
5/5Лидер
5/5Лидер
5/5Лидер
5/5Лидер
Расчёт ROI
3/5
5/5Лидер
5/5Лидер
2/5
4/5
2/5
Итого (PT-2 Score)
67/115
89/115Лидер
84/115
68/115
72/115
78/115
* Бесплатный тариф OpenRouter ("":free") на момент теста — не тарифная цена для продакшена, а временное условие с жёстким дневным лимитом запросов. При исчерпании лимита эти модели становятся недоступны до следующего дня или требуют перехода на платный тариф той же платформы (в $).
** Nemotron 3 Super дважды вставил китайские иероглифы (法律义务) вместо русского текста «выполнение юридической обязанности» в разборе 152-ФЗ/GDPR — реальный, воспроизводимый дефект многоязычной модели, а не единичная случайность (повторился в двух местах одного ответа).
Тестовые задания и ответы
БЛОК 1 — РУССКИЙ ЯЗЫК
Перепиши юридический текст простым языком: «Арендатор обязуется в случае расторжения договора аренды по инициативе Арендатора до истечения срока аренды возместить Арендодателю убытки в размере арендной платы за один месяц...»
GigaChat
Если арендатор решит досрочно расторгнуть договор (раньше окончания срока аренды), он обязан компенсировать владельцу недвижимости сумму месячной арендной платы — именно столько владелец мог бы получить от нового арендатора.
0.5с52 токенаДобавил контекст
YandexGPT Pro · Лидер
Если арендатор сам решит расторгнуть договор до окончания срока аренды, он должен будет заплатить арендодателю сумму, равную плате за один месяц, согласно условиям договора.
1.3с33 токенаЛаконично, без лишнего
Claude Sonnet 4.6
Если вы захотите расторгнуть договор аренды раньше срока по своей инициативе, вам придётся выплатить арендодателю компенсацию в размере одного месяца арендной платы — той суммы, что указана в договоре.
2.1с38 токенов«Компенсация» точнее «убытков»
БЛОК 2 — РОССИЙСКИЙ КОНТЕКСТ
Объясни разницу между 152-ФЗ и европейским GDPR. Что важнее знать российскому бизнесу?
GigaChat
Дал развёрнутый ответ, но допустил ключевую фактическую ошибку: назвал Privacy Shield действующим механизмом для передачи данных. Соглашение признано недействительным Судом ЕС в 2020 году (дело Schrems II).
3.4с466 токеновФактическая ошибка
YandexGPT Pro
Структурированный ответ с разбивкой по сферам применения, требованиям и ответственности. Фактических ошибок не обнаружено. Рекомендовал обратиться к юристу — корректно для такой темы.
8.9с439 токеновБез ошибок
Claude Sonnet 4.6 · Лидер
Указал актуальные механизмы: SCC (стандартные договорные клаузулы) вместо устаревшего Privacy Shield. Упомянул конкретную статью 18.1 о локализации данных. Чёткое разграничение «обязателен всегда» vs «нужен при клиентах из ЕС».
3.2с~380 токеновАктуальные факты
БЛОК 3 — БИЗНЕС-ЗАДАЧА
Напиши новостной лид (не более 280 символов): Just AI запустил caila.io — единый API к 100+ ИИ-моделям с рублёвым биллингом и российским юрлицом.
GigaChat
Just AI представил платформу caila.io — единый доступ к 100+ российским и зарубежным ИИ-моделям, с оплатой в рублях и юридическим статусом РФ. Теперь разработка с использованием передовых технологий стала проще и дешевле для бизнеса.
0.6с267 символовMarkdown в новостном тексте
YandexGPT Pro · Лидер
Just AI представил caila.io — платформу с единым API к более чем 100 ИИ-моделям, среди которых GigaChat, YandexGPT и DeepSeek. Особенность — биллинг в рублях и российское юридическое лицо.
1.1с196 символовЧистый текст, точный
Claude Sonnet 4.6 · Лидер
Just AI запустил caila.io — единый API к 100+ ИИ-моделям: GigaChat, YandexGPT, DeepSeek и западным сервисам. Рублёвый биллинг, российское юрлицо, совместимость с OpenAI SDK.
2.1с192 символаДобавил OpenAI SDK — ключевое USP
Блок 6 — Прикладная математика
Три задачи из реальной бизнес-практики с однозначно проверяемым ответом. Оценивается не только результат, но и правильность хода решения.
ЗАДАЧА 1 — UNIT-ЭКОНОМИКА · Правильный ответ: T = 12,5 мес · LTV/CAC = 6x · Канал окупается (норма >3x)
CAC = 3 000 руб, LTV = 18 000 руб, ежемесячный отток = 8%. Рассчитай: средний срок жизни клиента, LTV/CAC, вывод об окупаемости канала.
GigaChat — 2/5
Применил логарифмическую формулу вместо простой T = 1/churn. Получил отрицательное промежуточное значение (−0,082), затем инвертировал. Итог «≈12 месяцев» случайно близок к правильному. LTV/CAC = 6 — верно. Вывод слабый: «LTV/CAC > 1» вместо отраслевого бенчмарка >3x.
3.5сНеверная формула2/5
YandexGPT Pro — 5/5
T = 1/0,08 = 12,5 месяцев — верно. LTV/CAC = 18 000/3 000 = 6 — верно. Вывод: канал окупается, LTV/CAC > 1. Чистое и корректное решение.
8.5сВерная формула5/5
Claude Sonnet 4.6 — 5/5
T = 1/0,08 = 12,5 месяцев. LTV/CAC = 6x — значительно выше отраслевого бенчмарка в 3x. Вывод: канал высокоэффективен, каждый вложенный рубль приносит 6 рублей жизненной ценности.
2.4сБенчмарк 3x упомянут5/5
ЗАДАЧА 2 — ИНТЕРПРЕТАЦИЯ ДАННЫХ · Правильный ответ: конверсии ВЫРОСЛИ на +3,33%
Конверсия упала с 4,2% до 3,1%, трафик вырос на 40%. Абсолютное число конверсий выросло или упало? На сколько процентов?
GigaChat — 4/5
Правильный ход: X × 0,042 vs 1,4X × 0,031 = 0,0434X. Рост на 3,33% — верно. Решение немного перегружено форматированием, но математически корректно.
3.2сВерный ответ4/5
YandexGPT Pro — 5/5
K₁ = T × 0,042; K₂ = T × 1,4 × 0,031 = T × 0,0434. Рост (0,0434 − 0,042)/0,042 × 100% = 3,33%. Чистое алгебраическое решение.
9.8сВерный ответ, чисто5/5
Claude Sonnet 4.6 — 5/5
0,042X → 0,0434X, рост +3,3%. Добавлен практический вывод: снижение % конверсии при росте трафика — нормальная картина при масштабировании на менее целевую аудиторию.
2.1сВерный ответ + контекст5/5
ЗАДАЧА 3 — ROI · Правильный ответ: экономия 14 820 000 руб · ROI 470% · Окупаемость 2,1 мес
50 менеджеров × 1,5 ч/день × 800 руб/ч × 247 дней. Внедрение 2 млн + подписка 600 тыс. Рассчитай годовую экономию, ROI и срок окупаемости.
GigaChat — 3/5
Годовая экономия: 14 820 000 руб — верно. ROI: использовал формулу Savings/Costs × 100% → получил 569% вместо правильных 470%. Срок окупаемости: 2,1 мес — верно. Ошибка в формуле ROI принципиальная.
4.4сROI формула неверна → 569% вместо 470%
YandexGPT Pro — 5/5
Экономия: 60 000 руб/день × 247 дней = 14 820 000 руб. ROI: (14 820 000 − 2 600 000)/2 600 000 × 100% = 470%. Срок окупаемости: 2 600 000/1 235 000 = 2,1 мес. Все три ответа верны.
Три открытые модели протестированы напрямую через API OpenRouter (бесплатный тариф). Полные результаты — в сравнительной таблице выше; здесь — два конкретных ответа, которые объясняют, откуда взялись расхождения в баллах.
БЛОК 2 — РОССИЙСКИЙ КОНТЕКСТ · тот же промпт: 152-ФЗ vs GDPR
Российский контекст оценивался не только по полноте, но и по языковой чистоте ответа — ошибка здесь так же значима, как фактическая.
Nemotron 3 Ultra
Подробный, технически точный разбор (SCC, DPIA, отсутствие права на забвение в 152-ФЗ). Из недостатков — опечатка «гражданинский» вместо «гражданский» и избыточный объём для делового читателя.
Опечатка170,8с
Nemotron 3 Super
Структурно сильный ответ — но дважды вместо русского текста «выполнение юридической обязанности» вставлены китайские иероглифы: «...защита жизненно важных интересов, выполнение法律义务...». Повторилось в двух разных местах одного ответа — не случайная опечатка, а системная утечка не того языка при генерации.
Китайские иероглифы в ответе76,7с
MiniMax M3 · Лидер среди новых
Чистый русский язык, компактнее конкурентов, для деловой аудитории читается быстрее. Уместно сослался на реальный кейс — штраф Meta по GDPR (€1,2 млрд, 2023) — как наглядный ориентир масштаба риска.
Точный релевантный пример31,3с
ЗАДАЧА 3 — ROI · тот же промпт: правильный ответ ROI = 470%, окупаемость 2,1 мес.
Две из трёх новых моделей допустили одну и ту же методологическую ошибку — посчитали чистую экономию (за вычетом подписки), а затем разделили её на полные затраты, где подписка уже учтена дважды.
Nemotron 3 Ultra — 2/5
Годовая экономия 14,82 млн — верно. Но ROI посчитан как 711% или 547% (два варианта, оба мимо цели из-за двойного учёта подписки) вместо 470%. Срок окупаемости — 1,7 мес. вместо 2,1.
711%/547% вместо 470%
Nemotron 3 Super — 4/5
Дал два варианта расчёта и явно выделил корректный: «Вариант Б — 12 220 000/2 600 000 × 100% ≈ 470%», окупаемость «≈2,1 месяца». Правильный ответ присутствует, но подан как один из двух равноправных вариантов, а не как основной.
470% и 2,1 мес. — оба варианта названы
MiniMax M3 — 2/5
Та же ошибка, что у Nemotron 3 Ultra: ROI = 2370% или 547% (оба мимо 470%). Срок окупаемости 64 дня ≈ 2 месяца — оказался близко к верному 2,1 мес., но получен другим, внутренне непоследовательным способом (через 365 дней в году вместо 12 месяцев).
2370%/547% вместо 470%
Выводы Полярного Теста · Раунд 2
🥇
YandexGPT Pro 5.1 — победитель второй раунд подряд (89/115). Единственная модель с идеальным счётом в математическом блоке. Лучший баланс качества, доступности и точности для российского бизнеса.
🥈
Claude Sonnet 4.6 — второе место (84/115). Также идеальный математический результат, лидер по фактической точности. Минус: требует VPN в России и долларовый биллинг.
🥉
MiniMax M3 — лучшая среди новых открытых моделей (78/115), протестирована бесплатно через OpenRouter. Чистый и компактный русский язык, но провалила расчёт ROI той же ошибкой, что и Nemotron 3 Ultra.
4-6
Nemotron 3 Super (72), GigaChat (67) и Nemotron 3 Ultra (68) — плотная группа в нижней половине таблицы. У Nemotron 3 Super — лучший математический блок среди новых моделей (14/15), но и самый заметный дефект: китайские иероглифы вместо русского текста в двух местах одного ответа. У GigaChat — по-прежнему неверная арифметика ROI. У Nemotron 3 Ultra — корректные цифры, но самая медленная скорость ответа во всём раунде (до 170 секунд на бесплатном тарифе).
⚠️
Наблюдение о надёжности: GLM 5.2 и Gemma 4 31B не удалось протестировать полностью — свободный лимит запросов на эти модели оказался исчерпан на уровне всей платформы OpenRouter, а не только нашего аккаунта. Даже успешно протестированные модели отвечали в 10–150 раз медленнее платных GigaChat/YandexGPT/Claude. Бесплатный доступ реален, но не заменяет промышленный тариф для регулярной бизнес-нагрузки.
📌
Вывод для бизнеса: Для большинства российских компаний — YandexGPT как основная модель, Claude как валидатор для критичных документов. GigaChat оправдан при работе с чувствительными данными (хранение в РФ). Бесплатные открытые модели через OpenRouter — рабочий вариант для разовых экспериментов и пилотов без бюджета, но не для продакшена: медленно, нестабильно на пике спроса, и, как показал Nemotron 3 Super, не застраховано от языковых сбоев.
Полярный Тест проведён AI Радар. Раунд 1 (GigaChat, YandexGPT Pro 5.1, Claude Sonnet) — июль 2026, оценка вручную. Раунд 2 (август 2026) добавил три модели — Nemotron 3 Ultra, Nemotron 3 Super, MiniMax M3 — протестированные напрямую через API OpenRouter (бесплатный тариф), с реально измеренным временем ответа и оценкой качества тем же автором по идентичной рубрике. GLM 5.2 и Gemma 4 31B тестировались, но исключены из таблицы из-за неполных данных (постоянная ошибка 429 на уровне платформы). Методология открытая — промпты доступны для воспроизведения.
Частые вопросы о Полярном Тесте
Что такое Полярный Тест?
Полярный Тест — открытая методология AI Радар для сравнения языковых моделей применительно к задачам российского бизнеса: качество русского языка, знание российских реалий, скорость, стоимость в рублях и доступность без VPN.
Какие модели протестированы в PT-2?
К трём моделям раунда PT-1 (GigaChat, YandexGPT Pro 5.1, Claude Sonnet) добавлены три открытые модели, протестированные напрямую через API OpenRouter: Nemotron 3 Ultra и Nemotron 3 Super от NVIDIA, MiniMax M3. Ещё две модели (GLM 5.2, Gemma 4 31B) тестировались, но не прошли полный набор задач из-за постоянных ошибок 429 (превышение лимита бесплатного тарифа на уровне платформы) и не включены в итоговую таблицу.
Какая модель победила в PT-2?
Победитель по-прежнему YandexGPT Pro 5.1 (89/115). MiniMax M3 стал лучшим среди новых открытых моделей (78/115), опередив GigaChat (67/115), но уступив Claude Sonnet (84/115).
По каким критериям оценивались модели в Полярном Тесте?
Шесть блоков: русский язык (20 баллов), российский контекст (20 баллов), бизнес-задачи (25 баллов), скорость и стоимость (20 баллов), надёжность для России (15 баллов), прикладная математика (15 баллов).
Чем PT-2 отличается по методологии от PT-1?
Три исходные модели оценены вручную автором, как и в PT-1. Три новые модели протестированы через реальные вызовы API OpenRouter (бесплатный тариф) с измеренным временем ответа, а качество ответов оценено тем же автором по идентичной рубрике — с проверкой математических задач по однозначно верным числовым ответам.