PT-1 · Версия 1.0 · Июль 2026

Полярный Тест:
методология сравнения ИИ
для российского рынка

Открытая система оценки языковых моделей, созданная специально для задач российского бизнеса — с учётом языка, контекста, стоимости и доступности без VPN.

6 моделей в раунде PT-2
6 блоков оценки
115 баллов максимум
Август 2026 — дата замера PT-2

Методология

Западные бенчмарки (MMLU, MT-Bench, Chatbot Arena) заточены под английский язык и академические задачи. Полярный Тест оценивает то, что реально важно для компании в России: качество русского языка, знание российских реалий, скорость, стоимость в рублях и доступность без VPN.

01
Русский язык
Перефраз, деловые письма, объяснение сложного простым языком
20 баллов
02
Российский контекст
Знание законодательства, компаний, регулирования, рыночных реалий
20 баллов
03
Бизнес-задачи
Новостные лиды, аналитика, копирайтинг, структурирование данных
25 баллов
04
Скорость и стоимость
Токены в секунду, цена за 1М токенов в рублях, задержка первого токена
20 баллов
05
Надёжность для России
Доступность без VPN, рублёвый биллинг, хранение данных в РФ
15 баллов
06
Прикладная математика
Unit-экономика, интерпретация данных, расчёт ROI — реальные бизнес-задачи с проверяемым ответом
15 баллов

Сравнительная таблица

Раунд 2 · Август 2026 · Тестовые промпты одинаковы для всех моделей · Зелёный = лидер метрики · Максимум 115 баллов

Цены на токены: GigaChat — тариф для физлиц (developers.sber.ru), входящие 0.065 ₽ / исходящие 0.50 ₽ за 1К. YandexGPT Pro 5.1 — yandex.cloud, 0.40 ₽ за 1К. Claude Sonnet — $3 / $15 за 1М токенов, пересчёт по курсу 90 ₽/$. Nemotron 3 Ultra/Super и MiniMax M3 протестированы напрямую через API OpenRouter, бесплатный тариф (":free") — 0 ₽ на момент теста, но это не производственный тариф: лимит 50 запросов в день на аккаунт, периодические ошибки 429 при перегрузке.

Ещё две модели — GLM 5.2 и Gemma 4 31B — тестировались тем же методом, но не прошли полный набор из 6 задач: свободный лимит запросов оказался исчерпан платформой ещё до нашего теста (постоянная ошибка 429 даже после трёх повторов с паузами до 100 секунд). Не включены в таблицу, чтобы не давать оценку по неполным данным — сама по себе эта перегрузка является наблюдением о надёжности бесплатного тарифа.

Метрика
GigaChat
Сбер
YandexGPT Pro
Яндекс · 5.1
Claude Sonnet
Anthropic · 4.6
Nemotron 3 Ultra
NVIDIA · via OpenRouter
Nemotron 3 Super
NVIDIA · via OpenRouter
MiniMax M3
MiniMax · via OpenRouter
Русский язык 14/20 18/20 Лидер 16/20 12/20 17/20 17/20
Российский контекст 13/20 16/20 19/20 Лидер 17/20 12/20 18/20
Бизнес-задачи 16/25 21/25 Лидер 21/25 Лидер 20/25 19/25 20/25
Скорость (короткие задачи) 0.5с Лидер 1.1с 2–3с 106,6с 49,3с 18,1с
Скорость (длинные задачи) 3.4с 8.9с 3–5с Лидер 170,8с 76,7с 31,3с
Доступность в РФ без VPN Да Лидер Да Лидер VPN VPN VPN VPN
Рублёвый биллинг Да Лидер Да Лидер $ $ $ $
Хранение данных в РФ Да Лидер Да Лидер США/EU США США США/КНР
СТОИМОСТЬ · АВГУСТ 2026
Входящие токены / 1 000 0.065 ₽ 0.40 ₽ $0.003 ≈ 0.27 ₽ 0 ₽* 0 ₽* 0 ₽*
Исходящие токены / 1 000 0.50 ₽ 0.40 ₽ $0.015 ≈ 1.35 ₽ 0 ₽* 0 ₽* 0 ₽*
Валюта биллинга ₽ рубли Лидер ₽ рубли Лидер $ USD $ USD* $ USD* $ USD*
Фактическая точность Ошибки Хорошо Отлично Лидер Хорошо Языковой баг** Хорошо
Unit-экономика (T, LTV/CAC) 2/5 5/5 Лидер 5/5 Лидер 4/5 5/5 Лидер 5/5 Лидер
Интерпретация данных 4/5 5/5 Лидер 5/5 Лидер 5/5 Лидер 5/5 Лидер 5/5 Лидер
Расчёт ROI 3/5 5/5 Лидер 5/5 Лидер 2/5 4/5 2/5
Итого (PT-2 Score) 67/115 89/115 Лидер 84/115 68/115 72/115 78/115

* Бесплатный тариф OpenRouter ("":free") на момент теста — не тарифная цена для продакшена, а временное условие с жёстким дневным лимитом запросов. При исчерпании лимита эти модели становятся недоступны до следующего дня или требуют перехода на платный тариф той же платформы (в $).

** Nemotron 3 Super дважды вставил китайские иероглифы (法律义务) вместо русского текста «выполнение юридической обязанности» в разборе 152-ФЗ/GDPR — реальный, воспроизводимый дефект многоязычной модели, а не единичная случайность (повторился в двух местах одного ответа).

Тестовые задания и ответы

БЛОК 1 — РУССКИЙ ЯЗЫК
Перепиши юридический текст простым языком: «Арендатор обязуется в случае расторжения договора аренды по инициативе Арендатора до истечения срока аренды возместить Арендодателю убытки в размере арендной платы за один месяц...»
GigaChat
Если арендатор решит досрочно расторгнуть договор (раньше окончания срока аренды), он обязан компенсировать владельцу недвижимости сумму месячной арендной платы — именно столько владелец мог бы получить от нового арендатора.
0.5с 52 токена Добавил контекст
YandexGPT Pro · Лидер
Если арендатор сам решит расторгнуть договор до окончания срока аренды, он должен будет заплатить арендодателю сумму, равную плате за один месяц, согласно условиям договора.
1.3с 33 токена Лаконично, без лишнего
Claude Sonnet 4.6
Если вы захотите расторгнуть договор аренды раньше срока по своей инициативе, вам придётся выплатить арендодателю компенсацию в размере одного месяца арендной платы — той суммы, что указана в договоре.
2.1с 38 токенов «Компенсация» точнее «убытков»
БЛОК 2 — РОССИЙСКИЙ КОНТЕКСТ
Объясни разницу между 152-ФЗ и европейским GDPR. Что важнее знать российскому бизнесу?
GigaChat
Дал развёрнутый ответ, но допустил ключевую фактическую ошибку: назвал Privacy Shield действующим механизмом для передачи данных. Соглашение признано недействительным Судом ЕС в 2020 году (дело Schrems II).
3.4с 466 токенов Фактическая ошибка
YandexGPT Pro
Структурированный ответ с разбивкой по сферам применения, требованиям и ответственности. Фактических ошибок не обнаружено. Рекомендовал обратиться к юристу — корректно для такой темы.
8.9с 439 токенов Без ошибок
Claude Sonnet 4.6 · Лидер
Указал актуальные механизмы: SCC (стандартные договорные клаузулы) вместо устаревшего Privacy Shield. Упомянул конкретную статью 18.1 о локализации данных. Чёткое разграничение «обязателен всегда» vs «нужен при клиентах из ЕС».
3.2с ~380 токенов Актуальные факты
БЛОК 3 — БИЗНЕС-ЗАДАЧА
Напиши новостной лид (не более 280 символов): Just AI запустил caila.io — единый API к 100+ ИИ-моделям с рублёвым биллингом и российским юрлицом.
GigaChat
Just AI представил платформу caila.io — единый доступ к 100+ российским и зарубежным ИИ-моделям, с оплатой в рублях и юридическим статусом РФ. Теперь разработка с использованием передовых технологий стала проще и дешевле для бизнеса.
0.6с 267 символов Markdown в новостном тексте
YandexGPT Pro · Лидер
Just AI представил caila.io — платформу с единым API к более чем 100 ИИ-моделям, среди которых GigaChat, YandexGPT и DeepSeek. Особенность — биллинг в рублях и российское юридическое лицо.
1.1с 196 символов Чистый текст, точный
Claude Sonnet 4.6 · Лидер
Just AI запустил caila.io — единый API к 100+ ИИ-моделям: GigaChat, YandexGPT, DeepSeek и западным сервисам. Рублёвый биллинг, российское юрлицо, совместимость с OpenAI SDK.
2.1с 192 символа Добавил OpenAI SDK — ключевое USP

Блок 6 — Прикладная математика

Три задачи из реальной бизнес-практики с однозначно проверяемым ответом. Оценивается не только результат, но и правильность хода решения.

ЗАДАЧА 1 — UNIT-ЭКОНОМИКА · Правильный ответ: T = 12,5 мес · LTV/CAC = 6x · Канал окупается (норма >3x)
CAC = 3 000 руб, LTV = 18 000 руб, ежемесячный отток = 8%. Рассчитай: средний срок жизни клиента, LTV/CAC, вывод об окупаемости канала.
GigaChat — 2/5
Применил логарифмическую формулу вместо простой T = 1/churn. Получил отрицательное промежуточное значение (−0,082), затем инвертировал. Итог «≈12 месяцев» случайно близок к правильному. LTV/CAC = 6 — верно. Вывод слабый: «LTV/CAC > 1» вместо отраслевого бенчмарка >3x.
3.5с Неверная формула 2/5
YandexGPT Pro — 5/5
T = 1/0,08 = 12,5 месяцев — верно. LTV/CAC = 18 000/3 000 = 6 — верно. Вывод: канал окупается, LTV/CAC > 1. Чистое и корректное решение.
8.5с Верная формула 5/5
Claude Sonnet 4.6 — 5/5
T = 1/0,08 = 12,5 месяцев. LTV/CAC = 6x — значительно выше отраслевого бенчмарка в 3x. Вывод: канал высокоэффективен, каждый вложенный рубль приносит 6 рублей жизненной ценности.
2.4с Бенчмарк 3x упомянут 5/5
ЗАДАЧА 2 — ИНТЕРПРЕТАЦИЯ ДАННЫХ · Правильный ответ: конверсии ВЫРОСЛИ на +3,33%
Конверсия упала с 4,2% до 3,1%, трафик вырос на 40%. Абсолютное число конверсий выросло или упало? На сколько процентов?
GigaChat — 4/5
Правильный ход: X × 0,042 vs 1,4X × 0,031 = 0,0434X. Рост на 3,33% — верно. Решение немного перегружено форматированием, но математически корректно.
3.2с Верный ответ 4/5
YandexGPT Pro — 5/5
K₁ = T × 0,042; K₂ = T × 1,4 × 0,031 = T × 0,0434. Рост (0,0434 − 0,042)/0,042 × 100% = 3,33%. Чистое алгебраическое решение.
9.8с Верный ответ, чисто 5/5
Claude Sonnet 4.6 — 5/5
0,042X → 0,0434X, рост +3,3%. Добавлен практический вывод: снижение % конверсии при росте трафика — нормальная картина при масштабировании на менее целевую аудиторию.
2.1с Верный ответ + контекст 5/5
ЗАДАЧА 3 — ROI · Правильный ответ: экономия 14 820 000 руб · ROI 470% · Окупаемость 2,1 мес
50 менеджеров × 1,5 ч/день × 800 руб/ч × 247 дней. Внедрение 2 млн + подписка 600 тыс. Рассчитай годовую экономию, ROI и срок окупаемости.
GigaChat — 3/5
Годовая экономия: 14 820 000 руб — верно. ROI: использовал формулу Savings/Costs × 100% → получил 569% вместо правильных 470%. Срок окупаемости: 2,1 мес — верно. Ошибка в формуле ROI принципиальная.
4.4с ROI формула неверна → 569% вместо 470%
YandexGPT Pro — 5/5
Экономия: 60 000 руб/день × 247 дней = 14 820 000 руб. ROI: (14 820 000 − 2 600 000)/2 600 000 × 100% = 470%. Срок окупаемости: 2 600 000/1 235 000 = 2,1 мес. Все три ответа верны.
9.9с Все ответы верны 5/5
Claude Sonnet 4.6 — 5/5
14 820 000 руб годовой экономии. ROI = (14 820 000 − 2 600 000)/2 600 000 = 470%. Срок окупаемости: 2 600 000/(14 820 000/12) ≈ 2,1 месяца. Все расчёты верны.
2.3с Все ответы верны 5/5

PT-2 — новые модели: два показательных примера

Три открытые модели протестированы напрямую через API OpenRouter (бесплатный тариф). Полные результаты — в сравнительной таблице выше; здесь — два конкретных ответа, которые объясняют, откуда взялись расхождения в баллах.

БЛОК 2 — РОССИЙСКИЙ КОНТЕКСТ · тот же промпт: 152-ФЗ vs GDPR
Российский контекст оценивался не только по полноте, но и по языковой чистоте ответа — ошибка здесь так же значима, как фактическая.
Nemotron 3 Ultra
Подробный, технически точный разбор (SCC, DPIA, отсутствие права на забвение в 152-ФЗ). Из недостатков — опечатка «гражданинский» вместо «гражданский» и избыточный объём для делового читателя.
Опечатка 170,8с
Nemotron 3 Super
Структурно сильный ответ — но дважды вместо русского текста «выполнение юридической обязанности» вставлены китайские иероглифы: «...защита жизненно важных интересов, выполнение法律义务...». Повторилось в двух разных местах одного ответа — не случайная опечатка, а системная утечка не того языка при генерации.
Китайские иероглифы в ответе 76,7с
MiniMax M3 · Лидер среди новых
Чистый русский язык, компактнее конкурентов, для деловой аудитории читается быстрее. Уместно сослался на реальный кейс — штраф Meta по GDPR (€1,2 млрд, 2023) — как наглядный ориентир масштаба риска.
Точный релевантный пример 31,3с
ЗАДАЧА 3 — ROI · тот же промпт: правильный ответ ROI = 470%, окупаемость 2,1 мес.
Две из трёх новых моделей допустили одну и ту же методологическую ошибку — посчитали чистую экономию (за вычетом подписки), а затем разделили её на полные затраты, где подписка уже учтена дважды.
Nemotron 3 Ultra — 2/5
Годовая экономия 14,82 млн — верно. Но ROI посчитан как 711% или 547% (два варианта, оба мимо цели из-за двойного учёта подписки) вместо 470%. Срок окупаемости — 1,7 мес. вместо 2,1.
711%/547% вместо 470%
Nemotron 3 Super — 4/5
Дал два варианта расчёта и явно выделил корректный: «Вариант Б — 12 220 000/2 600 000 × 100% ≈ 470%», окупаемость «≈2,1 месяца». Правильный ответ присутствует, но подан как один из двух равноправных вариантов, а не как основной.
470% и 2,1 мес. — оба варианта названы
MiniMax M3 — 2/5
Та же ошибка, что у Nemotron 3 Ultra: ROI = 2370% или 547% (оба мимо 470%). Срок окупаемости 64 дня ≈ 2 месяца — оказался близко к верному 2,1 мес., но получен другим, внутренне непоследовательным способом (через 365 дней в году вместо 12 месяцев).
2370%/547% вместо 470%

Выводы Полярного Теста · Раунд 2

🥇
YandexGPT Pro 5.1 — победитель второй раунд подряд (89/115). Единственная модель с идеальным счётом в математическом блоке. Лучший баланс качества, доступности и точности для российского бизнеса.
🥈
Claude Sonnet 4.6 — второе место (84/115). Также идеальный математический результат, лидер по фактической точности. Минус: требует VPN в России и долларовый биллинг.
🥉
MiniMax M3 — лучшая среди новых открытых моделей (78/115), протестирована бесплатно через OpenRouter. Чистый и компактный русский язык, но провалила расчёт ROI той же ошибкой, что и Nemotron 3 Ultra.
4-6
Nemotron 3 Super (72), GigaChat (67) и Nemotron 3 Ultra (68) — плотная группа в нижней половине таблицы. У Nemotron 3 Super — лучший математический блок среди новых моделей (14/15), но и самый заметный дефект: китайские иероглифы вместо русского текста в двух местах одного ответа. У GigaChat — по-прежнему неверная арифметика ROI. У Nemotron 3 Ultra — корректные цифры, но самая медленная скорость ответа во всём раунде (до 170 секунд на бесплатном тарифе).
⚠️
Наблюдение о надёжности: GLM 5.2 и Gemma 4 31B не удалось протестировать полностью — свободный лимит запросов на эти модели оказался исчерпан на уровне всей платформы OpenRouter, а не только нашего аккаунта. Даже успешно протестированные модели отвечали в 10–150 раз медленнее платных GigaChat/YandexGPT/Claude. Бесплатный доступ реален, но не заменяет промышленный тариф для регулярной бизнес-нагрузки.
📌
Вывод для бизнеса: Для большинства российских компаний — YandexGPT как основная модель, Claude как валидатор для критичных документов. GigaChat оправдан при работе с чувствительными данными (хранение в РФ). Бесплатные открытые модели через OpenRouter — рабочий вариант для разовых экспериментов и пилотов без бюджета, но не для продакшена: медленно, нестабильно на пике спроса, и, как показал Nemotron 3 Super, не застраховано от языковых сбоев.

Полярный Тест проведён AI Радар. Раунд 1 (GigaChat, YandexGPT Pro 5.1, Claude Sonnet) — июль 2026, оценка вручную. Раунд 2 (август 2026) добавил три модели — Nemotron 3 Ultra, Nemotron 3 Super, MiniMax M3 — протестированные напрямую через API OpenRouter (бесплатный тариф), с реально измеренным временем ответа и оценкой качества тем же автором по идентичной рубрике. GLM 5.2 и Gemma 4 31B тестировались, но исключены из таблицы из-за неполных данных (постоянная ошибка 429 на уровне платформы). Методология открытая — промпты доступны для воспроизведения.

Частые вопросы о Полярном Тесте

Что такое Полярный Тест?
Полярный Тест — открытая методология AI Радар для сравнения языковых моделей применительно к задачам российского бизнеса: качество русского языка, знание российских реалий, скорость, стоимость в рублях и доступность без VPN.
Какие модели протестированы в PT-2?
К трём моделям раунда PT-1 (GigaChat, YandexGPT Pro 5.1, Claude Sonnet) добавлены три открытые модели, протестированные напрямую через API OpenRouter: Nemotron 3 Ultra и Nemotron 3 Super от NVIDIA, MiniMax M3. Ещё две модели (GLM 5.2, Gemma 4 31B) тестировались, но не прошли полный набор задач из-за постоянных ошибок 429 (превышение лимита бесплатного тарифа на уровне платформы) и не включены в итоговую таблицу.
Какая модель победила в PT-2?
Победитель по-прежнему YandexGPT Pro 5.1 (89/115). MiniMax M3 стал лучшим среди новых открытых моделей (78/115), опередив GigaChat (67/115), но уступив Claude Sonnet (84/115).
По каким критериям оценивались модели в Полярном Тесте?
Шесть блоков: русский язык (20 баллов), российский контекст (20 баллов), бизнес-задачи (25 баллов), скорость и стоимость (20 баллов), надёжность для России (15 баллов), прикладная математика (15 баллов).
Чем PT-2 отличается по методологии от PT-1?
Три исходные модели оценены вручную автором, как и в PT-1. Три новые модели протестированы через реальные вызовы API OpenRouter (бесплатный тариф) с измеренным временем ответа, а качество ответов оценено тем же автором по идентичной рубрике — с проверкой математических задач по однозначно верным числовым ответам.