Лучшие нейросети 2026: рейтинг на основе реальных данных | AI Радар
Большой гайд

Лучшие нейросети 2026: рейтинг на основе реальных данных

📅 Обновлено 19.08.2026 ✍️ Александр Григорьев🏷 Тренды
Наберите в поиске «лучшие нейросети 2026» — и получите десяток статей с одинаковой структурой: «лучшая для текста», «лучшая для картинок», «лучшая для видео», без единой ссылки на то, откуда взялась оценка. Часто за такими списками стоят партнёрские ссылки на конкретные сервисы, а не измерения. Этот рейтинг устроен иначе: там, где у radarii.ru есть собственные данные — Полярный тест (PT-1) и отслеживаемый лидерборд открытого бенчмарка MERA — мы показываем баллы и ссылку на источник. Там, где своих измерений нет, мы прямо это говорим и опираемся на признанные открытые индексы — Artificial Analysis Intelligence Index и LMArena. Измерено — помечено зелёным, оценка редакции — оранжевым.
46
моделей
в каталоге сайта
3
модели протестированы
в Полярном тесте, раунд 1
8 из 46
моделей в открытом
MERA-лидерборде сайта
19.08.2026
дата обновления
этого рейтинга

Почему рейтингам нейросетей в интернете обычно нельзя доверять

Стоит открыть десяток топовых статей по запросу «лучшие нейросети 2026», и закономерность видна сразу. Площадки вроде Хабра публикуют материалы с пометкой «на правах рекламы», где «лучшей» неизбежно оказывается модель спонсора публикации. Обзорные сайты вроде Kluch.tv, StoneAI, AIBotManager или GPTunnel в основном зарабатывают на партнёрских ссылках — чем больше кликов на подписку конкретного сервиса, тем выше комиссия автора статьи, и это встроенный конфликт интересов, который редко проговаривается открыто. Даже более технически ориентированные издания вроде Computerra нередко пересказывают пресс-релизы разработчиков моделей без независимой проверки заявленных цифр.

Формат категорий усиливает проблему. «Лучшая нейросеть для текста», «лучшая для картинок», «лучшая для рассуждений» — звучит структурно, но за этими ярлыками почти никогда не стоит методология: непонятно, на каких задачах сравнивали модели, сколько раз запускали тест, кто выставлял оценку и не менялся ли победитель категории синхронно с обновлением партнёрской программы. Субъективное мнение одного автора, оформленное как объективный рейтинг, — самый частый обман в этой нише контента.

У radarii.ru здесь другая отправная точка. Сайт уже больше года ведёт собственный сравнительный тест нейросетей — Полярный тест (PT-1) — специально заточенный под то, что важно для использования моделей в России, и отдельно отслеживает результаты моделей на открытом российском бенчмарке MERA, где методология и итоговые баллы публикуются в открытом доступе, а не формулируются редакцией на глаз. Это не значит, что у нас есть измерение на любой вопрос — покрытие тестов пока ограничено, и мы говорим об этом прямо в разделе методологии ниже, а не маскируем пробелы уверенным тоном.

Методология: как считается этот рейтинг

🧭Три слоя данных, без смешивания источников

Рейтинг в этой статье строится на трёх раздельных источниках данных, и важно не путать их между собой — у каждого своя методология и свои ограничения.

Слой 1 — Полярный тест (PT-1), собственная методика radarii.ru. Это единственный слой данных, который сайт производит сам. Тест оценивает модели по шести блокам: качество русского языка (20 баллов), знание российского контекста (20), решение бизнес-задач (25), скорость и цена (20), надёжность работы из России (15) и прикладная математика (15) — максимум 115 баллов. Раунд 1 вышел в июле 2026 года и охватил три модели: YandexGPT Pro 5.1, Claude Sonnet 4.6 и GigaChat. Это честное и важное ограничение: тест пока не прошли, например, GPT-5.6, Gemini или DeepSeek — раунды выходят по мере ресурса на тестирование, а не одним махом на весь каталог. Полная методика и текущие результаты — на странице Полярный тест.

Слой 2 — MERA, открытый российский бенчмарк. MERA (mera.a-ai.ru) — независимый академический бенчмарк для оценки языковых моделей на русском языке с публичной методологией и открытым лидербордом. radarii.ru не проводит эти замеры сам, а отслеживает и агрегирует уже опубликованные результаты: на странице дашборда представлены 8 моделей из 46 в общем каталоге сайта с их баллами по MERA.

Слой 3 — признанные зарубежные индексы, там, где своих данных нет. Для категорий, которые не покрывают ни Полярный тест, ни MERA — генерация кода, изображений, видео, общие рассуждения на английском языке — мы используем данные Artificial Analysis Intelligence Index и LMArena (переименован в Arena в январе 2026 года). Оба индекса имеют открытую методологию: Artificial Analysis прогоняет модели по стандартизированному набору задач, LMArena собирает голоса живых пользователей в слепых парных сравнениях. У обоих есть общая особенность — цифры меняются еженедельно вместе с выходом новых версий моделей, поэтому мы указываем дату среза рядом с каждым таким числом и относимся к точным значениям с осторожностью, а не как к постоянной величине.

3/46
Из 46 моделей в каталоге radarii.ru напрямую протестированы сайтом в раунде 1 Полярного теста только три — остальные оценки в этой статье опираются на открытые сторонние источники, что явно помечено по тексту.

Итоговое правило простое: если рядом с цифрой стоит пометка измерено — это результат конкретного теста с указанным источником. Если стоит пометка оценка — это качественная характеристика на основе открытых обзоров, не претендующая на точность до десятых долей балла.

Отдельно стоит сказать, почему мы не пытаемся закрыть пробелы Полярного теста собственными «примерными» цифрами по остальным 43 моделям каталога. Соблазн понятен — таблица со всеми моделями сразу выглядит внушительнее одной с тремя строками. Но заполнение пустых ячеек числами, которые никто не измерял, — это ровно та практика, за которую мы критикуем конкурентов в начале статьи. Честнее признать текущий охват узким и расширять его раундами, чем выдавать оценку редакции за результат теста.

AI Радар — Аналитический дашборд
Полная картина рынка ИИ России и мира
520 млрд ₽рынок ИИ России
+24%рост г/г
800+AI-компаний
$3.68 трлнпрогноз мир к 2030
На главную

Топ нейросетей для текста и рассуждений

✍️Общий зачёт и логические задачи — разные вещи

В категории «текст и рассуждения» стоит сразу развести два разных навыка, которые в маркетинговых материалах разработчиков часто сливаются в одно: способность писать связный, стилистически уместный текст — и способность решать многошаговые логические и математические задачи (reasoning). Модель может быть отличным редактором и посредственным математиком, и наоборот.

По открытому лидерборду MERA, который отслеживает radarii.ru, среди моделей каталога сайта в общем зачёте лидирует Claude Opus 4.6 с результатом 0,862 — это выше даже человеческого ориентира на этом бенчмарке. Дальше с заметным отрывом идут российские модели: BerryLM-XL от Wildberries и «Руси» с результатом 0,835 и Cotype Pro 3 от MWS AI — 0,824, обе опережают GPT-5.4 от OpenAI с результатом 0,821. Это не опечатка и не ошибка агрегации: на конкретно этом открытом бенчмарке пара менее раскрученных российских моделей на практике обходит по баллу флагманскую западную модель, что само по себе интересный и не самый очевидный факт.

Топ-4 по общему баллу MERA среди моделей каталога radarii.ru измерено
Claude Opus 4.6
0,862
BerryLM-XL
0,835
Cotype Pro 3
0,824
GPT-5.4
0,821
Источник: открытый лидерборд MERA, агрегировано на странице дашборда radarii.ru (8 моделей из 46 в каталоге). Полный список постоянно пополняется по мере публикации новых результатов на самом бенчмарке.

Оценка — по данным индекса Artificial Analysis Intelligence Index (август 2026, свыше 170 протестированных моделей) в верхней части общего рейтинга удерживаются модели семейства Claude — Claude Opus 5 и Claude Fable 5 (актуальные версии линейки Anthropic на конец лета 2026), с плотной группой преследователей из Grok 4.6 от SpaceXAI и линейки GPT-5.6 от OpenAI. Разрывы между top-5 моделями индекса измеряются буквально одним-двумя баллами из ста, поэтому говорить о едином и стабильном «победителе» по общим рассуждениям в 2026 году уже не совсем корректно — скорее о группе моделей сопоставимого уровня, где выбор решает не абсолютный балл, а конкретная задача, цена и доступность.

Отдельно про математические и научные рассуждения: по открытым замерам на бенчмарке уровня выпускника вуза (GPQA Diamond) заметно выделяется Gemini 3.1 Pro от Google — это область, где Google исторически инвестировала сильнее конкурентов. Для рутинных текстовых задач на русском языке — черновики писем, посты, объяснения — по Полярному тесту разрыв между моделями не критичен: даже занявшая третье место в раунде 1 модель решает большинство повседневных задач приемлемо, разница проявляется в основном на сложных и объёмных материалах.

Топ нейросетей для кода

💻Данные противоречивы сильнее, чем в любой другой категории

Честная оговорка: категория «лучшая нейросеть для кода» — там, где открытые источники расходятся сильнее всего. Разные тестовые площадки используют разные версии бенчмарка SWE-bench (Verified, Pro, с разной обвязкой-«скаффолдингом» вокруг модели), и один и тот же вопрос «какая модель лучше пишет код» может дать результат от «Claude лидирует с большим отрывом» до «GPT-5.6 обходит всех» в зависимости от того, какую методику взяли за основу. У radarii.ru нет собственного измерения по коду, поэтому все цифры в этом разделе — это оценка по совокупности открытых источников, а не единая проверенная цифра.

С этой оговоркой общая картина на конец лета 2026 года выглядит так. Модели семейства Claude Opus чаще всего называют лидером именно в агентном кодинге — то есть в сценарии, где модель не просто пишет фрагмент кода по запросу, а самостоятельно чинит баги в реальном репозитории за несколько шагов, включая запуск тестов и правку по их результатам. GPT-5.6 в ряде замеров вырывается вперёд по чистому проценту решённых задач на стандартизированных бенчмарках. Gemini 3.1 Pro регулярно попадает в тройку лидеров и особенно хорошо показывает себя там, где код завязан на математику или анализ данных. DeepSeek V4 заметно отстаёт по глубокому пониманию контекста на русском языке, но по соотношению цены и качества на коде и многоязычных задачах — один из самых убедительных вариантов на рынке: разница в цене API с российскими и западными аналогами может достигать 5-8 раз.

Практический вывод для разработчика в России: для больших агентных задач и код-ревью в сложных проектах разумно тестировать Claude и GPT-5.6 — оба доступны по API, вопрос упирается в оплату из России (подробнее — в разделе про цены ниже). Для больших объёмов рутинных запросов, где счёт идёт на десятки тысяч обращений в месяц, DeepSeek стоит рассмотреть исключительно из экономических соображений. Готовые примеры запросов для типовых задач разработчика — в статье «Промпты для кода и code review», обзор инструментов по профессии — в статье «Нейросети для программиста».

Топ нейросетей для генерации изображений

🎨Не существует одной универсально лучшей модели

В генерации изображений единого лидера нет по определению — слишком по-разному устроены задачи. Оценка по открытым обзорам и сравнениям на конец лета 2026 года: для художественных, атмосферных иллюстраций и концепт-арта индустрия по-прежнему чаще всего называет Midjourney — модель заметно слабее понимает русскоязычные промпты и рассчитана на формулировки на английском. Для фотореалистичных изображений в высоком разрешении заметно выделяются модели линейки Nano Banana и Imagen от Google.

Для русскоязычных задач без VPN и без оплаты иностранной картой лучший вариант — Kandinsky от Сбера: бесплатен, нативно понимает русский язык и контекст, работает напрямую из России. По тонкости деталей и художественной выразительности он пока уступает топовым мировым моделям, но для черновиков соцсетей, обложек и быстрой проверки визуальной гипотезы этого более чем достаточно. Аналогичную нишу закрывает Шедеврум от Яндекса — тоже бесплатный и простой в освоении сервис для несложных задач на русском.

Практический ориентир по выбору: если нужен точный, детально проработанный визуал под конкретный бренд-гайд и бюджет позволяет — начинайте с Midjourney или Nano Banana Pro. Если нужен быстрый бесплатный черновик на русском без оплаты картой — Kandinsky или Шедеврум. Пошаговая инструкция — в статье «Как создать изображение нейросетью», готовые формулировки промптов — в статье «Промпты для генерации картинок», обзор задач дизайнера — в статье «Нейросети для дизайнера».

Топ нейросетей для генерации видео

🎬Самая быстро меняющаяся категория в этом рейтинге

Видеогенерация — хорошая иллюстрация того, почему рейтинг нейросетей вообще не может быть статичным документом. Ещё в начале 2026 года одним из заметных игроков категории был Sora 2 от OpenAI — но 26 апреля 2026 года компания официально прекратила потребительский доступ к модели, а API отключается 24 сентября 2026 года. Модель, которая полгода назад претендовала на лидерство, к моменту публикации этой статьи уже выводится из эксплуатации — нагляднее не покажешь, зачем нужна дата последнего обновления рядом с любым рейтингом ИИ.

Оценка по открытым трекерам категории на конец лета 2026 года: в верхней части рейтингов сейчас закрепились Google Veo 3.1 (выделяется поддержкой синхронной генерации звука в высоком качестве), китайская Kling 3.0 (умеет генерировать один ролик с несколькими сменами ракурса камеры без потери консистентности героя — заметный технический скачок для индустрии) и Seedance 2.0 от ByteDance. Runway Gen-4.5, которая лидировала на старте в конце 2025 года, к середине 2026-го выпала из топ-10 — ещё один пример того, как быстро перестраивается расстановка сил в этой категории.

По цене за ролик один из самых доступных вариантов на рынке — Kling 3.0 Standard, около $0,84 за десятисекундный клип со звуком; западные модели уровня Veo обычно обходятся дороже, особенно в облегчённых тарифах, рассчитанных на массовое использование. Для российских пользователей ключевой практический вопрос — не столько качество, сколько доступность оплаты и наличие VPN, поскольку прямого биллинга из России у большинства перечисленных сервисов нет. Обзор задач монтажа — в статье «Нейросети для монтажа видео», инструкция по анимации фото — в статье «Как создать видео из фото нейросетью».

Российские модели отдельно: GigaChat и YandexGPT

🇷🇺Здесь у нас есть собственное прямое измерение

Это единственный раздел рейтинга, где у radarii.ru есть прямое измерение по обеим ключевым российским моделям — именно ради такого сравнения и задумывался Полярный тест. В раунде 1 (июль 2026) тестировались GigaChat и YandexGPT Pro 5.1, а также Claude Sonnet 4.6 в качестве внешней точки отсчёта. Результат: YandexGPT Pro 5.1 — 89 из 115 баллов и первое место, Claude Sonnet 4.6 — 84 из 115 и второе место, GigaChat — 67 из 115 и третье место.

Полярный тест PT-1, раунд 1 — итоговый балл из 115 измерено
YandexGPT Pro 5.1
89 / 115
Claude Sonnet 4.6
84 / 115
GigaChat
67 / 115
Источник: Полярный тест (PT-1), radarii.ru/benchmark. Тест по шести блокам: русский язык, российский контекст, бизнес-задачи, скорость и цена, надёжность, прикладная математика. Раунд 1 — июль 2026.

Важно, что YandexGPT обошла не только GigaChat, но и зарубежную Claude Sonnet 4.6 — именно за счёт блоков, заточенных под российскую специфику: знание контекста, интеграция с поиском и сервисами Яндекса, стабильная работа без VPN. Это ровно та ситуация, где универсальный мировой рейтинг вроде LMArena или Artificial Analysis дал бы другую картину — на них Claude обычно опережает обе российские модели, — но для задачи «нейросеть для работы из России на русском языке» локальный тест оказывается показательнее.

У GigaChat при этом есть свои сильные стороны, которые не полностью отражены в итоговом балле PT-1. Модель поставляется с изначально встроенной генерацией изображений через Kandinsky — удобно, если нужен единый инструмент и для текста, и для визуала без переключения между сервисами. С 1 февраля 2026 года Сбер примерно втрое снизил цены на платный доступ к API, что делает GigaChat одним из самых доступных вариантов по деньгам среди моделей с российской юрисдикцией данных.

И ещё один нюанс, который стоит держать в голове: «лучшая российская модель» — не всегда синоним GigaChat или YandexGPT. Как показано в разделе про текст выше, на открытом бенчмарке MERA в топе общего зачёта среди российских разработок оказываются менее раскрученные модели — BerryLM-XL от Wildberries и Cotype Pro 3 от MWS AI, обе с результатом выше, чем у GPT-5.4. Рынок российских LLM заметно шире двух самых известных брендов, и по конкретным задачам стоит проверять актуальный расклад, а не полагаться на узнаваемость названия. Прямое сравнение GigaChat и YandexGPT под бизнес-задачи — в статье «GigaChat или YandexGPT для бизнеса».

Как выбрать модель под свою задачу

Рейтинг с одним «победителем» — удобный формат для статьи, но плохой ориентир для реального выбора: у разных пользователей разные приоритеты, и модель, оптимальная для одного сценария, может быть избыточной или неудобной для другого. Ниже — рамка из четырёх вопросов, которая помогает сузить выбор быстрее, чем чтение сравнительных таблиц.

Вопрос 1 — какой тип задачи преобладает? Для текста на русском в бизнес-контексте — смотрите на верхние строчки Полярного теста. Для кода — на модели семейства Claude и GPT-5.6, с оглядкой на DeepSeek при большом объёме запросов. Для визуала — разделяйте художественные задачи (Midjourney) и задачи на русском без VPN (Kandinsky, Шедеврум).

Вопрос 2 — критична ли работа без VPN и оплата российской картой? Если да — круг сужается до GigaChat, YandexGPT, Kandinsky, Шедеврум и российских голосовых ассистентов; все ведущие зарубежные модели требуют обходных путей для доступа и оплаты, что добавляет и стоимость, и организационный риск.

Вопрос 3 — где будут храниться данные? Для работы с персональными данными клиентов, договорами и другой чувствительной информацией приоритет — за моделями с российской юрисдикцией хранения данных и корпоративными тарифами с гарантией неиспользования переписки для обучения. Загрузка таких данных в бесплатный публичный интерфейс любой модели, включая российские, — плохая практика вне зависимости от рейтинга модели.

Вопрос 4 — насколько высока цена ошибки? Чем выше цена ошибки конкретной задачи — юридический документ, финансовый расчёт, коммуникация с ключевым клиентом — тем меньше смысла экономить на топовой модели и тем важнее обязательная проверка результата человеком, независимо от того, какая модель эту задачу выполняла.

Сценарий · Копирайтер-фрилансер
Приоритет — качество текста на русском и цена подписки. Разумная отправная точка — YandexGPT или GigaChat для повседневных черновиков, с точечным обращением к Claude или GPT-5.6 через агрегатор для сложных или объёмных материалов, где важны тонкие нюансы стиля.
Сценарий · Разработчик в продуктовой команде
Приоритет — качество агентного кодинга и интеграция с рабочими инструментами. Разумная отправная точка — Claude или GPT-5.6 по API для основной работы, DeepSeek — для вспомогательных задач с большим объёмом обращений, где важна цена за токен.
Сценарий · Владелец бизнеса с персональными данными клиентов
Приоритет — соответствие требованиям к хранению данных в России. Разумная отправная точка — GigaChat или YandexGPT на корпоративном тарифе с гарантией неиспользования данных, а не бесплатный публичный интерфейс любой модели.

Новичкам, которые ещё не определились даже с первым инструментом, полезнее будет более базовый разбор в статье «Какая нейросеть лучше для начинающих». Для тех, кто уже работает с несколькими моделями и хочет выстроить эффективную комбинацию под разные задачи, — статья «Связка нейросетей для работы».

Ещё один рабочий принцип, который редко проговаривают в статьях-рейтингах: выбор модели — это не решение на год вперёд. Подписки на большинство сервисов помесячные, а API можно подключать и отключать без штрафов, поэтому нет смысла держаться за однажды выбранный инструмент из инерции. Разумная практика — пересматривать используемый набор моделей раз в квартал, особенно если задача достаточно объёмная, чтобы разница в качестве или цене ощутимо влияла на бюджет или результат.

Цены и доступность из России

💳Формальная цена и реальная стоимость доступа — разные числа

Для большинства зарубежных моделей номинальная цена подписки и реальная стоимость для пользователя из России — не одно и то же. У OpenAI, Anthropic и Google нет официального биллинга на территории России, поэтому оплата идёт через посредников — иностранную карту, зарубежный Apple ID или Stripe-чекаут, — и к базовой цене добавляется курсовая разница и комиссия посредника.

СервисОфициальная ценаОсобенность доступа из России
ChatGPT Plus$20/месНет прямого биллинга РФ; фактическая стоимость с учётом посредников — ориентировочно 2 500-3 000 ₽/мес
Claude Pro$20/месАналогично ChatGPT — оплата через зарубежные платёжные инструменты
Google AI Pro (Gemini)$19,99/месТребует зарубежного аккаунта Google для оплаты
GigaChatот 0 ₽ до ~30 000 ₽/месПрямая оплата рублями; с 01.02.2026 цены на API снижены примерно втрое
YandexGPT / Алиса Проот 0 ₽, подписка ~169 ₽/месПрямая оплата рублями, работает без VPN
DeepSeek (API)от $0,14 за 1M входных токеновТребует иностранной карты для оплаты API, данные обрабатываются за пределами РФ

Цены в таблице — ориентировочные и меняются чаще, чем обновляется эта статья: у GigaChat и YandexGPT — из-за конкуренции друг с другом на российском рынке, у зарубежных моделей — из-за курса валют и условий конкретных посредников. Прежде чем принимать решение по бюджету на месяц вперёд, стоит свериться с актуальным тарифом на сайте самого сервиса. Подробный разбор способов оплаты — в статье «Чем заменить ChatGPT в России», а стоимость подписок по всем крупным сервисам за 2026 год — в статье «Сколько стоит подписка на нейросети в 2026 году».

Отдельная практическая деталь для тех, кто считает бюджет на объём запросов, а не на подписку физлица: разница в цене API между DeepSeek и российскими моделями достигает 5-8 раз в пользу DeepSeek, но при этом полностью снимается вопрос хранения данных на территории России и качества понимания русскоязычного контекста — для чувствительных задач это может перевесить любую экономию.

Как часто обновляется рейтинг и почему топ меняется быстро

2026 год ещё раз подтвердил, что рейтинг нейросетей — это не статичный список, а снимок состояния рынка на конкретную дату. Модель, которая полгода назад заслуженно возглавляла категорию, может быть снята с эксплуатации к моменту, когда читатель открывает статью — история с деприкейшеном Sora 2 в апреле 2026 года тому пример, а не исключение. Только за первую половину года в топ-10 по видеогенерации сменилось больше половины состава.

PT-1
Раз в 1-2 месяца
Новый раунд Полярного теста
По мере накопления заметных обновлений моделей и появления ресурса на полноценное тестирование — раунд 2 расширит список протестированных моделей за пределы текущих трёх.
MERA
По мере публикации
Синхронизация с лидербордом MERA
Данные подтягиваются на дашборд сайта, как только на самом бенчмарке появляются новые официальные результаты моделей.
AA/Arena
При каждом обновлении статьи
Сверка с внешними индексами
Данные Artificial Analysis и LMArena актуализируются вручную при пересмотре материала — с указанием даты сверки, а не «вечнозелёными» цифрами без даты.

Практический вывод для читателя: относитесь к любому рейтингу нейросетей, включая этот, как к снимку на конкретную дату, а не как к постоянной истине. Если решение о выборе модели критично для бизнеса, перед покупкой годовой корпоративной лицензии стоит свериться с датой обновления материала и, по возможности, протестировать пару кандидатов на собственной задаче — рейтинг сужает выбор до нескольких разумных вариантов, но не заменяет проверку на реальном use case.

📝 Материал обновляется по мере выхода новых раундов Полярного теста, обновления лидерборда MERA и актуализации внешних индексов. Дата последней сверки данных — 19.08.2026.

Частые вопросы

01Как считается этот рейтинг и чем он отличается от других топов нейросетей в интернете?
Рейтинг строится на трёх слоях данных: собственном Полярном тесте (PT-1) сайта radarii.ru, открытом российском бенчмарке MERA и признанных зарубежных индексах — Artificial Analysis Intelligence Index и LMArena (Arena). В отличие от большинства статей в выдаче, где категории вроде «лучшая для текста» основаны на мнении редакции без ссылки на источник, здесь у каждой цифры указано её происхождение, а там, где измерений нет, стоит прямая пометка «оценка», а не выдуманный балл.
02Какая нейросеть в 2026 году лучше всего для повседневных задач на русском языке?
По результатам Полярного теста (PT-1) — YandexGPT Pro 5.1 с результатом 89 из 115 баллов, с очень небольшим отрывом от Claude Sonnet 4.6 (84 из 115) и заметно опережая GigaChat (67 из 115) на тестируемых пока трёх моделях. Для задач без строгого требования к российской специфике по открытым международным индексам чаще лидируют модели семейства Claude и GPT-5.6.
03Чем Полярный тест (PT-1) отличается от MERA?
MERA — открытый академический бенчмарк, который оценивает модели по широкому набору формальных задач и языковых способностей без привязки к конкретной стране использования. Полярный тест — собственная методика radarii.ru, которая специально смотрит на то, что важно бизнесу в России: качество русского языка, знание российских реалий, скорость и цену в рублях, доступность без VPN и надёжность. Это разные линзы на одни и те же модели, и результаты по ним закономерно не всегда совпадают.
04Почему в рейтинге участвуют не все 46 моделей из каталога сайта?
Полный сравнительный тест — трудоёмкий процесс, который занимает время на каждую модель, поэтому Полярный тест выходит раундами: в первом раунде (июль 2026) протестированы три модели. Лидерборд MERA на сайте отслеживает 8 моделей из 46, у остальных пока нет опубликованного результата на этом бенчмарке. Рейтинг обновляется по мере появления новых данных, а не собирается за один присест.
05Какая нейросеть лучше — GigaChat или YandexGPT?
По Полярному тесту YandexGPT Pro 5.1 набрала больше баллов, чем GigaChat, в первую очередь за счёт бизнес-задач и работы с российским контекстом. Но у GigaChat есть свои сильные стороны — например, встроенная генерация изображений через Kandinsky и агрессивное снижение цен на API в начале 2026 года. Подробное сравнение — в статье «GigaChat или YandexGPT для бизнеса».
06Можно ли доверять зарубежным бенчмаркам вроде Artificial Analysis и LMArena?
Это признанные в индустрии источники с открытой методологией, и мы используем их данные там, где своих измерений нет — например, для видео- и кодовых моделей. Но у них есть ограничения: цифры меняются еженедельно с выходом новых версий моделей, а часть замеров зависит от конкретной обвязки (scaffolding), в которой тестировалась модель. Мы указываем дату среза и источник рядом с каждой такой цифрой, чтобы было понятно, насколько она свежая.
07Какая нейросеть для генерации изображений бесплатна и работает без VPN?
Kandinsky от Сбера и Шедеврум от Яндекса — обе бесплатны, нативно понимают русский язык и работают из России напрямую. По художественной выразительности они пока уступают топовым мировым моделям вроде Midjourney, но для черновиков, соцсетей и быстрых визуальных гипотез этого обычно достаточно.
08Стоит ли выбирать DeepSeek ради экономии?
Если критична цена за миллион токенов API, DeepSeek — один из самых дешёвых вариантов на рынке при конкурентном качестве на коде и рассуждениях. Компромисс — более слабое, чем у GigaChat и YandexGPT, понимание русского языка и российского контекста, а также вопросы к тому, где и как хранятся данные запросов. Для англоязычных и кодовых задач с высоким объёмом обращений это часто оправданный выбор, для чувствительной русскоязычной переписки — нет.
09Как часто вы обновляете этот рейтинг?
Раунды Полярного теста выходят по мере накопления заметных обновлений моделей, ориентировочно раз в один-два месяца. Данные MERA подтягиваются по мере публикации новых результатов на самом бенчмарке. Цифры из внешних индексов вроде Artificial Analysis мы актуализируем при каждом обновлении статьи — дата последней сверки указана внизу материала.