Kimi K3: 2,8 трлн параметров и скрытые 51% галлюцинаций | AI Радар
Исследования

Moonshot AI открыла веса Kimi K3 на 2,8 трлн параметров — независимые тесты нашли скрытые 51% галлюцинаций

📅 27 июля 2026 ✍️ Александр Григорьев 🏷 Kimi K3 · Moonshot AI · открытые модели
Китайская Moonshot AI 27 июля открыла полные веса модели Kimi K3 — крупнейшей открытой языковой модели на рынке (2,8 трлн параметров, архитектура MoE, из 896 экспертов на каждый токен активируются лишь 16). При этом независимая оценка Artificial Analysis зафиксировала рост доли галлюцинаций до 51% при точности 46% — эти цифры отсутствуют в собственных бенчмарк-графиках Moonshot.
2,8 трлн
Параметров модели
16 из 896 экспертов активны
51%
Доля галлюцинаций
по Artificial Analysis
1 млн
Токенов контекста
у модели

Крупнейшая открытая модель на рынке

Kimi K3 стала доступна через хостинг-API Moonshot и потребительскую платформу kimi.com ещё 16 июля, а полные веса модели — то есть возможность самостоятельно развернуть модель на своих серверах без обращения к API компании — открылись только 27 июля. Формально это делает K3 крупнейшей открытой моделью, когда-либо выложенной публично: 2,8 трлн параметров общей ёмкости при architecture Mixture-of-Experts, где на каждый токен вычисления реально задействуют лишь 16 из 896 «экспертов» — примерно 1,8% от полного объёма параметров. Именно такая разреженная активация позволяет модели такого масштаба работать на приемлемой по стоимости инфраструктуре: цена $3 за миллион входных токенов ($0,30 при попадании в кеш) и $15 за миллион выходных — сопоставимо с ценами топовых моделей OpenAI и Anthropic, но при полностью открытых весах.

По независимым замерам Artificial Analysis Intelligence Index, K3 занимает четвёртое место среди всех фронтирных моделей — после Claude Fable 5, GPT-5.6 Sol и лишь немного отстаёт от третьего места, обгоняя при этом Claude Opus 4.8. Отдельно модель заняла первое место в рейтинге Frontend Code Arena, что указывает на её сильные стороны в задачах написания пользовательских интерфейсов и веб-кода.

Скандал: 51% галлюцинаций, о которых Moonshot не сообщила

Главная проблема релиза — не в качестве модели как таковом, а в прозрачности заявленных характеристик. Независимое тестирование Artificial Analysis показало, что доля галлюцинаций у K3 выросла до примерно 51% против 39% у предыдущего поколения Kimi K2. Формально модель одновременно стала точнее — доля фактически верных ответов выросла с 33% до 46% — но одновременно резко увеличилась доля случаев, когда модель выдаёт неверный ответ с уверенным, убедительным тоном, не сигнализируя о собственной неуверенности. Это опаснее, чем просто низкая точность: пользователь, не имеющий доступа к независимым бенчмаркам, не может отличить уверенный правильный ответ от уверенного неправильного.

Ключевая претензия сообщества в том, что этот показатель отсутствует в официальных материалах Moonshot: опубликованные компанией бенчмарк-графики демонстрируют рост качества модели, но не содержат данных о галлюцинациях вообще. Для сравнения, у модели Claude Fable 5 на том же независимом тесте зафиксирован показатель 54,9% — то есть K3 не является рекордсменом по этому параметру среди всех фронтирных моделей, но именно замалчивание метрики в собственной документации вызвало критику: разработчики, которые интегрируют модель в продукты без доступа к таким независимым тестам, рискуют получить искажённое представление о надёжности K3 в задачах, где важна фактическая точность, а не только «интеллект» в широком смысле.

AI Радар — Аналитический дашборд
Полная картина рынка ИИ России и мира
520 млрд ₽рынок ИИ России
+24%рост г/г
800+AI-компаний
$3.68 трлнпрогноз мир к 2030
На главную

Почему это важно для российского рынка ИИ

Для российских компаний открытые веса Kimi K3 представляют практический интерес: модель можно развернуть на собственной инфраструктуре внутри страны, не завязываясь на зарубежные API и связанные с ними риски отключения доступа. Это особенно актуально для организаций, которые подпадают под требования к локализации данных и не могут отправлять запросы к облачным API иностранных провайдеров. При этом 2,8 трлн параметров — это крайне требовательный к вычислительным ресурсам объём: даже с разреженной активацией 16 из 896 экспертов, полноценное развёртывание модели такого масштаба потребует серьёзного парка GPU, что делает её реалистичным выбором в первую очередь для крупных корпораций и исследовательских центров, а не для среднего бизнеса.

Показательный урок для российских разработчиков и интеграторов ИИ — не полагаться исключительно на маркетинговые бенчмарки вендора при выборе модели для продуктивных задач, особенно там, где важна фактическая точность (юридические заключения, медицинские консультации, финансовая аналитика). История с Kimi K3 наглядно показывает: даже топовая по общим показателям модель может иметь существенный, но не разглашённый недостаток в конкретном критически важном измерении. Практический вывод — перед внедрением любой новой модели в чувствительный продуктивный сценарий стоит прогонять собственные независимые тесты на галлюцинации, а не ограничиваться официальными материалами разработчика.

Что дальше

Moonshot AI пока не прокомментировала претензии по поводу отсутствия данных о галлюцинациях в своих официальных материалах. Учитывая масштаб внимания к релизу — крупнейшая открытая модель на рынке — можно ожидать, что независимые лаборатории продолжат публиковать собственные замеры по разным метрикам, включая факт-чекинг и устойчивость к провокационным запросам, что в течение ближайших недель даст более полную картину реальных возможностей и ограничений K3 по сравнению с закрытыми топовыми моделями.

📎 Первоисточник: Tech Times ↗