Kimi K3 стала доступна через хостинг-API Moonshot и потребительскую платформу kimi.com ещё 16 июля, а полные веса модели — то есть возможность самостоятельно развернуть модель на своих серверах без обращения к API компании — открылись только 27 июля. Формально это делает K3 крупнейшей открытой моделью, когда-либо выложенной публично: 2,8 трлн параметров общей ёмкости при architecture Mixture-of-Experts, где на каждый токен вычисления реально задействуют лишь 16 из 896 «экспертов» — примерно 1,8% от полного объёма параметров. Именно такая разреженная активация позволяет модели такого масштаба работать на приемлемой по стоимости инфраструктуре: цена $3 за миллион входных токенов ($0,30 при попадании в кеш) и $15 за миллион выходных — сопоставимо с ценами топовых моделей OpenAI и Anthropic, но при полностью открытых весах.
По независимым замерам Artificial Analysis Intelligence Index, K3 занимает четвёртое место среди всех фронтирных моделей — после Claude Fable 5, GPT-5.6 Sol и лишь немного отстаёт от третьего места, обгоняя при этом Claude Opus 4.8. Отдельно модель заняла первое место в рейтинге Frontend Code Arena, что указывает на её сильные стороны в задачах написания пользовательских интерфейсов и веб-кода.
Главная проблема релиза — не в качестве модели как таковом, а в прозрачности заявленных характеристик. Независимое тестирование Artificial Analysis показало, что доля галлюцинаций у K3 выросла до примерно 51% против 39% у предыдущего поколения Kimi K2. Формально модель одновременно стала точнее — доля фактически верных ответов выросла с 33% до 46% — но одновременно резко увеличилась доля случаев, когда модель выдаёт неверный ответ с уверенным, убедительным тоном, не сигнализируя о собственной неуверенности. Это опаснее, чем просто низкая точность: пользователь, не имеющий доступа к независимым бенчмаркам, не может отличить уверенный правильный ответ от уверенного неправильного.
Ключевая претензия сообщества в том, что этот показатель отсутствует в официальных материалах Moonshot: опубликованные компанией бенчмарк-графики демонстрируют рост качества модели, но не содержат данных о галлюцинациях вообще. Для сравнения, у модели Claude Fable 5 на том же независимом тесте зафиксирован показатель 54,9% — то есть K3 не является рекордсменом по этому параметру среди всех фронтирных моделей, но именно замалчивание метрики в собственной документации вызвало критику: разработчики, которые интегрируют модель в продукты без доступа к таким независимым тестам, рискуют получить искажённое представление о надёжности K3 в задачах, где важна фактическая точность, а не только «интеллект» в широком смысле.
Для российских компаний открытые веса Kimi K3 представляют практический интерес: модель можно развернуть на собственной инфраструктуре внутри страны, не завязываясь на зарубежные API и связанные с ними риски отключения доступа. Это особенно актуально для организаций, которые подпадают под требования к локализации данных и не могут отправлять запросы к облачным API иностранных провайдеров. При этом 2,8 трлн параметров — это крайне требовательный к вычислительным ресурсам объём: даже с разреженной активацией 16 из 896 экспертов, полноценное развёртывание модели такого масштаба потребует серьёзного парка GPU, что делает её реалистичным выбором в первую очередь для крупных корпораций и исследовательских центров, а не для среднего бизнеса.
Показательный урок для российских разработчиков и интеграторов ИИ — не полагаться исключительно на маркетинговые бенчмарки вендора при выборе модели для продуктивных задач, особенно там, где важна фактическая точность (юридические заключения, медицинские консультации, финансовая аналитика). История с Kimi K3 наглядно показывает: даже топовая по общим показателям модель может иметь существенный, но не разглашённый недостаток в конкретном критически важном измерении. Практический вывод — перед внедрением любой новой модели в чувствительный продуктивный сценарий стоит прогонять собственные независимые тесты на галлюцинации, а не ограничиваться официальными материалами разработчика.
Moonshot AI пока не прокомментировала претензии по поводу отсутствия данных о галлюцинациях в своих официальных материалах. Учитывая масштаб внимания к релизу — крупнейшая открытая модель на рынке — можно ожидать, что независимые лаборатории продолжат публиковать собственные замеры по разным метрикам, включая факт-чекинг и устойчивость к провокационным запросам, что в течение ближайших недель даст более полную картину реальных возможностей и ограничений K3 по сравнению с закрытыми топовыми моделями.