GigaChat 3.5 Ultra построена на гибридной архитектуре, сочетающей MLA (Multi-head Latent Attention) — механизм внимания, снижающий требования к памяти при инференсе, — и GatedDeltaNet, более новый подход к обработке длинного контекста с управляемым забыванием состояния. Комбинация даёт модели заметное преимущество по эффективности: несмотря на то что общее число параметров (432 млрд) меньше, чем у предшественника GigaChat 3.1 Ultra (700 млрд), в реальном инференсе новая модель использует в 4 раза меньше KV-кэша на токен и способна обрабатывать более чем вдвое больший контекст — то есть архитектурная эффективность выросла сильнее, чем формально сократилось число параметров.
Из 432 млрд параметров активны на каждом токене только 28 млрд — это классическая MoE-конструкция (mixture-of-experts), при которой модель условно «активирует» лишь часть своих весов под конкретный запрос, что снижает вычислительные затраты на инференс по сравнению с плотной моделью сопоставимого качества.
Веса GigaChat 3.5 Ultra опубликованы на HuggingFace и на российской платформе GitVerse под лицензией MIT — одной из самых разрешительных в индустрии: она допускает практически неограниченное коммерческое использование, модификацию и распространение производных моделей без обязательства делиться изменениями или платить лицензионные отчисления. Это отличает решение Сбера от более ограничительных подходов некоторых других лабораторий (например, требования делиться выручкой при крупном коммерческом использовании, как у Kimi K3 или в новой модели монетизации Qwen от Alibaba).
Публикация MIT-лицензированных весов флагманской модели такого масштаба — редкий шаг для крупного российского enterprise-игрока: до этого GigaChat в основном был доступен через API или частично открытые более младшие версии линейки, тогда как флагманский Ultra-тир обычно оставался закрытым.
Открытие весов флагманской модели под MIT-лицензией напрямую усиливает позицию GigaChat как основы для локального инференса под требования 152-ФЗ о персональных данных — российские компании, которым нужно развёртывать ИИ внутри собственного периметра без передачи данных за рубеж, получают доступ к модели корпоративного уровня без ограничений на коммерческое использование. Это также подтверждает более широкую стратегическую линию Сбера на суверенные и открытые модели, зафиксированную в законе об ИИ (подписан 26 июля): статус «суверенная модель» подразумевает не только российское происхождение, но и определённую степень прозрачности и доступности для государственного и корпоративного контроля.
Для рынка в целом появление ещё одной сильной открытой альтернативы снижает зависимость российских разработчиков от зарубежных открытых моделей (Llama, Qwen, DeepSeek) — до сих пор основной источник открытых весов корпоративного уровня, доступных для локального развёртывания в России.