Публично доступна претрейн‑версия крупной языковой модели, обученной с нуля, с архитектурой Mixture of Experts; технические отчёты и бенчмарки доступны в открытом виде под лицензией Apache 2.0.
В составе модели — 80 млрд параметров, активны примерно 3 млрд на данный момент; архитектура относится к Mixture of Experts. В техдокументах отмечается, что для маршрутизации применяется подход без вспомогательных потерь, а 36 из 48 слоёв внимания реализуют механизм Kimi Delta Attention.
Разработчики называют это экспериментальной версией, которая тестирует архитектурные решения для будущей единой рассуждающей модели, которая станет базой для агентных возможностей.
Зачем это нужно
В июле один из крупных игроков заявил, что осталось лишь одна полностью отечественная фундаментальная ИИ‑модель; дообучение конкурентов продолжается, а ранее упомянутый флагман обучался на весах другой модели.
После релиза представители банка назвали модель компактной и одной из множества компактных языковых моделей; подчёркивается, что мировой ИИ‑развитие строится вокруг флагманских моделей на сотни миллиардов параметров.
Дебаты разворачиваются вокруг преференций суверенного ИИ: предлагают сделать его приоритетным для госуправления, школ и выборов, а также обсудить обязательное использование бизнеса даже если это дороже аналогов.
Продолжаются дискуссии о суверенном ИИ и роли крупных корпораций в развитии отрасли.