Опубликована претрейн‑версия крупной языковой модели в открытом доступе

Публично доступна претрейн‑версия крупной языковой модели, обученной с нуля, с архитектурой Mixture of Experts; технические отчёты и бенчмарки доступны в открытом виде под лицензией Apache 2.0.

В составе модели — 80 млрд параметров, активны примерно 3 млрд на данный момент; архитектура относится к Mixture of Experts. В техдокументах отмечается, что для маршрутизации применяется подход без вспомогательных потерь, а 36 из 48 слоёв внимания реализуют механизм Kimi Delta Attention.

Разработчики называют это экспериментальной версией, которая тестирует архитектурные решения для будущей единой рассуждающей модели, которая станет базой для агентных возможностей.

Зачем это нужно

В июле один из крупных игроков заявил, что осталось лишь одна полностью отечественная фундаментальная ИИ‑модель; дообучение конкурентов продолжается, а ранее упомянутый флагман обучался на весах другой модели.

После релиза представители банка назвали модель компактной и одной из множества компактных языковых моделей; подчёркивается, что мировой ИИ‑развитие строится вокруг флагманских моделей на сотни миллиардов параметров.

Дебаты разворачиваются вокруг преференций суверенного ИИ: предлагают сделать его приоритетным для госуправления, школ и выборов, а также обсудить обязательное использование бизнеса даже если это дороже аналогов.

Продолжаются дискуссии о суверенном ИИ и роли крупных корпораций в развитии отрасли.