Китайский гигант: Moonshot AI представляет Kimi K3
Moonshot AI выпустила Kimi K3 — открытую модель с 2,8 триллионами параметров, запущенную 16 июля. Это крупнейшая открытая весовая модель на сегодняшний день, которая по масштабу попадает в так называемый класс 3T — категорию, куда ранее ни одна публично доступная модель не входила. Модель поддерживает контекст до одного миллиона токенов и работает в нативном мультимодальном режиме.
Kimi K3 уже привлекла внимание всего ИИ-сообщества: Kimi Delta Attention обеспечивает до 6,3-кратное ускорение декодирования в контекстах на миллион токенов, а механизм Attention Residuals повышает эффективность обучения на ~25% при дополнительных затратах менее 2%. Веса модели станут доступны 27 июля.
Архитектура нового поколения: как работает Kimi K3
Главная инженерная находка K3 — использование подхода mixture-of-experts (смесь экспертов). Вместо того чтобы запускать всю модель для каждого сгенерированного слова, Kimi K3 разбивает свои 2,8 триллиона параметров на 896 специализированных секций и активирует лишь 16 из них одновременно — это около 1,8% от общего числа. Расчёт на одно слово резко сокращается, однако объём памяти не уменьшается: все параметры по-прежнему должны быть загружены и готовы к вызову.
Второе ключевое решение — квантование с осознанным обучением (quantization-aware training): K3 работает на точности четыре бита на параметр вместо стандартных шестнадцати. Moonshot применила этот метод начиная со стадии дообучения и объяснила выбор «широкой совместимостью с оборудованием» — формулировка, которую стоит рассматривать как страховку от зависимости от чипов NVIDIA. Независимый анализ показывает, что в таком формате модель занимает около 1,4 ТБ против 5,6 ТБ при полной точности.
Для обслуживания модели Moonshot интегрировала код кэширования в открытый проект vLLM, что, по заявлению компании, позволяет ценообразовать K3 конкурентоспособно несмотря на её размер. Рекомендуемая конфигурация — 64 и более ускорителей, объединённых в единой пул памяти.
Память вместо вычислений: стратегия обхода ограничений
Два фактора определяют стоимость запуска крупной модели: вычислительная нагрузка на каждое слово и объём памяти, который должен быть постоянно доступен. Экспортный контроль ударил по Китаю прежде всего по первому, и архитектура K3 выглядит как целенаправленная попытка тратить меньше вычислительных ресурсов. Однако Moonshot пошла дальше: компания переместила узкое место с вычислений на память, которая собирается из множества отдельных, по отдельности непримечательных чипов.
Такой подход лежит в основе систем Huawei CloudMatrix и указывает на реальный обходной путь: память можно агрегировать across множество чипов, тогда как обучающие вычисления собрать аналогичным образом невозможно. Тесты Moonshot проводились на NVIDIA H200S и на «GPGPU от альтернативного вендора» (имя которого компания не раскрывает), а бенчмарки — на NVIDIA L20, урезанной карте, поставляемой в Китай в рамках экспортных правил. Блог компании не уточняет, где именно расположено оборудование H200, а Палата представителей США в январе приняла законопроект о закрытии лазейки с арендой облачных мощностей за рубежом, через которую китайские компании получали доступ к ограниченным ускорителям.
Что это значит для бизнеса в Азиатско-Тихоокеанском регионе
Практический вопрос для региональных компаний — не то, возглавит ли K3 рейтинг бенчмарков, а то, насколько модель такого масштаба вообще разворачиваемая. Предприятия Азии обращаются к открытым весам по трём причинам: цена, суверенитет данных и языковое покрытие региона. Банки и страховые компании Юго-Восточной Азии уже тестируют самостоятельное хостинг-развертывание открытых моделей, чтобы данные никогда не покидали их собственные системы.
Тот факт, что Китай в августе 2025 года на торговых переговорах просил облегчения именно по ограничениям на высокополосную память, а не по литографии или доступу к TSMC, — показательный сигнал о том, что именно память является реальным узким местом отечественной полупроводниковой промышленности. Локальное производство высокополосной памяти в этом году оценивается примерно в два миллиона стэков — этого хватит примерно на 250 000–300 000 чипов уровня Huawei Ascend 910C, тогда как у SMIC есть пластинная мощность более чем на миллион единиц. Вопрос остаётся открытым: сможет ли K3 стать реальной альтернативой закрытым западным моделям для азиатского бизнеса — или её масштаб окажется скорее декларацией амбиций, чем рабочим инструментом.
