Ставка не на размер, а на экономику работы

Moonshot AI выпустила очередную версию своей кодовой модели. Общее число параметров осталось прежним — триллион, — а работа велась над другим: качеством выполнения длинных цепочек инструкций и стоимостью эксплуатации.

Заявленный результат — расход токенов на 30% меньше предшественницы при сопоставимом или лучшем качестве. Для агентных сценариев, где модель работает часами и генерирует огромные объёмы промежуточных рассуждений, это прямая экономия.

Интереснее всего здесь то, что модель выпущена под лицензией MIT и может разворачиваться на собственной инфраструктуре. Разберём, что для этого нужно.

Архитектура

В основе — «смесь экспертов»: суммарно триллион параметров, но на каждый токен активируется лишь 32 миллиарда.

Технические параметры:

Параметр Значение
Структура 1 плотный слой + 61 слой MoE
Механизм внимания Multi-Head Latent Attention
Функция активации SwiGLU
Эксперты 384 всего, на токен активируются 8 специализированных + 1 общий
Словарь 160 000 токенов
Контекстное окно 256 000 токенов

Расширенное контекстное окно особенно ценно при работе с крупными кодовыми базами: модель удерживает начало сессии даже в длинных диалогах и не теряет ранее принятые решения.

Поддерживается и мультимодальный ввод через отдельный визуальный кодировщик на 400 миллионов параметров — можно подавать скриншоты интерфейсов, схемы и диаграммы.

Что изменилось

Четыре ключевых нововведения относительно предыдущей версии.

Принудительное сохранение рассуждений. Промежуточные выводы модели не обрезаются и не теряются между шагами агентной итерации. Режим нельзя отключить — стабильность цепочки рассуждений обеспечена конструктивно.

Это решает известную проблему длинных агентных сессий: модель, потерявшая ход собственных рассуждений, начинает противоречить своим же ранним решениям и ходить по кругу.

Квантование INT4. Собственная схема, отработанная на предыдущих моделях линейки. Снижает требования к видеопамяти при развёртывании через распространённые движки инференса.

Меньше галлюцинаций. Ранние отзывы фиксируют сокращение зацикленных и ошибочных рассуждений.

Экономия токенов на 30%. Ключевой практический выигрыш: тот же объём работы при меньшем расходе вычислительных ресурсов.

Результаты тестов

По опубликованным данным, прирост относительно предыдущей версии заметный, хотя топовым проприетарным моделям она пока уступает:

Тест Предыдущая версия K2.7 Code GPT-5.5 Claude Opus 4.8
Kimi Code Bench v2 50,9 62,0 69,0 67,4
Software Bench 48,3 53,6 69,1 63,8
MLS Light Bench 35,1 35,5 42,8
Kimi Claw 24/7 Bench 42,9 46,9 52,8 50,4
MCP Bench 69,4 76,0 79,4 81,3

Наиболее заметен рост на первом тесте — более 11 пунктов. В агентных сценариях прибавка около 4 баллов, что разработчики связывают напрямую с принудительным сохранением рассуждений.

Стандартная оговорка: часть тестов разработана самой компанией, и к таким результатам стоит относиться сдержаннее, чем к независимым.

Развёртывание на своём железе

Здесь самое интересное для тех, кто рассматривает собственную инфраструктуру.

Лицензия MIT — модель можно использовать и в коммерческих проектах без дополнительных ограничений. Это принципиальное отличие от проприетарных моделей, доступных только через API.

Совместимость с распространёнными движками инференса позволяет запускать её на своих серверах, не завися от облачных провайдеров.

Требования к железу. И здесь важный момент, который легко упустить: память нужна под все параметры, а не под активные. Активируются 32 миллиарда, но в память должен поместиться весь триллион — заранее неизвестно, какие эксперты понадобятся следующему токену.

Это означает серверную конфигурацию с несколькими ускорителями высокого класса. Квантование INT4 частично снижает планку, но не отменяет её принципиально.

Обещанное ускорение. Разработчики анонсировали высокоскоростной режим инференса с ускорением более чем в 6 раз в ближайшем обновлении. Если заявленное подтвердится, экономика эксплуатации изменится заметно.

Кому это интересно

Компаниям с требованиями к данным. Код не покидает контур — решающий аргумент там, где исходники нельзя отправлять во внешние сервисы.

Тем, у кого большой объём агентной работы. При постоянной нагрузке собственная инфраструктура окупается против оплаты за токены, а экономия в 30% ускоряет окупаемость.

Разработчикам продуктов. Лицензия MIT позволяет встраивать модель в коммерческие решения.

Кому не стоит: при эпизодическом использовании. Стоимость нескольких ускорителей высокого класса не окупится, если модель нужна время от времени — API дешевле.

Итог

Kimi K2.7 Code — не про рекорды в тестах, а про экономику эксплуатации. Тот же объём параметров, но на треть меньше токенов на ту же работу и конструктивно защищённая цепочка рассуждений для длинных агентных сессий.

Главная практическая ценность — открытая лицензия и возможность развернуть модель у себя. Главное ограничение — требования к памяти: рассчитывать конфигурацию нужно по полному объёму параметров, а не по активной части.

Планируете развернуть языковую модель на собственном оборудовании — расскажите, какую именно и под какую нагрузку, посчитаем требования по памяти и подберём конфигурацию.