Ставка не на размер, а на экономику работы
Moonshot AI выпустила очередную версию своей кодовой модели. Общее число параметров осталось прежним — триллион, — а работа велась над другим: качеством выполнения длинных цепочек инструкций и стоимостью эксплуатации.
Заявленный результат — расход токенов на 30% меньше предшественницы при сопоставимом или лучшем качестве. Для агентных сценариев, где модель работает часами и генерирует огромные объёмы промежуточных рассуждений, это прямая экономия.
Интереснее всего здесь то, что модель выпущена под лицензией MIT и может разворачиваться на собственной инфраструктуре. Разберём, что для этого нужно.
Архитектура
В основе — «смесь экспертов»: суммарно триллион параметров, но на каждый токен активируется лишь 32 миллиарда.
Технические параметры:
| Параметр | Значение |
|---|---|
| Структура | 1 плотный слой + 61 слой MoE |
| Механизм внимания | Multi-Head Latent Attention |
| Функция активации | SwiGLU |
| Эксперты | 384 всего, на токен активируются 8 специализированных + 1 общий |
| Словарь | 160 000 токенов |
| Контекстное окно | 256 000 токенов |
Расширенное контекстное окно особенно ценно при работе с крупными кодовыми базами: модель удерживает начало сессии даже в длинных диалогах и не теряет ранее принятые решения.
Поддерживается и мультимодальный ввод через отдельный визуальный кодировщик на 400 миллионов параметров — можно подавать скриншоты интерфейсов, схемы и диаграммы.
Что изменилось
Четыре ключевых нововведения относительно предыдущей версии.
Принудительное сохранение рассуждений. Промежуточные выводы модели не обрезаются и не теряются между шагами агентной итерации. Режим нельзя отключить — стабильность цепочки рассуждений обеспечена конструктивно.
Это решает известную проблему длинных агентных сессий: модель, потерявшая ход собственных рассуждений, начинает противоречить своим же ранним решениям и ходить по кругу.
Квантование INT4. Собственная схема, отработанная на предыдущих моделях линейки. Снижает требования к видеопамяти при развёртывании через распространённые движки инференса.
Меньше галлюцинаций. Ранние отзывы фиксируют сокращение зацикленных и ошибочных рассуждений.
Экономия токенов на 30%. Ключевой практический выигрыш: тот же объём работы при меньшем расходе вычислительных ресурсов.
Результаты тестов
По опубликованным данным, прирост относительно предыдущей версии заметный, хотя топовым проприетарным моделям она пока уступает:
| Тест | Предыдущая версия | K2.7 Code | GPT-5.5 | Claude Opus 4.8 |
|---|---|---|---|---|
| Kimi Code Bench v2 | 50,9 | 62,0 | 69,0 | 67,4 |
| Software Bench | 48,3 | 53,6 | 69,1 | 63,8 |
| MLS Light Bench | — | 35,1 | 35,5 | 42,8 |
| Kimi Claw 24/7 Bench | 42,9 | 46,9 | 52,8 | 50,4 |
| MCP Bench | 69,4 | 76,0 | 79,4 | 81,3 |
Наиболее заметен рост на первом тесте — более 11 пунктов. В агентных сценариях прибавка около 4 баллов, что разработчики связывают напрямую с принудительным сохранением рассуждений.
Стандартная оговорка: часть тестов разработана самой компанией, и к таким результатам стоит относиться сдержаннее, чем к независимым.
Развёртывание на своём железе
Здесь самое интересное для тех, кто рассматривает собственную инфраструктуру.
Лицензия MIT — модель можно использовать и в коммерческих проектах без дополнительных ограничений. Это принципиальное отличие от проприетарных моделей, доступных только через API.
Совместимость с распространёнными движками инференса позволяет запускать её на своих серверах, не завися от облачных провайдеров.
Требования к железу. И здесь важный момент, который легко упустить: память нужна под все параметры, а не под активные. Активируются 32 миллиарда, но в память должен поместиться весь триллион — заранее неизвестно, какие эксперты понадобятся следующему токену.
Это означает серверную конфигурацию с несколькими ускорителями высокого класса. Квантование INT4 частично снижает планку, но не отменяет её принципиально.
Обещанное ускорение. Разработчики анонсировали высокоскоростной режим инференса с ускорением более чем в 6 раз в ближайшем обновлении. Если заявленное подтвердится, экономика эксплуатации изменится заметно.
Кому это интересно
Компаниям с требованиями к данным. Код не покидает контур — решающий аргумент там, где исходники нельзя отправлять во внешние сервисы.
Тем, у кого большой объём агентной работы. При постоянной нагрузке собственная инфраструктура окупается против оплаты за токены, а экономия в 30% ускоряет окупаемость.
Разработчикам продуктов. Лицензия MIT позволяет встраивать модель в коммерческие решения.
Кому не стоит: при эпизодическом использовании. Стоимость нескольких ускорителей высокого класса не окупится, если модель нужна время от времени — API дешевле.
Итог
Kimi K2.7 Code — не про рекорды в тестах, а про экономику эксплуатации. Тот же объём параметров, но на треть меньше токенов на ту же работу и конструктивно защищённая цепочка рассуждений для длинных агентных сессий.
Главная практическая ценность — открытая лицензия и возможность развернуть модель у себя. Главное ограничение — требования к памяти: рассчитывать конфигурацию нужно по полному объёму параметров, а не по активной части.
Планируете развернуть языковую модель на собственном оборудовании — расскажите, какую именно и под какую нагрузку, посчитаем требования по памяти и подберём конфигурацию.
