Moonshot AI представила Kimi K2.7 Code: специализированный агент для задач программирования

Китайская компания Moonshot AI выпустила очередную версию своей кодовой модели — Kimi K2.7 Code. Новинка строится поверх K2.6 и в первую очередь нацелена на улучшение долгосрочного планирования при выполнении сложных задач разработки. По заявлению разработчиков, модель расходует токены на 30% экономнее предшественниц — это ощутимо снижает стоимость длительных агентных сессий.

В основе архитектуры — Mixture-of-Experts (MoE): суммарно 1 триллион параметров, из которых в каждый момент активны лишь 32 миллиарда. Одновременно появился принудительный режим сохранения полной цепочки рассуждений при итеративной агентной работе.


Архитектура и технические характеристики

Kimi K2.7 Code наследует структуру K2.6 практически без изменений. Ключевые параметры:

  • Слои: 1 плотный + 61 слой MoE
  • Механизм внимания: Multi-Head Latent Attention (MLA)
  • Функция активации: SwiGLU
  • Эксперты MoE: 384 всего; на каждом токене активируются 8 специализированных + 1 общий
  • Словарный запас: 160 000 токенов
  • Контекстное окно: 256 000 токенов

Расширенный контекст особенно ценен при работе с крупными кодовыми базами и многошаговыми агентными пайплайнами: модель не теряет ранние части диалога даже в длинных сессиях.

Поддержка мультимодального ввода обеспечена интеграцией визуального кодировщика Moonlight (400 млн параметров). Это означает, что на вход можно подавать не только текст, но и изображения с видеофрагментами — полезно при разборе скриншотов интерфейсов, схем и диаграмм в рамках автономных агентных рабочих процессов.


Что изменилось по сравнению с K2.6

Общее число параметров осталось прежним — 1 триллион. Однако команда Moonshot AI сосредоточилась на качестве выполнения длинных последовательностей инструкций. Четыре главных нововведения:

  • preserve_thinking — принудительный режим, при котором промежуточные рассуждения не обрезаются и не «забываются» между шагами агентной итерации. Отключить его нельзя: стабильность цепочки мышления гарантирована конструктивно.
  • Квантование INT4 — собственная схема, отработанная на Kimi-K2-Thinking. Снижает требования к памяти GPU при развёртывании через vLLM, SGLang и KTransformers.
  • Снижение галлюцинаций — ранние тесты независимых пользователей фиксируют заметное сокращение зацикленных и ошибочных рассуждений.
  • Экономия токенов на 30% — ключевое преимущество при эксплуатации в production: меньше токенов означает меньший расход вычислительных ресурсов при том же объёме работы.

Результаты бенчмарков

Kimi K2.7 Code показывает уверенный прирост относительно K2.6, хотя по ряду показателей пока уступает топовым проприетарным моделям:

Бенчмарк K2.6 K2.7 Code GPT-5.5 Claude Opus 4.8
Kimi Code Bench v2 50,9 62,0 69,0 67,4
Software Bench 48,3 53,6 69,1 63,8
MLS Light Bench 35,1 35,5 42,8
Kimi Claw 24/7 Bench 42,9 46,9 52,8 50,4
MCP Bench 69,4 76,0 79,4 81,3

Наиболее заметен прогресс в Kimi Code Bench v2: рост более чем на 11 пунктов. В агентных сценариях (Kimi Claw 24/7 Bench) улучшение составило 4 балла — прямое следствие режима preserve_thinking, который не допускает потери промежуточных выводов.


Доступность и развёртывание на собственной инфраструктуре

Kimi K2.7 Code выпускается под лицензией MIT — её можно использовать как в коммерческих, так и в исследовательских проектах без дополнительных ограничений. Совместимость с vLLM, SGLang и KTransformers позволяет запускать модель на собственных серверах, не завися от облачных провайдеров.

Для работы с полным весовым объёмом модели потребуется серверная инфраструктура с несколькими GPU высокого класса и достаточным объёмом видеопамяти. Квантование INT4 частично решает эту проблему, снижая аппаратные требования при незначительной потере точности.

Moonshot AI анонсировала, что в ближайшем обновлении появится высокоскоростной режим инференса — ожидаемое ускорение превысит 6× по сравнению с текущими показателями. После выхода этого обновления Kimi K2.7 Code станет ещё более практичным выбором для высоконагруженных агентных пайплайнов.


Интересуетесь развёртыванием ИИ-моделей на собственном железе? СервакМастер поможет подобрать GPU-сервер под ваши задачи — свяжитесь с нами и уточните актуальный ассортимент и конфигурации.