Что произошло
Z.ai опубликовала веса своей флагманской модели GLM-5.2. Событие примечательно не самим фактом открытия, а результатом: модель заняла первое место в рейтинге Design Arena, обойдя закрытый коммерческий флагман. Для открытых моделей это произошло впервые.
Разберём, за счёт чего, и главное — что нужно, чтобы развернуть такую модель у себя.
Архитектура
Модель построена по схеме «смесь экспертов»: суммарно 753 миллиарда параметров, но на каждый токен задействуется около 98 миллиардов.
Смысл такой конструкции: по качеству генерации модель ведёт себя как очень крупная, а вычислительная нагрузка при работе соответствует значительно меньшей. Плата за это — память: держать в ней нужно все параметры, а не только активные.
Контекст в миллион токенов
Ключевая особенность — контекстное окно в 1 миллион токенов без разбиения на фрагменты и без деградации внимания по мере роста входного текста.
Это открывает класс задач, недоступных в одном запросе: анализ крупной кодовой базы целиком, сопоставление объёмных документов, работа с длинными журналами событий без потери связей между удалёнными частями текста.
Обычно расширение контекста упирается в стоимость: вычислительные затраты растут быстрее линейного. Здесь применён механизм, при котором один индексатор обслуживает сразу четыре слоя разрежённого внимания вместо отдельного на каждый. Результат — снижение числа операций на токен при максимальном контексте в 2,9 раза относительно предыдущей версии.
Практически это означает, что миллион токенов перестаёт быть дорогой экзотикой и становится рабочим режимом.
Ускорение генерации
Переработан механизм предсказания нескольких токенов за шаг: допустимая длина спекулятивного блока выросла на 20%. Прямой эффект — более быстрая генерация в длинных сессиях, без каких-либо изменений со стороны пользователя.
Результаты тестов
| Тест | GLM-5.2 | Предыдущая версия | Ближайший коммерческий |
|---|---|---|---|
| Design Arena (Elo) | 1360 | — | 1350 |
| FrontierSWE | 74,4% | — | 75,1% |
| Terminal-Bench 2.1 | 81,0% | 63,5% | 85,0% |
| SWE-bench Pro | 62,1% | 58,4% | 69,2% |
Наиболее показателен прирост на третьей строке: +17,5 процентных пункта за одно поколение. Разрыв с коммерческим лидером сократился до 4 пунктов.
Первое место в Design Arena — с минимальным перевесом, 1360 против 1350. Это не разгром, а близкий результат, но сам факт лидерства открытой модели в подобном рейтинге показателен.
Честная оговорка: в полном спектре инженерных тестов отрыв коммерческого флагмана сохраняется. Разработчики позиционируют модель как располагающуюся по качеству между двумя последними версиями закрытого лидера — и это похоже на правду.
Что нужно для развёртывания
Здесь самое практичное, и цифры отрезвляют.
| Формат весов | Требуемая видеопамять | Назначение |
|---|---|---|
| FP8 (квантованный) | 754 ГБ | Промышленное развёртывание |
| BF16 (полная точность) | 1,5 ТБ | Дообучение и исследования |
754 гигабайта видеопамяти — это не одна карта и не две. Речь о полноценном узле с несколькими ускорителями высокого класса, а это серьёзные капитальные затраты.
Ключевой момент, который часто упускают: память нужна под все 753 миллиарда параметров, а не под 98 миллиардов активных. Заранее неизвестно, какие эксперты понадобятся следующему токену, поэтому в памяти должна лежать вся модель.
Веса опубликованы под лицензией MIT — использование в коммерческих проектах без ограничений.
Кому это действительно нужно
Организациям с требованиями к данным. Финансовый сектор, госструктуры, медицина — там, где информация не может покидать периметр. Здесь собственное развёртывание не альтернатива облаку, а единственный вариант.
Тем, кому нужно дообучение. Открытые веса позволяют адаптировать модель под свою предметную область — с закрытыми API это невозможно в принципе.
При очень больших объёмах. Постоянная нагрузка, при которой оплата за токены превышает стоимость собственной инфраструктуры.
Кому не подходит. Всем остальным. При эпизодическом или умеренном использовании узел на 754 ГБ видеопамяти не окупится никогда — коммерческий API окажется дешевле на порядки. Открытость модели ценна возможностями, а не экономией как таковой.
Коротко
GLM-5.2 — первая открытая модель, возглавившая Design Arena, и наиболее убедительный на сегодня аргумент в пользу открытых решений: контекст в миллион токенов, серьёзный прирост в инженерных тестах, лицензия MIT.
Технически интереснее всего механизм удешевления длинного контекста — сокращение операций на токен почти втрое сделало миллион токенов практичным режимом.
Но перед тем как планировать развёртывание, посмотрите на требования по памяти: 754 ГБ в квантованном виде. Собственная инфраструктура здесь оправдана требованиями к данным или дообучением, а не экономией.
Считаете конфигурацию под развёртывание крупной модели — напишите, какую именно, рассчитаем требования по памяти и подберём вариант.
