Зачем понадобилась собственная линейка

Разработка ИИ-ускорителей с нуля — предприятие, на которое решаются немногие. Нужно спроектировать чип, создать под него программный стек, портировать фреймворки и убедить разработчиков этим пользоваться. Проще купить готовое.

Huawei пошла по сложному пути по причинам, которые сегодня очевидны: доступ к передовым американским ускорителям для компании закрыт, а спрос на вычисления для ИИ внутри китайского рынка огромен. В такой ситуации собственный кремний из амбиции превращается в необходимость.

Дополнительное ограничение — производственное. Передовые фабрики недоступны, поэтому чипы изготавливаются на китайских мощностях по техпроцессам, отстающим от лидеров. Это накладывает отпечаток на всю линейку: компенсировать отставание в плотности транзисторов приходится архитектурными решениями и повышенным энергопотреблением.

Ascend и Atlas: в чём разница

Первое, что путает при знакомстве с экосистемой, — два названия для того, что кажется одним и тем же. Разница простая и важная.

Ascend — это чипы. Нейропроцессоры, вычислительное ядро всей системы. Ascend — то же, что «процессор» в привычной терминологии.

Atlas — это изделия на их основе. Платы расширения, вычислительные модули, серверы, стойки. Atlas — то, что физически покупают и устанавливают.

Соотношение как между кристаллом и видеокартой: один чип может использоваться в нескольких продуктах разного форм-фактора и назначения.

Отсюда логика чтения названий: чип определяет вычислительные возможности, изделие — форм-фактор, объём памяти, энергопотребление и сценарий применения.

Как разделены задачи внутри линейки

Второе разделение — по этапу работы с нейросетью.

Инференс — применение уже обученной модели. Модель загружена, поступают запросы, нужно быстро выдавать ответы. Требования: достаточный объём памяти под модель, высокая пропускная способность, экономичность, поскольку работа идёт непрерывно.

Обучение — построение модели на данных. Требуется хранить не только веса, но и градиенты с состояниями оптимизатора, что кратно увеличивает потребность в памяти. Плюс интенсивный обмен данными между ускорителями при распределённом обучении.

Соответственно, в линейке есть чипы, оптимизированные под инференс, и чипы под обучение. Смешивать их назначение технически можно, экономически — почти всегда неоправданно.

Ускорители для инференса

Исторически это самая массовая часть линейки — карты на чипах младшего семейства, рассчитанные на применение обученных моделей и обработку видео.

Базовые карты для инференса. Платы расширения умеренной мощности с небольшим энергопотреблением. Основные сценарии: обработка изображений, распознавание, классификация, работа с компактными моделями. Их сильная сторона — не пиковая производительность, а соотношение мощности к энергопотреблению и возможность ставить много карт в одно шасси.

Карты для видеоаналитики. Отдельная ветвь с акцентом на аппаратное декодирование видеопотоков. Применяются там, где нужно одновременно обрабатывать десятки или сотни камер: транспортная аналитика, промышленный контроль, системы безопасности. Ключевой параметр здесь — количество одновременно декодируемых потоков, а не абстрактная вычислительная мощность.

Удвоенные конфигурации. Карты, объединяющие два чипа на одной плате. Дают больше памяти и производительности в том же слоте — компромисс между плотностью и энергопотреблением.

Ускорители для обучения

Более тяжёлый сегмент: карты на старших чипах с большим объёмом памяти и поддержкой быстрого соединения между ускорителями.

Отличия от инференс-решений принципиальны. Больше памяти — потому что при обучении в неё нужно поместить не только модель. Выше энергопотребление и требования к охлаждению. Развитый интерконнект — при распределённом обучении карты постоянно синхронизируют состояние, и скорость этого обмена определяет масштабируемость.

Именно старшие чипы этой ветви стали основой для крупных вычислительных комплексов, на которых обучаются китайские языковые модели.

Поколение 2026 года

Наиболее заметное обновление — новая карта для инференса, представленная в марте 2026 года и рассчитанная на замену предыдущего массового семейства.

Что в ней принципиально нового:

Собственная память вместо HBM. Доступ к высокоскоростной памяти HBM для компании ограничен, и вместо неё применяется разработка собственной конструкции — 112 ГБ с пропускной способностью около 1,4 ТБ/с, позиционируемая как функциональный аналог HBM2E. Это показательный пример того, как ограничения вынуждают создавать замену целому классу компонентов.

Поддержка формата FP4. Вычисления с четырёхбитной точностью — способ радикально ускорить инференс и уменьшить объём памяти под модель ценой контролируемой потери точности. Карта стала первой в стране с аппаратной поддержкой этого формата.

Специализация под этап префилла. Инференс языковой модели делится на две фазы: обработка входного запроса целиком (префилл) и последовательная генерация ответа по токенам. Первая фаза упирается в вычислительную мощность, вторая — в пропускную способность памяти. Карта оптимизирована именно под первую, наиболее ресурсоёмкую.

Ориентировочные характеристики:

Параметр Значение
Форм-фактор Двухслотовая карта расширения
Объём памяти 112 ГБ
Пропускная способность памяти 1,4 ТБ/с
Производительность FP4 около 1,56 PFLOPS
Производительность FP8 около 1 PFLOPS
Производительность FP16 около 450 TFLOPS
Интерфейс PCIe 5.0
Энергопотребление 600 Вт

Обратите внимание на последнюю строку. 600 Вт на карту — это уровень, требующий продуманного питания и охлаждения. При расчёте конфигурации с несколькими такими ускорителями энергетический бюджет становится ограничением раньше, чем число слотов.

Анонсировано и решение для обучения на родственном чипе, но его выход отнесён на более поздний срок, а детали пока ограничены общими характеристиками.

Программный стек — главный вопрос

Здесь находится основная сложность экосистемы, и обойти её вниманием было бы нечестно.

Ускоритель без программного обеспечения — кусок кремния. Огромная доля успеха ведущего производителя GPU объясняется не столько железом, сколько зрелостью программной платформы, накопленной за полтора десятилетия: библиотеки, оптимизированные ядра, поддержка во всех фреймворках, гигантское сообщество и готовые ответы почти на любой вопрос.

У Huawei есть собственный программный стек и собственный фреймворк для машинного обучения. Популярные фреймворки поддерживаются через слои совместимости. Но зрелость экосистемы объективно ниже, и это выражается вполне конкретно:

  • Не всякая модель из открытого доступа заработает без адаптации.
  • Оптимизация под конкретную архитектуру требует усилий, которых в привычной экосистеме не потребовалось бы.
  • Меньше специалистов с опытом, меньше разобранных случаев, дольше поиск решения при проблеме.

Это не аргумент против платформы, а фактор, который нужно закладывать в план внедрения. Экономия на железе может обернуться расходами на адаптацию программной части.

Как выбирать под задачу

Сценарий Направление выбора Что критично
Видеоаналитика, много камер Карты с аппаратным декодированием Число потоков, энергоэффективность
Инференс компактных моделей Базовые инференс-карты Плотность установки, экономичность
Инференс крупных языковых моделей Новое поколение с большой памятью Объём и пропускная способность памяти
Обучение моделей Старшие чипы с интерконнектом Память, скорость связи между картами
Пилот, проверка гипотезы Минимальная конфигурация Совместимость вашего стека

Порядок действий при подборе:

Определите этап работы. Инференс и обучение требуют разного класса решений — это первая развилка.

Посчитайте память под модель. Как и с любыми ускорителями, объём памяти определяет саму возможность запуска. Начинать нужно с этого параметра.

Проверьте совместимость программной части. Ключевой шаг для этой экосистемы. Убедитесь, что ваши модели и фреймворки поддерживаются, до закупки железа.

Оцените энергетику площадки. Карты уровня 600 Вт требуют соответствующего питания и охлаждения — проверьте возможности помещения.

Заложите время на адаптацию. Внедрение займёт больше, чем на привычной платформе. Это нормально и предсказуемо, если запланировано заранее.

Коротко

Экосистема Huawei разделена на чипы Ascend и построенные на них изделия Atlas. Внутри — разделение по этапу работы: одни решения оптимизированы под инференс, другие под обучение.

Поколение 2026 года принесло собственную высокоскоростную память взамен недоступной HBM, поддержку четырёхбитных вычислений и специализацию под ресурсоёмкую фазу обработки запроса. Ценой стало высокое энергопотребление, требующее серьёзной инфраструктуры.

Главный фактор при принятии решения — не характеристики железа, а зрелость программного стека под ваши задачи. Проверять совместимость нужно до закупки, а на адаптацию закладывать отдельное время.

Если подбираете оборудование под ИИ-нагрузки и хотите сопоставить варианты — опишите задачу, поможем оценить требования и подобрать конфигурацию.