Крупнейший покупатель ускорителей начал делать свои

До сих пор OpenAI полностью зависела от чужого кремния — прежде всего от ускорителей NVIDIA. Компания была одним из крупнейших покупателей этого оборудования в мире, и её закупки заметно влияли на весь рынок.

Теперь ситуация меняется. Представлен Jalapeño — специализированный ускоритель собственной разработки, созданный в партнёрстве с Broadcom и предназначенный исключительно для инференса больших языковых моделей.

Инженерные образцы уже прошли испытания на реальных нагрузках во внутренних лабораториях компании. Первые коммерческие развёртывания намечены на конец 2026 года, а к 2029-му планируется довести суммарную мощность собственных кластеров до 10 гигаватт.

Почему именно инференс, а не обучение

Разделение принципиальное, и в нём вся логика проекта.

Обучение — построение модели. Процесс разовый, требует максимальной универсальности вычислений, поскольку архитектуры моделей постоянно меняются.

Инференс — применение готовой модели к запросам пользователей. Процесс непрерывный, происходит миллионы раз в сутки и состоит из ограниченного набора хорошо предсказуемых операций.

Именно на инференс приходится основная доля операционных расходов сервиса вроде ChatGPT. Обучили модель один раз — а обслуживать запросы приходится постоянно, и каждый ответ стоит денег.

Отсюда решение: сделать чип не универсальным, а узкоспециализированным. Такой подход называется ASIC — интегральная схема специального назначения. Она проигрывает универсальным ускорителям в гибкости, но существенно выигрывает в эффективности на той задаче, под которую спроектирована.

Функциональные блоки Jalapeño оптимизированы под конкретные операции языковых моделей: матричные умножения, механизм внимания и деквантизацию — то есть под то, из чего инференс и состоит.

Как устроен чип

Jalapeño собран из нескольких кристаллов на общей подложке:

  • Центральный вычислительный кристалл — выполняет основные матричные операции.
  • Восемь стеков памяти HBM3E — размещены вокруг центрального кристалла, обеспечивают высокую пропускную способность при малых задержках.
  • Сетевые блоки Broadcom — встроены прямо в чип, что позволяет объединять сотни ускорителей в единые кластеры.

Последний пункт заслуживает отдельного внимания. Обычно сетевая часть — это отдельные компоненты на плате. Перенос её внутрь чипа сокращает путь данных и упрощает масштабирование: соединение ускорителей между собой перестаёт быть отдельной инженерной задачей.

Полные характеристики — техпроцесс, число вычислительных блоков, пиковая производительность — пока не раскрыты, технический отчёт обещан позже. Отдельно отмечено, что чип совместим не только с моделями самой OpenAI, но и с другими языковыми моделями.

Девять месяцев от эскиза до кремния

Самая примечательная деталь проекта — не архитектура, а срок.

Полный цикл от первых набросков до готовности к производству занял девять месяцев. Для полупроводниковой отрасли, где разработка сложного чипа традиционно измеряется годами, это исключительный показатель.

Сложился он из трёх факторов:

  • Применение собственных языковых моделей в проектировании. OpenAI использовала свои же нейросети для ускорения разработки и оптимизации архитектуры.
  • Опыт Broadcom. Партнёр взял на себя основную часть аппаратной разработки, опираясь на многолетнюю практику создания подобных решений.
  • Участие ODM-производителя. Проектирование плат и стоечных систем под ускоритель выполняет специализированная компания-контрактник.

Такое разделение труда — разработчик моделей плюс производитель чипов плюс ODM для серверных платформ — становится в отрасли типовым и создаёт прямую конкуренцию классическим серверным вендорам.

Экономика: заявленное снижение стоимости вдвое

Ключевая цифра, озвученная руководством Broadcom: снижение стоимости инференса примерно на 50% по сравнению с актуальными ускорителями конкурентов на задачах работы с языковыми моделями.

Достигается это, по описанию разработчиков, не грубым наращиванием мощности, а балансировкой: минимизацией перемещения данных внутри системы и согласованием вычислительных ресурсов, пропускной способности сети и объёма памяти. Такой подход даёт высокую утилизацию оборудования и низкие задержки при обработке запросов.

К заявленным цифрам стоит относиться с обычной осторожностью: они получены во внутренних тестах и на выбранных сценариях. Но даже с поправкой на маркетинг двукратная разница в стоимости обслуживания запросов принципиально меняет финансовую модель ИИ-сервиса.

Что это значит для рынка серверов

Последствия выходят далеко за пределы одной компании.

Перераспределение спроса на GPU. Один из крупнейших покупателей начинает частично закрывать свои потребности собственными решениями. Для остального рынка это потенциально означает более доступное предложение ускорителей, дефицит которых последние годы был устойчивым.

Сигнал другим крупным игрокам. Если специализированный чип удаётся довести до кремния за девять месяцев, аналогичные проекты у других технологических гигантов становятся заметно вероятнее. А это уже тенденция к фрагментации рынка ИИ-ускорителей, который сейчас близок к монопольному.

Новый спрос на серверную обвязку. Кластеры на специализированных ускорителях требуют собственных стоек, систем жидкостного охлаждения и высокоскоростных соединений. Формируется отдельный сегмент оборудования.

Давление на цены. Появление конкурентоспособной альтернативы — единственный работающий механизм снижения цен в сегменте, где сейчас доминирует один поставщик.

Чего ждать пользователям

Краткосрочно — ничего. Для пользователя чат-бота смена оборудования под капотом незаметна.

Основной выигрыш достаётся самой компании: снижение операционных расходов, независимость от внешних поставщиков и полный контроль над технологическим стеком — от архитектуры модели до кремния, на котором она исполняется.

Долгосрочно эффект может оказаться значительнее. Если следующие поколения чипа закроют ещё и задачи обучения, расклад на рынке полупроводников для ИИ изменится принципиально.

Коротко

OpenAI перестала быть только потребителем чужого железа и вышла в разработку собственного. Jalapeño — узкоспециализированный ускоритель под инференс языковых моделей, созданный с Broadcom за рекордные девять месяцев, с заявленным вдвое снижением стоимости обработки запросов.

Для рынка серверного оборудования это означает три вещи: возможное ослабление дефицита ускорителей, ускорение аналогичных проектов у других крупных игроков и формирование спроса на инфраструктуру под специализированные чипы.

Планируете инфраструктуру под ИИ-нагрузки и хотите разобраться, что выбрать сегодня — напишите нам, поможем подобрать конфигурацию под ваши задачи и бюджет.