В декабре 2025 года новостные ленты IT-индустрии заполнила одна и та же новость: Nvidia приобрела стартап Groq. Вне узкого круга специалистов о компании знали немногие, хотя ещё в 2024 году она попала в независимые бенчмарки с результатом около 300 токенов в секунду на Llama* 2 70B. Цифра выглядела настолько фантастической, что в неё многие просто не поверили — так же, как раньше случилось с Cerebras. Потенциал увидел Дженсен Хуанг: чипы LPU (Language Processing Unit) удачно закрывали слабое место аппаратного стека Nvidia. Ниже разберём, откуда взялась Groq, чем её архитектура отличается от GPU, где LPU проигрывает конкурентам и как эти чипы впишутся в будущие платформы Nvidia.

Откуда взялась Groq

Компания появилась в 2016 году, через год после Cerebras. Её основали Джонатан Росс и Дуглас Уайтман, которые в 2013–2015 годах стояли за разработкой первых тензорных ускорителей Google TPUv1. Зная сильные и слабые стороны TPU, они решили, что могут сделать лучше. Название отсылает к слову «grok» из романа Роберта Хайнлайна «Чужак в чужой стране» — понять что-то так глубоко, что оно становится частью тебя.

Сначала софт, потом кремний

Необычно, что разработку начали не с вычислительной архитектуры и подсистемы памяти, а с оптимизации под программный стек. В отрасли обычно поступают наоборот: сначала делают кристалл, затем долго портируют на него фреймворки. Подход Groq сделал чипы гибкими: популярные нейросети запускаются без костылей, а интеграция в существующую инфраструктуру проходит проще. При этом важна оговорка: решения Groq предназначены только для инференса. Обучать модели на этих чипах изначально не планировалось.

Хронология

Год Событие
2016 Основание Groq
2019 Уайтман уходит с поста CEO, компанию возглавляет Росс и готовит первый раунд финансирования
2020 Выходят первые чипы, тогда называвшиеся TSP (Tensor Streaming Processor): 14 нм, 220 МБ SRAM с пропускной способностью до 80 ТБ/с, 250 TFLOPS в FP16
2021 Первый раунд: $300 млн при оценке $1 млрд; техническим консультантом становится Ян ЛеКун из Meta*, а операционным директором — Стюарт Панн, бывший глава полупроводникового бизнеса Intel
2025 Второй раунд: ещё $750 млн при оценке $6,9 млрд; через несколько месяцев Хуанг предлагает $20 млрд наличными

Как сделка устроена и почему она понадобилась Nvidia

К концу 2025 года Nvidia столкнулась с парадоксом: GPU компании доминировали в обучении моделей, а рынок смещался в сторону инференса. По экспертным оценкам, на него уже приходилось 90–95% корпоративных ИИ-нагрузок: бизнес редко обучает модели с нуля, чаще пользуется API и предобученными LLM. Архитектура GPU, заточенная под параллельные вычисления при обучении, на инференсе несёт большие накладные расходы: динамический планировщик, кэш-когерентность, буферы переупорядочивания. Groq с детерминированной архитектурой и SRAM вместо HBM закрывала именно этот пробел — инференс с ультранизкой задержкой.

Сделку оформили аккуратно:

  • неэксклюзивная лицензия на технологии LPU;
  • переход ключевых инженеров, включая основателя и CEO Джонатана Росса, в Nvidia;
  • интеграция GroqCloud в экосистему DGX Cloud.

Формально это не поглощение. Groq сохранила независимость, а облачный сервис GroqCloud продолжил работу под руководством нового CEO Саймона Эдвардса. Так Nvidia получила и технологию, и людей, не вступая в затяжные споры с антимонопольными органами.

Что необычного в архитектуре LPU

Функциональные «слайсы» вместо универсальных ядер

Groq отказалась от привычной схемы «каждое ядро — самостоятельный микрокомпьютер». Процессор разделён на функциональные модули: контроллер инструкций, память, векторные вычисления, матричные умножители, сетевая коммутация. Блоки одного типа собраны в вертикальный слайс, а данные движутся горизонтально и последовательно проходят все виды обработки — как детали на конвейере.

У схемы два преимущества:

  1. Экономия площади. Блоки одного типа выполняют одинаковые инструкции, поэтому логика декодирования и управления вынесена в общий модуль ICU, который занимает менее 3% площади кристалла. Остальные 97% отданы полезным для инференса блокам.
  2. Предсказуемость задержек. Очередей, узких мест и конфликтов за ресурсы нет: данные идут по маршруту, заранее рассчитанному компилятором, а время прибытия в любую точку известно с точностью до такта.

Статическое планирование

В GPU динамический планировщик в каждом цикле решает, что исполнять дальше: переупорядочивает инструкции, угадывает ветвления, управляет кэшами. Для обучения это приемлемо, ведь там важнее пропускная способность, чем стабильность задержек. Для инференса в реальном времени такая непредсказуемость вредна.

LPU использует статическое планирование. Компилятор заранее вычисляет весь граф исполнения, включая обмены между чипами, вплоть до отдельных тактов. Кэш-когерентности, буферов переупорядочивания и спекулятивного исполнения нет. Задержка получается строго определённой — GPU такого гарантировать не могут.

SRAM как основная память

Самая узнаваемая особенность — SRAM вместо HBM. В процессорах SRAM обычно служит кэшем, а в LPU это основная память: сотни мегабайт сверхбыстрой памяти прямо на кристалле. По ёмкости разрыв огромен. В новейшем Groq 3 LPU на 4-нм техпроцессе SRAM всего 500 МБ, тогда как у Nvidia Rubin будет 288 ГБ HBM4 — разница почти в 600 раз.

Зато по скорости картина обратная:

Параметр Groq 3 LPU Nvidia Rubin
Тип памяти SRAM, 500 МБ HBM4, 288 ГБ
Пропускная способность 150 ТБ/с не более 22 ТБ/с

Скорость памяти LPU выше в 7 раз. Ключевая идея Groq в том, что инференс, особенно фаза декодирования, упирается в пропускную способность памяти, а не в её объём. Модель в 140 ГБ и 500 МБ на чип выглядят несопоставимо, но 256 чипов в стойке LPX дают 128 ГБ SRAM с суммарной пропускной способностью 40 ПБ/с. Доступ к SRAM примерно в 20 раз быстрее, чем к HBM, поэтому вычислительные блоки получают веса на полной скорости, без простоев. Отсюда и скорость генерации токенов, недостижимая для GPU.

Программный стек Groq

Железо без софта малоценно, и Groq собрала собственный стек:

  • Groq Compiler — основа всего стека. Берёт модель из PyTorch, TensorFlow или ONNX и раскладывает её на статический планировщик: каждый слой и операция привязаны к конкретному функциональному блоку и такту. Задержки минимальны, но компиляция занимает время.
  • GroqFlow — открытый инструментарий, автоматизирующий путь от загрузки модели до запуска на чипе. Это обёртка над компилятором, которая сама выполняет квантизацию, распределение слоёв и межчиповый обмен данными.
  • GroqWare — набор фирменных утилит для отладки, профилирования и мониторинга производительности. GroqFlow помогает запустить модель, GroqWare — понять, что внутри неё происходит.
  • TruePoint — технология, позволяющая хранить веса и активации в пониженной точности (FP8/FP4), а матричные умножения выполнять в полной точности (FP32). Прирост производительности относительно BF16 — в 2–4 раза без заметной деградации точности.
  • RealScale Interconnect — интерконнект для обмена данными между чипами. Особый протокол компенсирует естественный дрейф тактовых генераторов, поэтому сотни чипов выглядят для компилятора как одно логическое ядро. Он может предсказывать время прибытия данных с любого чипа, что открывает путь к высокому параллелизму без больших задержек.

После сделки с Nvidia этот набор оказался во многом лишним: у Хуанга есть экосистема CUDA с инструментами для практически любых ИИ-операций. Тем не менее не исключено, что собственный стек ещё пригодится Groq для отдельных задач.

Производительность и сравнение с конкурентами

Известность Groq принесли результаты 2024 года: до 300 токенов/с на Llama* 2 70B, что в 10 раз больше, чем у Nvidia H100 на той же модели. Дальше цифры росли:

  • Mixtral 8x7B — 480 токенов/с;
  • Llama* 2 7B — до 750 токенов/с;
  • Llama* 3.3 70B со спекулятивным декодированием — 1665 токенов/с, по заявлению Groq. Причём это первое поколение 14-нм чипов без аппаратных изменений, только за счёт программных оптимизаций.

Раз LPU специализирован на инференсе, сравнивать его логично с другими специализированными ускорителями:

  • Cerebras. Гигантские чипы WSE-3 тоже используют SRAM, но благодаря размерам её там не 500 МБ, а 44 ГБ с пропускной способностью 21 ПБ/с. Чип выполнен на одной цельной кремниевой пластине, что кратно ускоряет передачу данных между ядрами и сводит задержки к минимуму. В итоге WSE-3 выдаёт 3000 токенов/с на GPT-OSS 120b, тогда как Groq 3 LPU — 500 токенов/с.
  • SambaNova. Вместо одного огромного чипа, как у Cerebras, или массива маленьких детерминированных конвейеров, как у Groq, компания строит чип с иерархической памятью (SRAM, HBM, DDR) и динамически перестраиваемыми вычислительными конвейерами под архитектуру модели. Результат на GPT-OSS 120b — свыше 700 токенов/с против тех же 500 у Groq 3 LPU.

По пиковой скорости генерации Groq 3 LPU действительно отстаёт. Но преимущество LPU проявляется в сценариях с ультранизкой задержкой и минимальным размером батча, где важны не пиковые показатели, а стабильность и предсказуемость каждого отдельного запроса.

Ограничения LPU

Идеального железа не бывает, и у LPU есть фундаментальные ограничения, которые мешают массовому распространению.

  • Малая ёмкость. Не более 500 МБ SRAM на чип означает, что инференс возможен только в масштабе стойки: ни одна современная модель в память одного процессора не поместится. Нарастить SRAM существенно не получится — вырастут задержки и стоимость производства, и смысл LPU пропадёт.
  • Дорогое развёртывание. Даже небольшие модели требуют сотен чипов, а такие, как DeepSeek 671B, — тем более. Токен на LPU обходится дешевле ($0,05–$0,10 за миллион токенов против $0,25 у B200), но первоначальные капитальные затраты на кластер ощутимы.
  • Охлаждение. 256 чипов LPU в стойке LPX дают суммарный TDP около 25–30 кВт, поэтому нужно жидкостное охлаждение. Nvidia заявляет, что системы могут работать и на воздухе, но для серьёзных развёртываний это маловероятно.
  • Требования к моделям. Статический планировщик не позволяет просто взять PyTorch-модель и запустить её: компилятор должен превратить её в статический граф, а это возможно не для всех архитектур сразу. Трансформеры работают отлично, а со state space моделями (Mamba), рекуррентными сетями и экзотическими кастомными архитектурами придётся повозиться вручную. Изначально LPU не поддерживали vLLM, TensorRT-LLM, paged attention, continuous batching и другие популярные инструменты, но после прихода Nvidia архитектуру оптимизировали под NIM, NeMo и другие собственные среды компании.

LPU и стойки LPX в экосистеме Rubin и Feynman

Для Nvidia сделка — не просто покупка технологии, а фундамент новой архитектурной эпохи. Ранее представленный Rubin CPX для префилла выпал из дорожной карты, а его место занял LPU. Он стал седьмым ключевым компонентом экосистемы наряду с CPU Vera, GPU Rubin, NVLink 6, ConnectX-9, BlueField-4 и Spectrum-X.

Разделение ролей

LPU здесь не замена GPU, а специализированный сопроцессор для фазы декодирования, то есть генерации токенов. Rubin GPU берут вычислительно ёмкий префилл, а LPU забирает самую чувствительную к задержкам часть — послойную генерацию выходных токенов, где узкое место составляет пропускная способность памяти.

Стойка LPX

Отдельно LPU продаваться не будут, только в составе стоек LPX:

  • до 256 чипов Groq 3 LPU в одной стойке;
  • интерконнект RealScale C2C от Groq со скоростью 640 ТБ/с;
  • до 128 ГБ SRAM и 40 ПБ/с пропускной способности памяти;
  • дополнительно 12 ТБ оперативной памяти DDR5 для задач, где ёмкости SRAM не хватает.

Процессоры Groq 3 LPU будут работать в паре с Nvidia Rubin GPU в ИИ-стойках NVL72/144.

Attention-FFN Disaggregation

Стойки LPX смогут напрямую взаимодействовать с Rubin в одном кластере благодаря режиму Attention-FFN Disaggregation (AFD). Rubin GPU по-прежнему обслуживают attention-слои нейросети, а LPU в это время обрабатывают FFN-слои и экспертные смеси MoE. И то и другое происходит на каждом токене, а оркестрацией постоянного обмена данными между GPU и LPU занимается диспетчер NVIDIA Dynamo. В конфигурации Rubin + LPX с таким раздельным инференсом система, по данным Nvidia, обеспечивает в 35 раз более высокую пропускную способность на мегаватт для моделей с триллионом параметров по сравнению с чисто GPU-решениями.

Что дальше

Согласно дорожной карте GTC 2026, в 2027 году выйдет Groq 4 LPU, который будет работать в паре с ускорителями Feynman. Подробностей пока нет, есть лишь предположения: переход на 2-нм техпроцесс, до 1 ГБ SRAM и пропускная способность 300 ТБ/с. В долгосрочной перспективе Nvidia, вероятно, встроит LPU-подобные тензорные ядра с собственной SRAM прямо в кристалл GPU, создав универсальный ускоритель, одинаково пригодный для обучения и инференса. Так что LPU скорее первый шаг к архитектурной конвергенции внутри экосистемы Nvidia, чем финальная точка.

Что это значит при выборе железа

Практических выводов несколько:

  • Для обучения и для универсальных нагрузок по-прежнему нужны GPU с большим объёмом HBM. LPU их не заменяют и отдельно не продаются.
  • Если сервис упирается в задержку генерации токенов, стоит следить за платформами с разделением префилла и декодирования: именно в эту сторону движется Nvidia.
  • Стойка с жидкостным охлаждением на 25–30 кВт — другой класс инфраструктуры. Планировать питание и охлаждение нужно заранее.
  • Для большинства компаний, которые запускают собственные модели на своей площадке, актуальнее правильно подобранный GPU-сервер под конкретную модель и нагрузку.

Если вы выбираете оборудование для инференса или обучения, посмотрите серверы для ИИ и общий каталог серверов. Инженеры «СервакМастер» помогут подобрать конфигурацию под вашу задачу — свяжитесь с нами.

Итоги

Groq LPU — не просто очередной чип очередного стартапа, а показатель того, что рынок ИИ-железа входит в эпоху, где инференс важнее обучения. Groq одной из первых распознала эту тенденцию, а главный игрок отрасли не стал ждать, пока перспективные новички займут его долю, и встроил LPU в собственную экосистему. LPU не заменит GPU: это сопроцессор для инференса, такой же специализированный инструмент, какими когда-то стали тензорные ядра для матричных вычислений внутри GPU. Но не исключено, что в обозримом будущем Nvidia объединит решения для обучения и инференса в одном универсальном ускорителе.

*Llama — проект Meta Platforms Inc., деятельность которой в России признана экстремистской и запрещена.