Ещё несколько лет назад рынок ИИ-ускорителей держали Nvidia и догоняющая AMD, а редкие корпоративные разработки вроде IBM нацеливались на государственные тендеры. Сегодня картина другая: у AWS есть Trainium, у Google — TPU, а сотни стартапов делают собственные чипы разной степени оригинальности. Американская Cerebras из их числа заметно выделяется: компания заключила контракты с OpenAI и готовится к IPO. Её главная особенность — «царь-чипы» размером со всю кремниевую подложку 300 мм. Разберём, откуда взялась Cerebras, как устроены её ускорители, что в них реально, а что вызывает вопросы, и какие выводы из этого стоит сделать при выборе серверного оборудования для ИИ.
Откуда взялась Cerebras
Cerebras — не очередной стартап с чипами «на бумаге». Компанию основали в 2015 году, ещё до выхода первого ИИ-ускорителя Nvidia P100, так что её по праву считают одним из пионеров современного железа для искусственного интеллекта. Основатели — Эндрю Фельдман, Гэри Лаутербах, Майкл Джеймс, Шон Ли и Жан-Филипп Фрикер. Все пятеро раньше работали в SeaMicro, основанной в 2007 году и купленной AMD в 2012 году за $334 млн.
SeaMicro делала энергоэффективные микросерверы с высокой плотностью компонентов. Например, SM10000 объединял до 512 процессоров Intel Atom Z530 в корпусе 10U. Это стало возможным благодаря сети Freedom Fabric на базе ASIC: она связывала сотни микропроцессоров в топологию 3D torus с пропускной способностью до 1,28 Тбит/с. Позднее эта разработка легла в основу AMD Infinity Fabric. Опыт плотной упаковки вычислений и борьбы с узкими местами межсоединений определил философию Cerebras: пока остальные режут пластину на сотни мелких чипов, она использует её целиком.
Как устроен Wafer-Scale Engine
В сообществе чипы называют «царь-чипами», а официально они именуются Wafer-Scale Engine (WSE). Это не кристалл, вырезанный из пластины, а практически вся подложка целиком.
Почему пластины режут на кусочки
Другие производители — Nvidia, AMD, Google — режут пластины не потому, что мелкие чипы работают эффективнее, а потому что иначе было нельзя. При изготовлении большой подложки отдельные участки логики всегда получаются с браком: при высокотемпературной обработке (окислении, диффузии) в кремнии возникают структурные дефекты, влияющие на проводимость и работоспособность. Если использовать пластину целиком, она была бы бракованной всегда. Поэтому нерабочие участки отбрасывают, а из удачных делают процессоры.
Как Cerebras обошла проблему брака
Вместо того чтобы подстраиваться под дефекты, инженеры Cerebras решили устранить саму проблему:
- уменьшили каждое вычислительное ядро до 0,05 мм² — примерно 1% от размера ядра Nvidia H100;
- добавили резервные ядра, которые заменяют дефектные;
- спроектировали внутричиповую коммуникационную ткань, которая маршрутизирует данные в обход неисправных участков.
В итоге влияние бракованных областей сводится к минимуму, а их общее число уменьшается, поэтому производство WSE фактически безотходное и экономически оправданное. Кроме того, когда память, вычисления и межсоединения расположены на одной подложке, исчезают узкие места, свойственные GPU с внешней памятью HBM и межчиповыми связями NVLink. Именно этим объясняется огромная скорость генерации токенов у WSE.
Три поколения WSE
За более чем десять лет Cerebras выпустила всего три поколения чипов, тогда как Nvidia за то же время сменила десять поколений GPU. Причина в нехватке финансирования: никто не верил, что инженеры из поглощённой AMD компании сделают что-то работоспособное, а идея использовать всю подложку выглядела слишком амбициозной. К тому же в 2015 году никто не ожидал ИИ-бума, и инвесторы вкладывали деньги в метавселенные и криптовалюты.
| Параметр | WSE-1 | WSE-2 | WSE-3 |
|---|---|---|---|
| Представлен | август 2019 (Hot Chips) | апрель 2021 | март 2024 |
| Техпроцесс TSMC | 16 нм | 7 нм | 5 нм |
| Площадь | 46 225 мм² | 46 225 мм² | 46 225 мм² |
| Транзисторы | 1,2 трлн | 2,6 трлн | 4 трлн |
| Ядра | 400 000 | 850 000 | 900 000 |
| Встроенная SRAM | 18 ГБ | 40 ГБ | 44 ГБ |
| Пропускная способность памяти | 9 ПБ/с | 20 ПБ/с | 21 ПБ/с |
| Система | CS-1 | CS-2 | CS-3 |
WSE-1
Первое поколение стало сенсацией: оно доказало, что чип размером с 300-мм пластину технически возможен и коммерчески оправдан. 400 000 ядер Sparse Linear Algebra (SLA) оптимизированы под операции с разреженными тензорами. Внутренняя сеть Swarm в виде двумерной mesh-сетки обеспечивала обмен данными между ядрами с суммарной пропускной способностью 100 Пбит/с и наносекундными задержками, полностью убирая бутылочное горлышко межчиповых соединений. Система CS-1 при потреблении около 20 кВт (с учётом охлаждения и вспомогательной электроники) давала производительность, эквивалентную сотням GPU, в корпусе одного сервера.
WSE-2
Второе поколение сохранило площадь, но благодаря 7-нм техпроцессу более чем вдвое увеличило число транзисторов и ядер. Пропускная способность SRAM достигла 20 ПБ/с — за секунду можно передать объём данных, эквивалентный 5 000 фильмов в 4K. Пропускная способность внутренней сети выросла до 220 Пбит/с. На базе CS-2 стала доступна облачная платформа, и именно на нём построили суперкомпьютеры серии Condor Galaxy, включая Condor Galaxy 1 производительностью 4 EFLOPS.
Возникает закономерный вопрос: почему Condor Galaxy 1, мощнее El Capitan с его 1,7 EFLOPS, нет в TOP500? Ответ прост: рейтинг учитывает системы с вычислениями двойной точности FP64 (LINPACK), а WSE оптимизированы под разреженные тензоры и предназначены только для ИИ. Поэтому ни эта, ни любая другая система на WSE в TOP500 не попадёт — это не признак «скама», а следствие специализации.
WSE-3
Третье поколение — самый мощный одиночный чип в истории. 4 триллиона транзисторов — мировой рекорд; для сравнения, в Nvidia B200 их 208 миллиардов. Все 900 000 ядер заточены под ИИ: низкую точность (FP8, FP16), разреженные вычисления и паттерны доступа к памяти, типичные для трансформеров. Пропускная способность памяти в 21 ПБ/с более чем в 7 000 раз превышает показатель HBM3e у Nvidia H100. Пиковая производительность в FP16 — 125 PFLOPS, что примерно соответствует 3,5 серверам Nvidia DGX B200, но при вдвое меньшем энергопотреблении и в одном корпусе CS-3.
На WSE-3 основаны все современные достижения Cerebras в быстром инференсе, включая рекорды на Llama 3.1 405B и Llama 4 Maverick 400B, а также многомиллиардные контракты с OpenAI и AWS. По сравнению с WSE-2 число ядер и объём памяти выросли более чем вдвое, а по сравнению с WSE-1 число транзисторов выросло более чем в четыре раза, а пропускная способность памяти — почти в пять раз.
Аппаратная экосистема: CS-3, MemoryX и облако
WSE-3 нельзя купить и поставить в обычный сервер — он поставляется только в составе готовой системы CS-3. Это 16U-сервер с одним WSE-3, подключённым к внешней памяти MemoryX на DRAM DDR5 и NAND объёмом от 12 ТБ до 1,2 ПБ. Это позволяет работать с моделями до 24 триллионов параметров на одном ускорителе без сложного распределённого инференса.
Остаётся открытым вопрос, как сохраняется высокая скорость при подаче данных из относительно медленной DRAM в быструю, но всего 44-гигабайтную SRAM. Компания ответа не даёт, и это дополнительный повод для скепсиса у критиков.
Одна CS-3 потребляет 23 кВт, поэтому нужны жидкостное охлаждение, мощная подсистема питания и интерконнекты между чипами и стойками. Крупные заказчики и исследовательские организации могут купить CS-3 для собственных ЦОД. Цена официально не раскрывается, по некоторым данным, она составляет $2–3 млн, тогда как DGX B200 обойдётся примерно в $500 000.
Тем, кто не готов к капитальным затратам, доступна Cerebras Cloud — через API напрямую или через платформы AWS, Vercel и OpenRouter. Тарифы и скорость:
| Модель | Скорость | Вход, за 1 млн токенов | Выход, за 1 млн токенов |
|---|---|---|---|
| ZAI GLM 4.7 | ~1000 токенов/с | $2,25 | $2,75 |
| GPT OSS 120B | ~3000 токенов/с | $0,35 | $0,75 |
| Llama 3.1 8B | ~2200 токенов/с | $0,10 | $0,10 |
| Qwen 3 235B Instruct | ~1400 токенов/с | $0,60 | $1,20 |
На OpenRouter скорость инференса GLM 4.7 на мощностях Cerebras достигает 382 токенов в секунду, тогда как в API Google Vertex — лишь 97. За такую скорость Cerebras просит больше, но заметно это только на выходных токенах (около $2,12 за миллион), а входные стоят сопоставимо с конкурентами ($0,12 за миллион). Это может намекать на архитектурные ограничения стоек CS-3. Кроме того, список моделей невелик и далеко не самый свежий: GLM 4.7, GPT OSS 120B, Llama 3.1 8B и Qwen 3 235B Instruct. Причина в специфике чипов — каждую модель приходится долго адаптировать для запуска на WSE-3.
Финансы и перспективы
2026 год стал для Cerebras годом выхода на публичный рынок. 17 апреля 2026 года компания подала заявку на первое IPO с оценкой около $35 млрд (для сравнения, капитализация Intel — $339 млрд). Выручка выросла с $246 млн в 2022 году до $5,1 млрд в 2025 году, причём 2025-й стал первым прибыльным: чистая прибыль составила $2,38 млрд против убытка в $4,85 млрд годом ранее.
Главный драйвер роста — контракты с технологическими гигантами:
- OpenAI. Соглашение на сумму более $20 млрд предусматривает развёртывание 750 мегаватт мощностей Cerebras для инференса моделей OpenAI — это крупнейшее в мире развёртывание высокоскоростного ИИ-инференса. Дополнительно OpenAI предоставила Cerebras кредит $1 млрд в обмен на право получить до 10% акций компании.
- AWS. В марте 2026 года Amazon предложила гибридную схему: собственные чипы Trainium обрабатывают префилл, а Cerebras CS-3 берёт на себя декодирование. Это даёт скорость в 25 раз выше, чем у GPU Nvidia в сопоставимых конфигурациях.
Риски
- Концентрация выручки. Зависимость от нескольких мегаклиентов сохраняется. Если OpenAI, активно диверсифицирующая поставщиков железа, перейдёт на другие решения или собственные чипы, бизнесу Cerebras будет угрожать серьёзная опасность.
- Предел масштабирования. WSE уже занимает целую 300-мм пластину, увеличивать чип дальше физически невозможно. Рост производительности возможен лишь за счёт числа систем в кластере, а это возвращает проблемы межсоединений, от которых Cerebras пыталась уйти.
- Конкуренция. Nvidia по-прежнему занимает около 70% рынка, активно действуют Google TPU, Amazon Trainium и десятки стартапов, каждый со своим подходом.
Выводы и что это значит для выбора оборудования
Cerebras — не афера, а настоящая инженерная революция, нашедшая свою нишу и доказавшая коммерческую состоятельность. Компания решила задачу, которую десятилетиями считали нерешаемой: создала работоспособный и экономически выгодный чип размером с пластину. В специфических задачах инференса сверхбольших языковых моделей такая архитектура действительно на порядки превосходит традиционные GPU. Контракты с OpenAI (в тексте оригинала упоминалась и сумма свыше $100 млрд) и с AWS на гибридные развёртывания показывают, что крупнейшие игроки видят в технологии реальную ценность, а не маркетинговую иллюзию.
Но Cerebras — не «убийца Nvidia» и не универсальная замена GPU. Это узкоспециализированный инструмент с ограниченной гибкостью и высокими капитальными затратами: система стоит миллионы долларов, требует жидкостного охлаждения и 23 кВт на стойку, а набор поддерживаемых моделей невелик.
Для большинства компаний практический вывод такой: если нужны универсальность, возможность запускать любые модели, обучать и дообучать их, выбор по-прежнему лежит в области GPU-серверов. Wafer-scale-системы имеет смысл рассматривать как облачный сервис для сверхбыстрого инференса, а не как оборудование для собственной стойки. Подобрать конфигурацию под вашу ИИ-нагрузку поможет «СервакМастер»: посмотрите ИИ-серверы и серверы общего назначения либо свяжитесь с нами для расчёта сборки.
