Google TPUv9 Triggerfish: один кристалл для обучения и инференса в агентном ИИ

Google последовательно наращивает собственную линейку тензорных ускорителей TPU, и очередной шаг в этом направлении — чип TPUv9 с кодовым именем Triggerfish, разрабатываемый совместно с MediaTek. Новинка адресована прежде всего сценариям агентного искусственного интеллекта, где на первый план выходят минимальные задержки, высокая пропускная способность памяти и способность обслуживать многократные итеративные вызовы без лишних накладных расходов.


От двух чипов — к одному: архитектурный сдвиг в TPUv9

Важнейшее отличие TPUv9 от предшествующего поколения TPUv8 кроется в подходе к разделению рабочих нагрузок. Ранее задачи обучения и инференса решались двумя отдельными специализированными чипами — Zebrafish (производство MediaTek) и Sunfish (производство Broadcom). Теперь Google объединяет оба режима в единый кристалл.

Производство серии TPUv9 запланировано на третий квартал 2027 года. Triggerfish выйдет вторым в линейке — вслед за базовым чипом Humufish, — а его полноценный коммерческий запуск ожидается в начале 2028 года.


Технические характеристики TPUv9 Triggerfish

Triggerfish — это специализированная модификация базового TPUv9 Humufish, заточенная под устранение главных ограничений современных ИИ-систем: нехватки сверхбыстрой памяти на кристалле и процессорных узких мест.

Ключевые технические нововведения по сравнению с Humufish:

  • Увеличение объёма встроенной SRAM в 2–3 раза — больше данных хранится непосредственно на кристалле, что сокращает латентность при обращении к параметрам модели.
  • Переход с HBM4 на HBM4E — память нового стандарта обеспечивает более высокую пропускную способность, необходимую при работе с крупными языковыми моделями.
  • Добавление нового «симуляционного кристалла» — дополнительный функциональный блок, расширяющий возможности чипа при сложных агентных сценариях с разветвлённой логикой вызовов.

Отдельного внимания заслуживает встроенный CPU-модуль, спроектированный MediaTek и интегрированный непосредственно в корпус основного вычислительного ASIC. Этот CPU-тайл управляет переключением между режимами обучения и инференса и даёт чипу три практических преимущества:

  • возможность хранить значительно больший объём данных локально, не покидая кристалл TPU;
  • снижение накладных расходов на перемещение данных между компонентами системы;
  • повышение эффективности на фазе декодирования — этапе, критически важном для агентных ИИ-приложений.

Производственная цепочка и экономика чипа

В производственной инфраструктуре TPUv9 Triggerfish произойдут заметные изменения. Основной вычислительный ASIC-кристалл по-прежнему будет изготавливаться на мощностях TSMC, однако для продвинутой упаковки рассматривается технология Intel EMIB — как более экономичная альтернатива традиционному методу TSMC CoWoS.

Распределение ролей выглядит следующим образом: Google вместе с ближайшими партнёрами проектирует и производит основной вычислительный кристалл Humufish, а MediaTek берёт на себя компоненты ввода-вывода и бэкенд-дизайн всего чипа.

По оценкам аналитика Мин-Чи Куо, Google планирует выпустить от 100 до 200 тысяч экземпляров Triggerfish в дополнение к 400–500 тысячам базовых чипов Humufish. Стоимость одного Triggerfish примерно на 30% выше цены Humufish — отражение более сложного производственного процесса и расширенных характеристик.


TPUv10 Icefish: что известно о следующем поколении

Пока TPUv9 ещё находится в разработке, в индустрии уже появляются первые сведения о Google TPUv10 с кодовым именем Icefish. Данных немного, но известно, что производство может переехать на мощности Samsung с использованием 2-нм техпроцесса. Ориентировочный выход TPUv10 Icefish ожидается в 2029–2030 годах.


Итоги: куда движется стратегия Google в области ИИ-ускорителей

Логика Google становится отчётливой: компания всё явственнее смещает приоритеты с максимальной теоретической пропускной способности в сторону реальной эффективности при агентных нагрузках. В этом классе задач выигрывает не тот, у кого больше FLOPS, а тот, кто может быстрее перебирать итерации с минимальными задержками — а для этого нужны объёмная сверхбыстрая SRAM, интегрированный CPU и оптимизированная фаза декодирования.

Уход Broadcom из текущей цепочки в пользу MediaTek вряд ли означает окончательный разрыв: скорее всего, Broadcom сосредоточится на других продуктах Google и может вернуться в следующем поколении. Более широкая тенденция очевидна: индустрия движется от узкоспециализированных ускорителей к универсальным чипам, одинаково компетентным как при обучении моделей, так и при инференсе агентных рабочих нагрузок.

Следите за актуальными новостями о серверном оборудовании и ИИ-инфраструктуре на страницах СервакМастер — мы поможем подобрать оптимальную конфигурацию сервера под ваши задачи.