Google TPUv9 Triggerfish: один кристалл для обучения и инференса в агентном ИИ
Google последовательно наращивает собственную линейку тензорных ускорителей TPU, и очередной шаг в этом направлении — чип TPUv9 с кодовым именем Triggerfish, разрабатываемый совместно с MediaTek. Новинка адресована прежде всего сценариям агентного искусственного интеллекта, где на первый план выходят минимальные задержки, высокая пропускная способность памяти и способность обслуживать многократные итеративные вызовы без лишних накладных расходов.
От двух чипов — к одному: архитектурный сдвиг в TPUv9
Важнейшее отличие TPUv9 от предшествующего поколения TPUv8 кроется в подходе к разделению рабочих нагрузок. Ранее задачи обучения и инференса решались двумя отдельными специализированными чипами — Zebrafish (производство MediaTek) и Sunfish (производство Broadcom). Теперь Google объединяет оба режима в единый кристалл.
Производство серии TPUv9 запланировано на третий квартал 2027 года. Triggerfish выйдет вторым в линейке — вслед за базовым чипом Humufish, — а его полноценный коммерческий запуск ожидается в начале 2028 года.
Технические характеристики TPUv9 Triggerfish
Triggerfish — это специализированная модификация базового TPUv9 Humufish, заточенная под устранение главных ограничений современных ИИ-систем: нехватки сверхбыстрой памяти на кристалле и процессорных узких мест.
Ключевые технические нововведения по сравнению с Humufish:
- Увеличение объёма встроенной SRAM в 2–3 раза — больше данных хранится непосредственно на кристалле, что сокращает латентность при обращении к параметрам модели.
- Переход с HBM4 на HBM4E — память нового стандарта обеспечивает более высокую пропускную способность, необходимую при работе с крупными языковыми моделями.
- Добавление нового «симуляционного кристалла» — дополнительный функциональный блок, расширяющий возможности чипа при сложных агентных сценариях с разветвлённой логикой вызовов.
Отдельного внимания заслуживает встроенный CPU-модуль, спроектированный MediaTek и интегрированный непосредственно в корпус основного вычислительного ASIC. Этот CPU-тайл управляет переключением между режимами обучения и инференса и даёт чипу три практических преимущества:
- возможность хранить значительно больший объём данных локально, не покидая кристалл TPU;
- снижение накладных расходов на перемещение данных между компонентами системы;
- повышение эффективности на фазе декодирования — этапе, критически важном для агентных ИИ-приложений.
Производственная цепочка и экономика чипа
В производственной инфраструктуре TPUv9 Triggerfish произойдут заметные изменения. Основной вычислительный ASIC-кристалл по-прежнему будет изготавливаться на мощностях TSMC, однако для продвинутой упаковки рассматривается технология Intel EMIB — как более экономичная альтернатива традиционному методу TSMC CoWoS.
Распределение ролей выглядит следующим образом: Google вместе с ближайшими партнёрами проектирует и производит основной вычислительный кристалл Humufish, а MediaTek берёт на себя компоненты ввода-вывода и бэкенд-дизайн всего чипа.
По оценкам аналитика Мин-Чи Куо, Google планирует выпустить от 100 до 200 тысяч экземпляров Triggerfish в дополнение к 400–500 тысячам базовых чипов Humufish. Стоимость одного Triggerfish примерно на 30% выше цены Humufish — отражение более сложного производственного процесса и расширенных характеристик.
TPUv10 Icefish: что известно о следующем поколении
Пока TPUv9 ещё находится в разработке, в индустрии уже появляются первые сведения о Google TPUv10 с кодовым именем Icefish. Данных немного, но известно, что производство может переехать на мощности Samsung с использованием 2-нм техпроцесса. Ориентировочный выход TPUv10 Icefish ожидается в 2029–2030 годах.
Итоги: куда движется стратегия Google в области ИИ-ускорителей
Логика Google становится отчётливой: компания всё явственнее смещает приоритеты с максимальной теоретической пропускной способности в сторону реальной эффективности при агентных нагрузках. В этом классе задач выигрывает не тот, у кого больше FLOPS, а тот, кто может быстрее перебирать итерации с минимальными задержками — а для этого нужны объёмная сверхбыстрая SRAM, интегрированный CPU и оптимизированная фаза декодирования.
Уход Broadcom из текущей цепочки в пользу MediaTek вряд ли означает окончательный разрыв: скорее всего, Broadcom сосредоточится на других продуктах Google и может вернуться в следующем поколении. Более широкая тенденция очевидна: индустрия движется от узкоспециализированных ускорителей к универсальным чипам, одинаково компетентным как при обучении моделей, так и при инференсе агентных рабочих нагрузок.
Следите за актуальными новостями о серверном оборудовании и ИИ-инфраструктуре на страницах СервакМастер — мы поможем подобрать оптимальную конфигурацию сервера под ваши задачи.
