12,6 PFLOPS для обучения и 10,1 PFLOPS для инференса — производительность новых чипов Google TPU 8-го поколения.

Ключевые выводы

🎯
Компания впервые за 10 лет разделила линейку TPU на отдельные чипы для обучения (8t) и инференса (8i).

TPU 8i получил 384 МБ встроенной SRAM и Collectives Acceleration Engine с задержкой на 5× ниже для работы ИИ-агентов.

Новая топология Boardfly сокращает сетевые переходы, позволяя связать до 1152 чипов в кластер.
10.1 PFLOPS FP4 ↑ 80% vs Ironwood

Производительность TPU 8i

Пиковая производительность при инференсе, 288 ГБ HBM3 · Google, 2026

Агентный ИИ требует не просто мощности, а низкой задержки при тысячах параллельных вызовов инструментов.

TPU 8i создан под этот паттерн.

«384 МБ SRAM в TPU 8i меняет арифметику накладных расходов для инференса агентов — это перестроит архитектуры сервинга.»— Андрей Карпаты, экс-лидер AI Tesla, основатель Eureka Labs

Сравнение TPU 8t и TPU 8i

TPU 8t (обучение): 12,6 PFLOPS FP4, 128 МБ SRAM, 6 528 ГБ/с HBM3E, 3D torus сеть. TPU 8i (инференс): 10,1 PFLOPS FP4, 384 МБ SRAM, 8 601 ГБ/с HBM3, Boardfly сеть. Кластер 8t масштабируется до 134 000 чипов, 8i — до 1152 чипов в группе.

Как мы писали в мае, мега-сделки в секторе ИИ-агентов уже привлекли $950 млн, и инфраструктура для них становится критическим узким местом.

Станут ли раздельные чипы стандартом индустрии через год?

🔮
К 2027 году большинство вендоров ИИ-ускорителей перейдут на раздельные архитектуры для обучения и инференса.

Вероятность: 65% — успех Google заставит Nvidia и AMD пересмотреть универсальные чипы.

✅ Аргументы за

Агентный ИИ требует специфической оптимизации инференса, которую не нужно смешивать с обучением. Снижение задержки на 5× критично для масштабирования тысяч агентов. Критерии подтверждения: анонс Nvidia отдельных чипов для инференса до конца 2026 года.

❌ Аргументы против

Универсальные чипы проще в разработке и дешевле в массовом производстве. Разработчикам придётся поддерживать две кодовые базы для разных чипов. Критерии опровержения: Google отказывается от раздельной линейки в 9-м поколении TPU.

📊
Ключевые сигналы для отслеживания

Анонс Nvidia/Broadcom аналогичных раздельных чипов в 2026 году.
Рост доли агентного ИИ в нагрузке дата-центров до 70% к концу года.
Первые бенчмарки TPU 8i от независимых лабораторий.

Сценарии развития

🟢 Оптимистичный сценарий (30%)

Раздельные чипы снижают стоимость инференса на 40%, агентный ИИ массово внедряется в корпорациях. Последствия: Google занимает 35% рынка ИИ-ускорителей к 2028 году.

🟡 Базовый сценарий (50%)

Google удерживает лидерство в TPU, Nvidia сохраняет доминирование в GPU благодаря экосистеме CUDA. Последствия: рынок разделится на специализированные (Google) и универсальные (Nvidia) решения.

🔴 Пессимистичный сценарий (20%)

TPU 8t/8i не достигают заявленных показателей, разработчики предпочитают проверенные GPU Nvidia. Последствия: Google пересматривает стратегию TPU в пользу универсальных решений к 2027 году.

Google's TPU 8t and TPU 8i address agentic AI
Обзор спецификаций новых чипов TPU 8-го поколения для агентного ИИ.

Первоисточник с детальным разбором Boardfly топологии и SRAM.

TPU 8t and TPU 8i technical deep dive
Технический анализ архитектуры 8-го поколения TPU от Google Cloud.

Официальный технический блог с данными о Collectives Acceleration Engine.

Google TPU 8t and 8i: 121 Exaflops, $21B Nvidia Challenge
Сравнение производительности TPU 8t/8i с решениями Nvidia и анализ рыночного влияния.

Контекст конкуренции с Nvidia и реакция сообщества разработчиков.