12,6 PFLOPS для обучения и 10,1 PFLOPS для инференса — производительность новых чипов Google TPU 8-го поколения.
Ключевые выводы
TPU 8i получил 384 МБ встроенной SRAM и Collectives Acceleration Engine с задержкой на 5× ниже для работы ИИ-агентов.
Новая топология Boardfly сокращает сетевые переходы, позволяя связать до 1152 чипов в кластер.
Производительность TPU 8i
Пиковая производительность при инференсе, 288 ГБ HBM3 · Google, 2026
Агентный ИИ требует не просто мощности, а низкой задержки при тысячах параллельных вызовов инструментов.
TPU 8i создан под этот паттерн.
«384 МБ SRAM в TPU 8i меняет арифметику накладных расходов для инференса агентов — это перестроит архитектуры сервинга.»— Андрей Карпаты, экс-лидер AI Tesla, основатель Eureka Labs
Сравнение TPU 8t и TPU 8i
TPU 8t (обучение): 12,6 PFLOPS FP4, 128 МБ SRAM, 6 528 ГБ/с HBM3E, 3D torus сеть. TPU 8i (инференс): 10,1 PFLOPS FP4, 384 МБ SRAM, 8 601 ГБ/с HBM3, Boardfly сеть. Кластер 8t масштабируется до 134 000 чипов, 8i — до 1152 чипов в группе.
Как мы писали в мае, мега-сделки в секторе ИИ-агентов уже привлекли $950 млн, и инфраструктура для них становится критическим узким местом.
Станут ли раздельные чипы стандартом индустрии через год?
Вероятность: 65% — успех Google заставит Nvidia и AMD пересмотреть универсальные чипы.
✅ Аргументы за
Агентный ИИ требует специфической оптимизации инференса, которую не нужно смешивать с обучением. Снижение задержки на 5× критично для масштабирования тысяч агентов. Критерии подтверждения: анонс Nvidia отдельных чипов для инференса до конца 2026 года.
❌ Аргументы против
Универсальные чипы проще в разработке и дешевле в массовом производстве. Разработчикам придётся поддерживать две кодовые базы для разных чипов. Критерии опровержения: Google отказывается от раздельной линейки в 9-м поколении TPU.
Анонс Nvidia/Broadcom аналогичных раздельных чипов в 2026 году.
Рост доли агентного ИИ в нагрузке дата-центров до 70% к концу года.
Первые бенчмарки TPU 8i от независимых лабораторий.
Сценарии развития
🟢 Оптимистичный сценарий (30%)
Раздельные чипы снижают стоимость инференса на 40%, агентный ИИ массово внедряется в корпорациях. Последствия: Google занимает 35% рынка ИИ-ускорителей к 2028 году.
🟡 Базовый сценарий (50%)
Google удерживает лидерство в TPU, Nvidia сохраняет доминирование в GPU благодаря экосистеме CUDA. Последствия: рынок разделится на специализированные (Google) и универсальные (Nvidia) решения.
🔴 Пессимистичный сценарий (20%)
TPU 8t/8i не достигают заявленных показателей, разработчики предпочитают проверенные GPU Nvidia. Последствия: Google пересматривает стратегию TPU в пользу универсальных решений к 2027 году.
Первоисточник с детальным разбором Boardfly топологии и SRAM.
Официальный технический блог с данными о Collectives Acceleration Engine.
Контекст конкуренции с Nvidia и реакция сообщества разработчиков.