Четыре триллиона транзисторов на одном кремниевом диске. 750 токенов в секунду — вдесятеро быстрее, чем на GPU-кластерах. OpenAI выбрасывает на рынок GPT-5.6 Sol не как очередную модель, а как заявку на смену архитектуры.

🎯
OpenAI запускает флагманскую модель GPT-5.6 Sol на wafer-scale чипах (монолитных процессорах размером с пластину) Cerebras WSE-3 — впервые frontier-модель работает не на GPU

Скорость инференса достигает 750 токенов в секунду — на порядок выше GPU-кластеров, что меняет сценарии использования AI-агентов

Контракт между OpenAI и Cerebras превышает $10 млрд, а публичный релиз Sol задерживается из-за запроса правительства США на дополнительную проверку
750 t/s GPT-5.6 Sol на Cerebras ↑ 10× vs GPU-кластеры

Скорость инференса GPT-5.6 Sol

Типичный GPU-кластер выдаёт 40–120 токенов в секунду на модели класса GPT. Cerebras WSE-3 поднимает планку до 750. Разница между «подождать минуту» и «получить ответ за секунду» · OpenAI, Cerebras, июль 2026

26 июня OpenAI анонсировала семейство GPT-5.6 — три модели: Sol, Terra, Luna. Sol — флагман, способный решать сложнейшие задачи вроде многослойного аудита кода и исследовательских задач, требующих длинного контекстного окна. Но главная новость была не в бенчмарках.

Sol впервые в истории OpenAI работает не на GPU Nvidia, а на процессоре Cerebras WSE-3 — чипе размером с целую пластину. Это не эволюция, а смена парадигмы: вместо тысяч дискретных чипов, соединённых шиной, — одна монолитная кремниевая пластина с 4 трлн транзисторов и 900 тыс. ядер.

«Стратегия OpenAI в области вычислений — построить устойчивый портфель, подбирая правильные системы под правильные задачи. Cerebras добавляет выделенное решение для низколатентного инференса, — говорит Сачин Катти, руководитель compute-инфраструктуры OpenAI. — Это более быстрые ответы, более естественное взаимодействие и более прочная основа для масштабирования AI в реальном времени».

Контракт, подписанный ещё в январе 2026 года, предусматривает поставку 750 МВт вычислительной мощности Cerebras через 2028 год. Сумма — более $10 млрд. OpenAI уже выплатила Cerebras $1 млрд в качестве обеспеченного кредита на строительство дата-центров.

Почему монолитный чип быстрее GPU

Традиционный GPU-кластер — это сотни дискретных чипов, каждый со своей памятью, соединённых медными линиями. Данные путешествуют между чипами, упираясь в пропускную способность шины. Cerebras WSE-3 решает проблему радикально: весь чип — один кристалл. On-chip память — 44 ГБ SRAM с пропускной способностью 21 ПБ/с. Никаких переходов между чипами, никаких задержек.

Для операций GEMV (основной тип вычислений при инференсе LLM) Cerebras показывает ускорение в 606× по сравнению с NVIDIA A100 и в 10–20× по сравнению с кластерами A100 под управлением SGLang и vLLM. Эти цифры — из рецензируемой работы WaferLLM, опубликованной на arXiv.

«Мы в 2017 году встречались с командой OpenAI и обсуждали, что наступит момент, когда масштаб модели и архитектура чипа должны будут сойтись. Этот момент настал», — пишет Эндрю Фельдман, CEO Cerebras.

Принципиальное отличие: Cerebras не пытается ускорить существующую GPU-архитектуру. Он перестраивает вычислительную модель. Представьте, что все данные, необходимые для ответа модели, уже лежат в одном месте — не нужно ждать, пока они перетекут по кабелям. Это не «более быстрый GPU». Это другая физика.

Три модели, один чип — и правительство

Семейство GPT-5.6 включает три варианта. Sol — для сложнейших задач: аудит безопасности, научные исследования, многослойный code review. Terra — для бизнес-задач: поддержка клиентов, документооборот, аналитика. Luna — быстрая и дешёвая модель для повседневной работы: суммаризация, черновики, рутина.

Но публичный релиз Sol — под вопросом. OpenAI предварила запуск консультациями с правительством США, которое запросило дополнительную проверку на основе исполнительного указа от 2 июня 2026 года. Указ предписывает федеральным агентствам совместно разработать процесс бенчмаркинга и оценки новых AI-моделей перед широким релизом.

«Мы заранее показали правительству наши планы, — говорится в блоге OpenAI. — По их запросу мы начинаем с ограниченного предварительного доступа для небольшой группы проверенных партнёров».

Это прецедент. Ранее правительство США уже заблокировало Anthropic Claude Fable 5 — экспортным контролем. Теперь очередь Sol. Регуляторная архитектура AI-индустрии становится такой же значимой, как и техническая.

Что это значит для рынка чипов

Контракт OpenAI-Cerebras меняет расстановку сил на рынке AI-акселераторов. Nvidia остаётся доминантом, но впервые крупнейший заказчик AI-инфраструктуры публично диверсифицирует поставщика.

Cerebras подала заявку на IPO в апреле 2026 года, планируя привлечь около $2 млрд при оценке $23 млрд. Morgan Stanley — ведущий андеррайтер. OpenAI одновременно выступает крупнейшим клиентом и, через Сэма Альтмана, одним из ранних инвесторов Cerebras.

Конкуренты не стоят на месте. OpenAI одновременно разрабатывает собственный чип с Broadcom (кодовое название Jalapeño) и углубляет партнёрство с Microsoft по Maia. Nvidia, в свою очередь, поглотила Groq, усиливая позиции в инференсе. Рынок фрагментируется — и это идёт на пользу заказчикам.

Как мы писали в июле, рынок AI-инференса переживает структурный сдвиг: General Compute привлёк $400 млн под залог чипов, FlashTensors предложил 10× ускорение загрузки LLM через SSD. Решения «второго порядка» множатся, но Cerebras — единственный, кто меняет сам принцип вычислений.

Что изменит 750 токенов в секунду

Разница между 90 и 750 токенами в секунду — не бенчмарк. Это вопрос о том, может ли AI-агент работать в реальном времени.

Кодинг-агент, генерирующий pull request на 4000 токенов за 6 секунд — это принципиально другой инструмент, чем тот, что делает это за минуту. Голосовой ассистент с задержкой менее 200 мс — это естественный диалог, а не «подождите, я думаю».

«Базовое правило технологии: скорость — главный драйвер внедрения, — говорит Фельдман. — PC-индустрия не возникла бы без перехода от килогерц к мегагерцам, а современный интернет — без широкополосного доступа».

Cerebras публикует бенчмарки: на gpt-oss-120B процессор выдает 2700+ токенов в секунду против 900 у DGX B200 Blackwell (Nvidia). Для Llama 4 Maverick (400B параметров) — 2522 токена/с, что в 6 раз быстрее Groq и в 21 раз быстрее Nvidia на memory-bound нагрузках. При этом стоимость — около $0.0001 за 1000 токенов.

Не всё так однозначно. GPU остаются эффективнее для тренировки моделей и для массового batch-инференса, где latency не критична. Cerebras — нишевое решение для real-time задач. Но эта ниша — именно то место, где AI встречается с пользователем.

Сценарии развития

🔮
Wafer-scale станет стандартом для real-time AI-инференса к 2028 году

Вероятность: 60% — Cerebras доказывает эффективность на GPT-5.6 Sol, конкуренты (Tesla Dojo, Groq, Sambanova) ускоряют разработку аналогичных решений

✅ Аргументы за

Контракт OpenAI даёт Cerebras $20+ млрд выручки и валидацию на крупнейшем заказчике

WaferLLM (рецензированная работа arXiv) подтверждает 10–20× ускорение без теоретических допущений

IPO Cerebras обеспечит финансирование масштабирования производства

Критерии подтверждения: Cerebras отчитывается о >50% загрузки 750 МВт к Q2 2027

❌ Аргументы против

Nvidia не стоит на месте — поглощение Groq и Blackwell Ultra могут сократить разрыв

Cerebras сильно зависит от одного заказчика: 86% выручки в 2025 пришлось на две связанные компании из ОАЭ

Wafer-scale сложно масштабировать: производство одного чипа требует дефектоустойчивой архитектуры, и yield остаётся проблемой

Критерии опровержения: OpenAI не продлевает контракт на дополнительный 1.25 ГВт после 2028

Что будет с рынком через год?

📊
Ключевые сигналы для отслеживания

Регуляторное решение по Sol: одобрит ли правительство США публичный релиз до сентября 2026
IPO Cerebras: оценка и аллокация покажут, верит ли рынок в wafer-scale как мейнстрим
Broadcom Jalapeño: успеет ли собственный чип OpenAI к 2027 и как изменится стратегия
Конкуренты: какой путь выберут Google (TPU), Amazon (Trainium) и Microsoft (Maia)
Nvidia: поглощение Groq даст результаты к Q4 2026 — сравнительные бенчмарки

Сценарии развития

🟢 Оптимистичный сценарий (25%)

Sol получает одобрение правительства, Cerebras доказывает состоятельность, wafer-scale становится третьим мейнстримным типом AI-процессоров — наряду с GPU и TPU. OpenAI продлевает контракт на дополнительный 1.25 ГВт.

Последствия: Рынок AI-чипов перестаёт быть монополией Nvidia, цены на инференс падают в 3–5 раз, появляются новые сценарии real-time AI

🟡 Базовый сценарий (55%)

Sol выходит в ограниченный доступ в 2026–2027, Cerebras сохраняет позицию нишевого провайдера для low-latency инференса. GPU остаются основой AI-инфраструктуры, но премиум-сегмент real-time уходит к специализированным чипам.

Последствия: Двухъярусный рынок: GPU для общего инференса, wafer-scale и LPU для времени. OpenAI диверсифицирует поставщиков, но не порывает с Nvidia

🔴 Пессимистичный сценарий (20%)

Правительство затягивает одобрение Sol, Nvidia отвечает Blackwell Ultra + Groq, Cerebras не справляется с масштабированием производства. OpenAI переключает фокус на собственный Jalapeño.

Последствия: Cerebras остаётся заметным, но не революционным игроком. IPO проходит ниже оценки, wafer-scale не становится стандартом
VentureBeat: OpenAI представляет GPT-5.6 Sol, Terra и Luna
Релиз семейства моделей с ограниченным доступом по запросу правительства США. Детальное описание Sol как флагманской модели и условий предварительного доступа.
Основной источник по анонсу GPT-5.6 и регуляторному контексту
AESOP: OpenAI запускает GPT-5.6 Sol на Cerebras с 750 токенами в секунду
Технический разбор архитектуры: 750 t/s, контракт на $20+ млрд, сравнение с Broadcom Jalapeño и GPU-кластерами.
Разбор архитектуры и коммерческих условий сделки
Cerebras: Партнёрство с OpenAI для высокоскоростного инференса
Официальный анонс многолетнего соглашения: 750 МВт, $10+ млрд, развёртывание в несколько этапов с 2026 по 2028 год.
Первичный источник — условия сделки и стратегия Cerebras