Эмилио Андере проектировал симуляции ядерных реакторов в Национальных лабораториях Сандия, а затем работал в Elicit — стартапе по поиску научных работ. Стивен Арельяно строил инфраструктуру Google Bard и писал код в Two Sigma. Оба окончили UChicago. В мае 2025-го они основали Wafer, летом прошли Y Combinator. 1 сентября 2026 года компания объявила о раунде Series A на $40 млн с оценкой выше $200 млн.
На AMD MI355X агенты компании выдают около 80% пропускной способности Nvidia B200 при стоимости ниже половины.
Что делает Wafer
Большинство оптимизаций инференса сейчас — разовая ручная работа перед деплоем. Wafer запускает агентов-инженеров по производительности: они следят за трафиком, требованиями по скорости и ограничениями, затем подбирают под каждый вызов модель, движок и GPU-кернел. Нагрузка меняется — раскладку пересобирают.
Работают на открытых моделях и оборудовании любого вендора. Основатель называет это «искусственный интеллект, который оптимизирует работу другого искусственного интеллекта». Каждый вызов получает свой маршрут: движок, кернелы, количество GPU. Компания продаёт результат — цену за токен и скорость ответа.
Цифры раунда
В апреле 2026-го Wafer закрыл сид-раунд на $4 млн с Fifty Years, Liquid2 и Y Combinator; среди ангелов были Джефф Дин и Войцех Заремба. В сентябре раунд Series A на $40 млн провели со-лиды Marathon и Chemistry. Новые инвесторы — Wing, AMD Ventures и Outset Capital; Fifty Years и YC удвоили позицию.
Участие AMD Ventures читается как заявка: вендор, который десятилетиями догоняет Nvidia, ставит на софтовый слой. В раунд вошли и ангелы — от Джеффа Дина до Гильермо Рауха и Мэттью Принса. По данным The Information, перед сделкой Wafer отклонил несколько предложений о поглощении от облачных провайдеров.
Почему это важно для инференса
Цифры, на которые смотрят, пришли с бенчмарка на AMD MI355X. На модели GLM-5.2 агенты Wafer вытягивают около 80% пропускной способности Nvidia B200 при цене ниже половины. Это 2626 токенов в секунду суммарно и 213 в однопоточном прогоне. Ускорение относительно исходной сборки — в 2–2,8 раза. DigitalOcean на Kimi 2.5 получил 11,33 раза.
Практическое значение такой цифры спорное, но направление ясно: чем ближе альтернатива к паритету по пропускной способности, тем увереннее её рассматривают как основной стек для корпоративного инференса. Заметно отстающее от Nvidia железо остаётся уделом задач без жёстких задержек.
Две цифры из бенчмарка стоит читать раздельно. 2626 токенов в секунду в сумме — пропускная способность тиражной развёртки. 213 токенов в секунду у одного потока — то, что чувствует пользователь во время ответа, то есть латентность. Для сервисов на языковых моделях второй показатель упирается в бюджет железа быстрее первого.
Инференс вышел в главную статью эксплуатации по арифметике: обучение супермоделей осталось уделом десятков лабораторий, а каждая витрина, агент и ассистент умножают количество ежедневных вызовов. Меньше долларов за токен при том же качестве — то, что определяет выживание в этом слое бизнеса.
Замок CUDA держится на софте, а не на транзисторах. Если слой оптимизации сглаживает разницу между чипами, покупатель получает рычаг на Nvidia и выбор вендора. AMD Ventures вкладывается в такой слой — сигнал, что и производитель так считает.
Инференс-инфраструктура притягивает деньги последние недели. Как мы писали в сентябре, TensorX строит суверенную сеть инференса для Европы за €8 млн; в августе мы писали о кластере IBM и Together AI на Nvidia Blackwell за $240 млн. Wafer играет в другой фазе: менять то, как используется уже установленное железо.
Где подвох
Категория молодая, и граница между оптимизацией и разовой настройкой под один случай пока размыта. Бенчмарки сняты на двух конфигурациях — MI355X с GLM-5.2 и Kimi 2.5. Продакшен-нагрузки других клиентов на тех же цифрах никто не публиковал; названных корпоративных заказчиков у компании в открытых источниках нет.
Раунд — ставка на обещание категории.
Вердикт
Сама оценка успеха Wafer не докажет. Его определят независимые прогоны на большем числе моделей. Премия в $200 млн опережает выручку: она платится за то, что выбор железа для инференса перестаёт быть единственным способом сэкономить.
Заявка сильная. Доказательства — впереди.