GPU выиграли эпоху тренировки. Инференс — другой матч, и в нём NVIDIA уязвимее, чем кажется.

🎯
Выводы

Стартап ElastixAI из Сиэтла превращает серийные FPGA-серверы в движки LLM-инференса и заявляет выигрыш до 50× по совокупной стоимости владения (TCO) против GPU-развёртываний.

Ставка построена на простом тезисе: инференс ограничен памятью, а не вычислениями, поэтому GPU в нём простаивают, а кастомные чипы устаревают раньше, чем выходят в продажу.

Первые поставки Elastix Rack запланированы на середину 2026 года — и это проверит, станет ли переконфигурируемое железо третьей силой между NVIDIA и ASIC-стартапами.

Основатели — инженеры из Apple и Meta. CEO Мохаммад Растегари в 2020 году продал Apple свою первую компанию Xnor.ai примерно за $200 млн, потом вел оптимизацию инференса Llama 405B в Meta, где упирался в потолок скорости генерации. CTO Саман Надерипаризи и CSO Махьяр Наджиби — из того же круга. Суммарно у команды более 24 000 научных цитирований.

Раунд — $18 млн посевного раунда в мае 2025-го, лид — фонд Fuse VC из Сан-Франциско. Из стелса компания вышла в феврале 2026-го. Теперь поставляется этап, который отличает хронику сорока инференс-стартапов от зрелой индустрии: железо, а не презентация.


ХРОНИКА: ElastixAI — путь к FPGA-инференсу
─────────────────────────────────────────────────────────────
  2020 ──────── 2020–24 ────── май 2025 ──── фев 2026 ── сер. 2026
  ⚫     ────── 🔬  ───────── 💰          ─── 🚀      ─── 🔥
  Xnor.ai       инференс     $18M seed    выход из    первые
  куплена       Llama 405B   (Fuse VC)    стелса +    поставки
  Apple         в Meta                    анонс        Elastix
                                          Elastix      Rack
                                          Rack

Хронология компании по данным All About Circuits и Business Wire

Почему GPU плохо инференсят

Тренировка — задача вычислений. Инференс — задача памяти. Модель на каждом токене перечитывает веса и KV-кэш, и именно перемещение данных, а не арифметика, съедает ватты. Для этого GPU спроектирован плохо.

до 50× выигрыш по TCO ↑ 10–50× против B200

Стоимость инференса на стойку

Naderiparizi назвал диапазон «от 10 до 50 раз по стоимости при равном показателе токенов в секунду на пользователя». Цифры охватывают и CapEx, и OpEx и, по словам команды, проверены на партнёрских стойках. · All About Circuits, 2026

Диапазон, а не одна цифра, — из-за разной «латентности на пользователя». На 4-битном квантовании эффект особенно заметен: на H100 без нативной поддержки операторы достигали лишь 10% потенциала метода, потому что ядро приходилось дописывать софтом.

Стойка против стойки

Elastix переводит LLM на коммерческие FPGA-серверы и настраивает их софтом под конкретную модель. Перенастроить железо под новую архитектуру можно за недели, тогда как custom silicon (кастомный кремний) проектируется три года и выходит с устаревшими представлениями о модели.

ПараметрElastix RackNVIDIA GB200 NVL72
Питание стойки ✔ 17–19 кВт ✗ 120–200 кВт
Охлаждение ✔ воздушное ✗ жидкостное, спецстойки
Оптимизация ✔ под память и потоки ◐ под вычисления
Адаптация к модели ✔ недели ✗ годы к новому чипу

По данным All About Circuits и Elastix AI, 2026

Разница в охлаждении — не деталь. Доработка дата-центра под NVL72 стоит $5–10 млн на мегаватт, и большинство существующих площадок на 10–15 кВт на стойку не тянут такую модернизацию. Воздушная стойка 17–19 кВт встраивается в текущий контур дата-центра без перестройки.

Переломный момент: кремний против времени

Многие компании привлекали деньги под чип для архитектуры, которая была актуальна на момент старта. Потом появился mixture-of-experts (смесь экспертов) — и им пришлось переделывать кремний.— Мохаммад Растегари, CEO ElastixAI

Это и есть корень тезиса компании. Кастомный ASIC фиксирует представление о модели на долгие годы. FPGA переконфигурируется вместе с индустрией. NVIDIA уже признала предел GPU-подхода, поглотив Groq и встроив его LPU в собственный инференс-стек.

Чего не хватает FPGA-подходу

Зрелость софта: у GPU за плечами CUDA и два десятилетия экосистемы. Elastix закрывает брешь плагином vLLM вместо CUDA с совместимым фронт-эндом API OpenAI, а инструменты конвертации обещает открыть сообществу — по образу экосистемной стратегии NVIDIA.

Второй риск — честные метрики: независимых бенчмарков стойки пока опубликовано не было. Третий — рынок, где NVL72 уже стал стандартом для гиперскейлеров.

Что это значит

Дата-центры растут, а сеть — нет. Меняется и единица измерения. В эпоху тренировки все считали в FLOPs на доллар — это было понятно и достаточно. Теперь метрика иная: токены в секунду на ватт, потому что именно электричество стало дефицитом, а не чипы. Дженсен Хуанг в интервью Дваркешу назвал её главной для индустрии: когда вычислительная мощность упирается в сеть, остальное становится производной от того, сколько токенов вы получаете за каждый джоуль.

Инфраструктурные решения ближайших двух лет определят, у кого в индустрии окажется гриф-ватт с самой высокой маржой. Гиперскейлеры уже скупают GPU не под доступную мощность: NVIDIA отгрузила в 2025-м примерно 10 ГВт чипов, а собственные складские запасы выросли в четыре раза с 2024 года.

📊
Сигналы для отслеживания

1. Первые независимые бенчмарки Elastix Rack против B200 на токенах в секунду на ватт.

2. Принят ли выигрыш по TCO пилотными дата-центрами — не по пресс-релизу, а по заказам.

3. Откроет ли компания конвертер для сообщества и появится ли у FPGA-инференса своя CUDA-момент.

4. Ответ NVIDIA на «третий путь» — после Groq есть ли ещё поглощения в FPga-сегменте.

Ставка ElastixAI корректна экономически: экономика дата-центра действительно переходит на токены в секунду на ватт, а не на FLOPs. Ровно в этом направлении движутся и действующие игроки: NVIDIA встроила Groq в собственный стек, а гиперскейлеры собирают портфели архитектур под разные профили латентности. Вопрос остаётся один — в доверии цифрам. Пока их подтверждает только сама компания.

FPGA-платформа ElastixAI против GPU: эксклюзивное интервью
Детальные цифры компании: диапазон 10–50× по TCO, 17–19 кВт на стойку, пять раз меньше энергопотребления на токен при равной пропускной способности.
Первичный источник технической аргументации ElastixAI.
Экономика современного дата-центра — это токены в секунду на ватт
Разбор компании, где упирается инференс: память, охлаждение и стоимость мегаватта. Ключ к пониманию позиции ElastixAI.
Первоисточник с контекстом рынка: $5–10 млн за мегаватт ретрофита, 10 ГВт GPU в 2025-м.
ElastixAI запускает FPGA-платформу для инференса
Новость о выходе из стелса: $18 млн seed, программная совместимость с GPU-пайплайнами и рынок инференса до $255 млрд к 2030 году.
Независимое издание, фиксирующее факты запуска и раунда.