GPU выиграли эпоху тренировки. Инференс — другой матч, и в нём NVIDIA уязвимее, чем кажется.
Стартап ElastixAI из Сиэтла превращает серийные FPGA-серверы в движки LLM-инференса и заявляет выигрыш до 50× по совокупной стоимости владения (TCO) против GPU-развёртываний.
Ставка построена на простом тезисе: инференс ограничен памятью, а не вычислениями, поэтому GPU в нём простаивают, а кастомные чипы устаревают раньше, чем выходят в продажу.
Первые поставки Elastix Rack запланированы на середину 2026 года — и это проверит, станет ли переконфигурируемое железо третьей силой между NVIDIA и ASIC-стартапами.
Основатели — инженеры из Apple и Meta. CEO Мохаммад Растегари в 2020 году продал Apple свою первую компанию Xnor.ai примерно за $200 млн, потом вел оптимизацию инференса Llama 405B в Meta, где упирался в потолок скорости генерации. CTO Саман Надерипаризи и CSO Махьяр Наджиби — из того же круга. Суммарно у команды более 24 000 научных цитирований.
Раунд — $18 млн посевного раунда в мае 2025-го, лид — фонд Fuse VC из Сан-Франциско. Из стелса компания вышла в феврале 2026-го. Теперь поставляется этап, который отличает хронику сорока инференс-стартапов от зрелой индустрии: железо, а не презентация.
ХРОНИКА: ElastixAI — путь к FPGA-инференсу
─────────────────────────────────────────────────────────────
2020 ──────── 2020–24 ────── май 2025 ──── фев 2026 ── сер. 2026
⚫ ────── 🔬 ───────── 💰 ─── 🚀 ─── 🔥
Xnor.ai инференс $18M seed выход из первые
куплена Llama 405B (Fuse VC) стелса + поставки
Apple в Meta анонс Elastix
Elastix Rack
Rack
Хронология компании по данным All About Circuits и Business Wire
Почему GPU плохо инференсят
Тренировка — задача вычислений. Инференс — задача памяти. Модель на каждом токене перечитывает веса и KV-кэш, и именно перемещение данных, а не арифметика, съедает ватты. Для этого GPU спроектирован плохо.
Стоимость инференса на стойку
Naderiparizi назвал диапазон «от 10 до 50 раз по стоимости при равном показателе токенов в секунду на пользователя». Цифры охватывают и CapEx, и OpEx и, по словам команды, проверены на партнёрских стойках. · All About Circuits, 2026
Диапазон, а не одна цифра, — из-за разной «латентности на пользователя». На 4-битном квантовании эффект особенно заметен: на H100 без нативной поддержки операторы достигали лишь 10% потенциала метода, потому что ядро приходилось дописывать софтом.
Стойка против стойки
Elastix переводит LLM на коммерческие FPGA-серверы и настраивает их софтом под конкретную модель. Перенастроить железо под новую архитектуру можно за недели, тогда как custom silicon (кастомный кремний) проектируется три года и выходит с устаревшими представлениями о модели.
| Параметр | Elastix Rack | NVIDIA GB200 NVL72 |
|---|---|---|
| Питание стойки | ✔ 17–19 кВт | ✗ 120–200 кВт |
| Охлаждение | ✔ воздушное | ✗ жидкостное, спецстойки |
| Оптимизация | ✔ под память и потоки | ◐ под вычисления |
| Адаптация к модели | ✔ недели | ✗ годы к новому чипу |
По данным All About Circuits и Elastix AI, 2026
Разница в охлаждении — не деталь. Доработка дата-центра под NVL72 стоит $5–10 млн на мегаватт, и большинство существующих площадок на 10–15 кВт на стойку не тянут такую модернизацию. Воздушная стойка 17–19 кВт встраивается в текущий контур дата-центра без перестройки.
Переломный момент: кремний против времени
Многие компании привлекали деньги под чип для архитектуры, которая была актуальна на момент старта. Потом появился mixture-of-experts (смесь экспертов) — и им пришлось переделывать кремний.— Мохаммад Растегари, CEO ElastixAI
Это и есть корень тезиса компании. Кастомный ASIC фиксирует представление о модели на долгие годы. FPGA переконфигурируется вместе с индустрией. NVIDIA уже признала предел GPU-подхода, поглотив Groq и встроив его LPU в собственный инференс-стек.
Чего не хватает FPGA-подходу
Второй риск — честные метрики: независимых бенчмарков стойки пока опубликовано не было. Третий — рынок, где NVL72 уже стал стандартом для гиперскейлеров.
Что это значит
Дата-центры растут, а сеть — нет. Меняется и единица измерения. В эпоху тренировки все считали в FLOPs на доллар — это было понятно и достаточно. Теперь метрика иная: токены в секунду на ватт, потому что именно электричество стало дефицитом, а не чипы. Дженсен Хуанг в интервью Дваркешу назвал её главной для индустрии: когда вычислительная мощность упирается в сеть, остальное становится производной от того, сколько токенов вы получаете за каждый джоуль.
Инфраструктурные решения ближайших двух лет определят, у кого в индустрии окажется гриф-ватт с самой высокой маржой. Гиперскейлеры уже скупают GPU не под доступную мощность: NVIDIA отгрузила в 2025-м примерно 10 ГВт чипов, а собственные складские запасы выросли в четыре раза с 2024 года.
1. Первые независимые бенчмарки Elastix Rack против B200 на токенах в секунду на ватт.
2. Принят ли выигрыш по TCO пилотными дата-центрами — не по пресс-релизу, а по заказам.
3. Откроет ли компания конвертер для сообщества и появится ли у FPGA-инференса своя CUDA-момент.
4. Ответ NVIDIA на «третий путь» — после Groq есть ли ещё поглощения в FPga-сегменте.
Ставка ElastixAI корректна экономически: экономика дата-центра действительно переходит на токены в секунду на ватт, а не на FLOPs. Ровно в этом направлении движутся и действующие игроки: NVIDIA встроила Groq в собственный стек, а гиперскейлеры собирают портфели архитектур под разные профили латентности. Вопрос остаётся один — в доверии цифрам. Пока их подтверждает только сама компания.