Инференс — самая дорогая часть ИИ, которую никто не считает. Точнее, считают, но не так. Стоимость одного миллиона токенов упала с $20 до $0,40 за три года — это падение в 1000 раз. Но бюджеты на инференс только растут. Потому что объёмы выросли быстрее, чем упали цены. И этот разрыв будет только увеличиваться. Таков основной парадокс новой экономики ИИ.

🎯
Главное

Инференс LLM подешевел в 1000× за три года — с $20 до $0,40 за млн токенов.

Инференс-оптимизация стала отдельной индустрией: Inferact (vLLM) привлёк $150M, Etched — $800M на custom ASIC, TensorMesh — $20M от Nvidia.

Парадокс в том, что общие расходы на инференс растут, несмотря на падение цен: агентные пайплайны потребляют в 50–200 раз больше токенов на задачу.

Цена инференса падала все три года. GPT-4-class модели в начале 2023 стоили $20–30 за миллион токенов. Сейчас — до $0,40. DeepSeek и вовсе предлагает по $0,07. Но общий счёт корпораций за инференс только растёт. Microsoft, по данным Bloomberg, тратит на инференс больше, чем на обучение. И это не аномалия — это новая норма.

Парадокс цены и объёма

Девальвация токена — одно из самых быстрых падений цены в истории технологий. За три года стоимость единицы вычислительной работы ИИ сократилась в 1000 раз. Для сравнения: транзистор дешевел в 2 раза каждые два года (закон Мура). Инференс дешевеет в 10 раз каждый год. И это не предел.

GPUnex Research фиксирует: совокупное падение сложилось из четырёх факторов — новое железо (каждое поколение GPU даёт 2–3× больше токенов на доллар), софтверная оптимизация (vLLM, TensorRT-LLM, SGLang подняли утилизацию GPU с 30% до 80%), архитектурные улучшения (MoE-модели активируют 30% параметров на токен вместо 100%) и конкуренция провайдеров (DeepSeek обвалил цены, заставив всех догонять).

Но парадокс в том, что корпоративные бюджеты на инференс растут, а не падают. По данным a16z, средняя компания из Fortune 500 тратит на инференс в 2026 году в 3 раза больше, чем в 2024-м. Причина — агентные пайплайны. Один запрос к GPT в 2023 году потреблял в среднем 500 токенов. Агентная задача в 2026 — от 10 000 до 50 000 токенов с учётом multi-turn, RAG и цепочек рассуждений. Это 20–100× больше токенов на единицу полезной работы.

$0,40 за млн токенов ↓ 98% с 2023

Стоимость GPT-4-класса инференса

С $20 за млн токенов в начале 2023 до $0,40 в середине 2026 · GPUnex Research, 2026

$50+ млрд рынок инференса 2026 ↑ 2,5× с 2024

Рынок инференса обгоняет обучение

Впервые затраты на инференс превысили расходы на обучение моделей · MarketsandMarkets, 2026

Что на подъёме

Рынок инференса в 2026 году оценивается в $50+ млрд — и впервые превышает рынок training-вычислений. Венчурные фонды реагируют соответственно. Inferact, коммерциализирующий vLLM, привлёк $150 млн seed при оценке $800 млн ещё до запуска публичного продукта. Основатели vLLM из Berkeley сделали то, что раньше казалось невозможным: построили бизнес на open-source инфраструктуре, которую уже используют Amazon и другие hyperscalerы.

Etched пошёл ещё дальше — $800 млн на производство custom ASIC (специализированной микросхемы) для inference-only (только инференса, без обучения). Идея радикальная: убрать из чипа все схемы, отвечающие за обучение, и получить 3–5× лучшую стоимость токена за счёт специализации. Первые прототипы на TSMC N4P уже выпущены, среди инвесторов — Джеффри Хинтон и Андрей Карпатый.

TensorMesh, как мы писали в июле, привлёк $20 млн от Nvidia и AMD с технологией KV-cache-оптимизации, которая обещает 10-кратное снижение стоимости инференса без потери качества. Утилизация GPU поднимается с 30–40% до 70–80% за счёт PagedAttention и continuous batching.

Что устаревает

Подход «одна модель на все задачи» уходит в прошлое. Эпоха monolithic LLM, когда одна гигантская модель обрабатывала все запросы, заканчивается. Её место занимает model routing — интеллектуальная маршрутизация запросов к моделям разного размера в зависимости от сложности задачи. По данным CRV, routing позволяет сократить затраты на 60–80% без ухудшения качества ответов для пользователя.

Традиционный batch-инференс без continuous batching — ещё один уходящий формат. vLLM со своим PagedAttention показал, что статическое выделение памяти под KV-cache — это потеря 60% GPU-ресурсов. Метод динамического управления памятью, заимствованный из virtual memory в ОС, стал стандартом де-факто.

Что появляется

Три техники задают следующий виток оптимизации. Первая — speculative decoding (спекулятивный декодинг): маленькая быстрая модель-черновик генерирует несколько токенов, большая модель их параллельно верифицирует. Результат математически идентичен обычной авторегрессии, но скорость — в 2–3 раза выше. Google Research показала, что комбинация speculative decoding с квантованием даёт до 5× ускорения на H100 без потери точности.

Вторая — prefill/decode disaggregation (разделение фаз): разделение фаз prefill (вычислительно ёмкая) и decode (ограничена памятью) на разные GPU. Позволяет оптимизировать каждую фазу независимо и подбирать железо под конкретный профиль нагрузки. BentoML и другие инфраструктурные проекты уже внедряют этот подход в production. Результат — до 40% снижения затрат при той же пропускной способности.

Третья — KV-cache reuse и remote caching (кэширование ключ-значение). LMCache и FlashTensors показывают, что вынос KV-cache из GPU-памяти в shared storage даёт 3–10× сокращение времени ответа для multi-turn сценариев. Техника особенно важна для RAG-пайплайнов, где контекст повторяется от запроса к запросу. По данным авторов LMCache, в production-сценариях с длинным контекстом кэш позволяет избежать до 90% повторных вычислений.

Четвёртая техника, набирающая обороты, — model routing (маршрутизация моделей). Вместо того чтобы отправлять все запросы одной модели, система анализирует сложность запроса и направляет его к оптимальной по стоимости модели. Простые вопросы — к маленьким open-source моделям за центы. Сложные — к frontier-моделям. По данным LockLLM, routing снижает затраты на 60–80% без ухудшения пользовательского опыта.

📊
Ключевые сигналы для отслеживания

Dynamic model routing становится стандартом deployment — все major провайдеры внедряют маршрутизацию по сложности запроса.
Inference-optimized ASIC (Etched, Groq) выходят из ниши — custom железо перестаёт быть экспериментальным.
OpenAI GPT-5.6 Sol на Cerebras WSE-3 показала конвергенцию модели и чипа — один воксель вычислений вместо распределённого кластера.
Serverless inference вытесняет always-on GPU — Regolo, Spheron и другие предлагают zero-idle-cost архитектуру.

Есть и другая сторона парадокса: дешёвый инференс меняет бизнес-модели. Когда стоимость токена падает до центов, становится экономически viable то, что раньше было невозможным. Персональные AI-ассистенты с полной историей контекста. Видеогенерация в реальном времени. AI-native SaaS с нулевой маржинальной стоимостью. Каждое удешевление на порядок открывает новый класс приложений, которые были нежизнеспособны при предыдущем уровне цен.

Аналитики Goldman Sachs оценивают совокупный экономический эффект от снижения стоимости инференса в $200–400 млрд дополнительного ВВП к 2030 году. Инвестиции в инфраструктуру инференса в 2026 году превысили $15 млрд — это больше, чем суммарные инвестиции в training-инфраструктуру за 2023–2024 годы.

Ключевой вопрос для инженеров и архитекторов — не как сделать модель умнее, а как сделать каждый токен дешевле при сохранении качества. Метрика, на которую смотрит вся индустрия, — cost per token (стоимость токена) при заданном качестве ответа. И здесь выигрывает не тот, у кого самая большая модель, а тот, у кого самый эффективный стек.

Особенно важно это для AI-агентов. Один агентный пайплайн может делать 50–200 LLM-вызовов на задачу. При стоимости $0,40 за млн токенов это кажется несущественным, но при масштабе в миллионы задач в день разница между оптимизированным и неоптимизированным стеком составляет миллионы долларов в год. Компании, которые инвестируют в inference-инфраструктуру сегодня, получают структурное преимущество в ценообразовании — они могут предлагать AI-продукты по цене, которую конкуренты без оптимизации не могут повторить.

Сравнение подходов к оптимизации

ТехникаВыигрышСложность внедренияКогда применять
Квантование (INT4/INT8) ✔ 2–4× меньше памяти Низкая — готовые инструменты Почти всегда
Continuous batching ✔ 3–10× пропускная способность Средняя — vLLM/SGLang Высокая нагрузка
Speculative decoding ✔ 2–3× скорость Средняя — нужна draft-модель Low-latency сценарии
KV-cache reuse ✔ 3–10× TTFT Высокая — инфраструктурно Multi-turn / RAG
Model routing ✔ 60–80% затрат Низкая — API gateway Гетерогенные нагрузки

Пять основных техник оптимизации инференса — по данным Morph, GPUnex, LockLLM, 2026

Сценарии развития

🟢 Оптимистичный: стоимость токена падает до $0,01

Специализированные ASIC + агентные оптимизации + квантование следующего поколения снижают стоимость до $0,01 за млн токенов к 2028. ИИ становится экономически эффективен для любого софта.

Критерии подтверждения: Etched и Groq подтверждают roadmap, Nvidia выходит на рынок inference-only чипов.

🟡 Базовый: цены стабилизируются на уровне $0,10–0,20

Темпы падения замедляются до 2–3× в год. Рынок консолидируется вокруг 3–4 основных подходов (квантование + routing + continuous batching).

Критерии подтверждения: Слияния и поглощения среди inference-стартапов, стандартизация стека.

🔴 Пессимистичный: энергетический потолок тормозит прогресс

Рост инференса упирается в лимиты энергосистем. Дата-центры потребляют 4% мировой электроэнергии. Регуляторы вводят ограничения. GPU-кластеры простаивают из-за нехватки мощности.

Критерии опровержения: SMR и геотермальная энергия для дата-центров масштабируются быстрее, чем растёт спрос на инференс.

Для стартапов снижение стоимости инференса означает не просто экономию — это меняет экономику продукта. Год назад AI-native SaaS-компания тратила 40–60% выручки на инференс. Сейчас, с оптимизированным стеком, эта доля падает до 10–15%. Разница — в возможности дойти до юнит-экономики, которая привлекает венчурный капитал, а не сжигает его. По данным a16z, стартапы, инвестировавшие в inference-оптимизацию на ранней стадии, показывают в 2 раза более высокую валовую маржу, чем конкуренты, использующие стандартные API без оптимизации. При этом эффект накапливается: каждая новая техника оптимизации даёт не аддитивный, а мультипликативный выигрыш. Квантование (2×) × continuous batching (3×) × routing (2×) = до 12× снижения затрат в одном стеке.

Главный вывод из 2026 года: инференс перестал быть технической деталью и стал стратегическим активом. Компании, которые контролируют свою стоимость токена, контролируют своё будущее на рынке AI-продуктов. Те, кто игнорирует оптимизацию, просто не выживут при масштабировании — их конкуренты смогут предлагать те же возможности в 5–10 раз дешевле. Экономика инференса — это новая экономика всей AI-индустрии.

Источники

Inference startup Inferact lands $150M to commercialize vLLM
vLLM стартовал как open-source проект в Berkeley, дорос до продакшена в Amazon и привлёк $150M seed.
Главный сигнал монетизации инфраструктурного слоя инференса
Inference chip startup Etched launches with $800M in funding
Специализированный inference-only чип на TSMC N4P — первая серьёзная попытка создать ASIC для инференса.
Custom silicon для инференса перестаёт быть теорией — Etched подтверждает рыночный спрос
AI Inference Economics: The 1,000× Cost Collapse Reshaping GPUs
Детальный разбор падения стоимости инференса: четыре фактора, проекции до 2028 года.
Комплексный анализ экономики инференса с верифицированными цифрами