Инференс — самая дорогая часть ИИ, которую никто не считает. Точнее, считают, но не так. Стоимость одного миллиона токенов упала с $20 до $0,40 за три года — это падение в 1000 раз. Но бюджеты на инференс только растут. Потому что объёмы выросли быстрее, чем упали цены. И этот разрыв будет только увеличиваться. Таков основной парадокс новой экономики ИИ.
Инференс LLM подешевел в 1000× за три года — с $20 до $0,40 за млн токенов.
Инференс-оптимизация стала отдельной индустрией: Inferact (vLLM) привлёк $150M, Etched — $800M на custom ASIC, TensorMesh — $20M от Nvidia.
Парадокс в том, что общие расходы на инференс растут, несмотря на падение цен: агентные пайплайны потребляют в 50–200 раз больше токенов на задачу.
Цена инференса падала все три года. GPT-4-class модели в начале 2023 стоили $20–30 за миллион токенов. Сейчас — до $0,40. DeepSeek и вовсе предлагает по $0,07. Но общий счёт корпораций за инференс только растёт. Microsoft, по данным Bloomberg, тратит на инференс больше, чем на обучение. И это не аномалия — это новая норма.
Парадокс цены и объёма
Девальвация токена — одно из самых быстрых падений цены в истории технологий. За три года стоимость единицы вычислительной работы ИИ сократилась в 1000 раз. Для сравнения: транзистор дешевел в 2 раза каждые два года (закон Мура). Инференс дешевеет в 10 раз каждый год. И это не предел.
GPUnex Research фиксирует: совокупное падение сложилось из четырёх факторов — новое железо (каждое поколение GPU даёт 2–3× больше токенов на доллар), софтверная оптимизация (vLLM, TensorRT-LLM, SGLang подняли утилизацию GPU с 30% до 80%), архитектурные улучшения (MoE-модели активируют 30% параметров на токен вместо 100%) и конкуренция провайдеров (DeepSeek обвалил цены, заставив всех догонять).
Но парадокс в том, что корпоративные бюджеты на инференс растут, а не падают. По данным a16z, средняя компания из Fortune 500 тратит на инференс в 2026 году в 3 раза больше, чем в 2024-м. Причина — агентные пайплайны. Один запрос к GPT в 2023 году потреблял в среднем 500 токенов. Агентная задача в 2026 — от 10 000 до 50 000 токенов с учётом multi-turn, RAG и цепочек рассуждений. Это 20–100× больше токенов на единицу полезной работы.
Стоимость GPT-4-класса инференса
С $20 за млн токенов в начале 2023 до $0,40 в середине 2026 · GPUnex Research, 2026
Рынок инференса обгоняет обучение
Впервые затраты на инференс превысили расходы на обучение моделей · MarketsandMarkets, 2026
Что на подъёме
Рынок инференса в 2026 году оценивается в $50+ млрд — и впервые превышает рынок training-вычислений. Венчурные фонды реагируют соответственно. Inferact, коммерциализирующий vLLM, привлёк $150 млн seed при оценке $800 млн ещё до запуска публичного продукта. Основатели vLLM из Berkeley сделали то, что раньше казалось невозможным: построили бизнес на open-source инфраструктуре, которую уже используют Amazon и другие hyperscalerы.
Etched пошёл ещё дальше — $800 млн на производство custom ASIC (специализированной микросхемы) для inference-only (только инференса, без обучения). Идея радикальная: убрать из чипа все схемы, отвечающие за обучение, и получить 3–5× лучшую стоимость токена за счёт специализации. Первые прототипы на TSMC N4P уже выпущены, среди инвесторов — Джеффри Хинтон и Андрей Карпатый.
TensorMesh, как мы писали в июле, привлёк $20 млн от Nvidia и AMD с технологией KV-cache-оптимизации, которая обещает 10-кратное снижение стоимости инференса без потери качества. Утилизация GPU поднимается с 30–40% до 70–80% за счёт PagedAttention и continuous batching.
Что устаревает
Подход «одна модель на все задачи» уходит в прошлое. Эпоха monolithic LLM, когда одна гигантская модель обрабатывала все запросы, заканчивается. Её место занимает model routing — интеллектуальная маршрутизация запросов к моделям разного размера в зависимости от сложности задачи. По данным CRV, routing позволяет сократить затраты на 60–80% без ухудшения качества ответов для пользователя.
Традиционный batch-инференс без continuous batching — ещё один уходящий формат. vLLM со своим PagedAttention показал, что статическое выделение памяти под KV-cache — это потеря 60% GPU-ресурсов. Метод динамического управления памятью, заимствованный из virtual memory в ОС, стал стандартом де-факто.
Что появляется
Три техники задают следующий виток оптимизации. Первая — speculative decoding (спекулятивный декодинг): маленькая быстрая модель-черновик генерирует несколько токенов, большая модель их параллельно верифицирует. Результат математически идентичен обычной авторегрессии, но скорость — в 2–3 раза выше. Google Research показала, что комбинация speculative decoding с квантованием даёт до 5× ускорения на H100 без потери точности.
Вторая — prefill/decode disaggregation (разделение фаз): разделение фаз prefill (вычислительно ёмкая) и decode (ограничена памятью) на разные GPU. Позволяет оптимизировать каждую фазу независимо и подбирать железо под конкретный профиль нагрузки. BentoML и другие инфраструктурные проекты уже внедряют этот подход в production. Результат — до 40% снижения затрат при той же пропускной способности.
Третья — KV-cache reuse и remote caching (кэширование ключ-значение). LMCache и FlashTensors показывают, что вынос KV-cache из GPU-памяти в shared storage даёт 3–10× сокращение времени ответа для multi-turn сценариев. Техника особенно важна для RAG-пайплайнов, где контекст повторяется от запроса к запросу. По данным авторов LMCache, в production-сценариях с длинным контекстом кэш позволяет избежать до 90% повторных вычислений.
Четвёртая техника, набирающая обороты, — model routing (маршрутизация моделей). Вместо того чтобы отправлять все запросы одной модели, система анализирует сложность запроса и направляет его к оптимальной по стоимости модели. Простые вопросы — к маленьким open-source моделям за центы. Сложные — к frontier-моделям. По данным LockLLM, routing снижает затраты на 60–80% без ухудшения пользовательского опыта.
Dynamic model routing становится стандартом deployment — все major провайдеры внедряют маршрутизацию по сложности запроса.
Inference-optimized ASIC (Etched, Groq) выходят из ниши — custom железо перестаёт быть экспериментальным.
OpenAI GPT-5.6 Sol на Cerebras WSE-3 показала конвергенцию модели и чипа — один воксель вычислений вместо распределённого кластера.
Serverless inference вытесняет always-on GPU — Regolo, Spheron и другие предлагают zero-idle-cost архитектуру.
Есть и другая сторона парадокса: дешёвый инференс меняет бизнес-модели. Когда стоимость токена падает до центов, становится экономически viable то, что раньше было невозможным. Персональные AI-ассистенты с полной историей контекста. Видеогенерация в реальном времени. AI-native SaaS с нулевой маржинальной стоимостью. Каждое удешевление на порядок открывает новый класс приложений, которые были нежизнеспособны при предыдущем уровне цен.
Аналитики Goldman Sachs оценивают совокупный экономический эффект от снижения стоимости инференса в $200–400 млрд дополнительного ВВП к 2030 году. Инвестиции в инфраструктуру инференса в 2026 году превысили $15 млрд — это больше, чем суммарные инвестиции в training-инфраструктуру за 2023–2024 годы.
Ключевой вопрос для инженеров и архитекторов — не как сделать модель умнее, а как сделать каждый токен дешевле при сохранении качества. Метрика, на которую смотрит вся индустрия, — cost per token (стоимость токена) при заданном качестве ответа. И здесь выигрывает не тот, у кого самая большая модель, а тот, у кого самый эффективный стек.
Особенно важно это для AI-агентов. Один агентный пайплайн может делать 50–200 LLM-вызовов на задачу. При стоимости $0,40 за млн токенов это кажется несущественным, но при масштабе в миллионы задач в день разница между оптимизированным и неоптимизированным стеком составляет миллионы долларов в год. Компании, которые инвестируют в inference-инфраструктуру сегодня, получают структурное преимущество в ценообразовании — они могут предлагать AI-продукты по цене, которую конкуренты без оптимизации не могут повторить.
Сравнение подходов к оптимизации
| Техника | Выигрыш | Сложность внедрения | Когда применять |
|---|---|---|---|
| Квантование (INT4/INT8) | ✔ 2–4× меньше памяти | Низкая — готовые инструменты | Почти всегда |
| Continuous batching | ✔ 3–10× пропускная способность | Средняя — vLLM/SGLang | Высокая нагрузка |
| Speculative decoding | ✔ 2–3× скорость | Средняя — нужна draft-модель | Low-latency сценарии |
| KV-cache reuse | ✔ 3–10× TTFT | Высокая — инфраструктурно | Multi-turn / RAG |
| Model routing | ✔ 60–80% затрат | Низкая — API gateway | Гетерогенные нагрузки |
Пять основных техник оптимизации инференса — по данным Morph, GPUnex, LockLLM, 2026
Сценарии развития
🟢 Оптимистичный: стоимость токена падает до $0,01
Критерии подтверждения: Etched и Groq подтверждают roadmap, Nvidia выходит на рынок inference-only чипов.
🟡 Базовый: цены стабилизируются на уровне $0,10–0,20
Критерии подтверждения: Слияния и поглощения среди inference-стартапов, стандартизация стека.
🔴 Пессимистичный: энергетический потолок тормозит прогресс
Критерии опровержения: SMR и геотермальная энергия для дата-центров масштабируются быстрее, чем растёт спрос на инференс.
Для стартапов снижение стоимости инференса означает не просто экономию — это меняет экономику продукта. Год назад AI-native SaaS-компания тратила 40–60% выручки на инференс. Сейчас, с оптимизированным стеком, эта доля падает до 10–15%. Разница — в возможности дойти до юнит-экономики, которая привлекает венчурный капитал, а не сжигает его. По данным a16z, стартапы, инвестировавшие в inference-оптимизацию на ранней стадии, показывают в 2 раза более высокую валовую маржу, чем конкуренты, использующие стандартные API без оптимизации. При этом эффект накапливается: каждая новая техника оптимизации даёт не аддитивный, а мультипликативный выигрыш. Квантование (2×) × continuous batching (3×) × routing (2×) = до 12× снижения затрат в одном стеке.
Главный вывод из 2026 года: инференс перестал быть технической деталью и стал стратегическим активом. Компании, которые контролируют свою стоимость токена, контролируют своё будущее на рынке AI-продуктов. Те, кто игнорирует оптимизацию, просто не выживут при масштабировании — их конкуренты смогут предлагать те же возможности в 5–10 раз дешевле. Экономика инференса — это новая экономика всей AI-индустрии.