Чем эффективнее становится AI-инференс, тем больше компаний на него тратят. Это не баг — это структурный парадокс всей индустрии.

🎯
Главное

Стоимость инференса упала в 1000× за три года — с $20 до $0,40 за миллион токенов. Но совокупные расходы растут: объём вычислений удваивается каждые 6–8 месяцев.

Четыре техники дают 80% эффекта: квантизация (FP8/INT4), continuous batching, speculative decoding и KV-cache-оптимизация. В комбинации они снижают стоимость токена в 5–10×.

Рынок инфраструктуры инференса превысит $50 млрд в 2026 году — впервые обогнав рынок training compute.

Базовый сценарий: одна H100 стоит $3/час и обрабатывает 50 токенов в секунду без оптимизации. С continuous batching — 16 000 токенов в секунду. Разница — не в «железе». В софте.

Эта статья — карта техник, которые реально работают в production. Без маркетинга. С цифрами.

Мы собрали данные по 79 конфигурациям инференса — от AWS p4d до локального RTX 5090 — и выделили четыре техники, которые дают 80% эффекта: квантизация, continuous batching, speculative decoding и KV-cache-оптимизация. Каждая снижает стоимость токена в 2–3×. В комбинации — в 5–10×.

Но есть нюанс: совокупные расходы индустрии на инференс растут, а не падают. Потому что каждая оптимизация открывает новые сценарии, которые потребляют ещё больше токенов. Это не баг — это структурная логика рынка.

Цена инференса — главный KPI 2026 года

Парадокс инференса звучит так: каждый процент снижения стоимости токена ведёт к росту потребления на 2–3%. Механизм простой — как только цена проходит порог, открываются новые сценарии использования.

Как мы писали в июне, за три года стоимость инференса упала в 1000× — GPT-4-equivalent стоит $0,40 за миллион токенов против $20 в конце 2022-го. Падение вызвано не одним фактором, а комбинацией четырёх: новое железо (каждое поколение GPU даёт 2–3× больше токенов на доллар), софтверная оптимизация (vLLM, TensorRT-LLM, SGLang подняли утилизацию GPU с 30–40% до 70–80%), архитектурная эффективность (MoE-модели активируют лишь часть параметров на токен) и конкуренция провайдеров.

Но объём потребления растёт быстрее, чем падает цена. Агентные пайплайны делают 50–200 LLM-вызовов на задачу. Средний многопользовательский контекст вырос с 4K токенов в 2024-м до 32K в 2026-м. Инференс теперь составляет 80–90% совокупной стоимости владения AI-системой.

Квантизация: 80% эффекта за 20% усилий

Квантизация снижает точность весов модели — и это даёт наибольший ROI среди всех техник оптимизации.

FP8 стал стандартом для Hopper GPU: 33% ускорения при потере 0,1–0,3% перплексии. На H100 FP8-квантизация — near-lossless. Для Blackwell доступен NVFP4 — ещё 2–4× throughput при 2–4% потери качества. Метод AWQ для INT4 сохраняет ~95% точности при сокращении VRAM в 3–4×.

70–80% утилизация GPU ↑ 2× vs 2024

Утилизация GPU: софт догоняет железо

Благодаря continuous batching и PagedAttention современные фреймворки утилизируют GPU на 70–80% против 30–40% два года назад · данные vLLM, 2026

Правило простое: всегда применяйте квантизацию. Это единственная техника, которая даёт прирост без компромиссов для большинства сценариев.

Фреймворки инференса: сравнительная карта 2026

Выбор inference engine значит больше, чем выбор модели. Неправильный engine — и вы теряете 3–10× производительности.

На 2026 год рынок поделён между пятью production-grade фреймворками. vLLM — абсолютный лидер по широте экосистемы. Его PagedAttention сократил потери KV-cache с 60–80% до 4%, а continuous batching даёт до 23× прирост throughput. Для типовых сценариев — лучший выбор.

SGLang доминирует в сценариях со сложными агентными пайплайнами благодаря RadixAttention — переиспользование префиксов даёт 70–90% cache hit. TensorRT-LLM — чемпион по raw throughput на NVIDIA, но требует десятков минут компиляции и крайне негибок. TGI от HuggingFace — стабильный выбор для простых развёртываний. llama.cpp — для CPU и edge.

💡
Когда какой фреймворк выбирать

🥇 vLLM — универсальный выбор, 80% сценариев
🥇 SGLang — сложные агенты, мульти-шаговые пайплайны
🥉 TensorRT-LLM — max throughput на NVIDIA, если готовы ждать компиляцию
🥉 Ollama / llama.cpp — локальные и edge-развёртывания

Пакетная обработка и KV-кэш: инженерный уровень

Системный уровень оптимизации даёт больший прирост, чем модельный — но требует глубоких знаний инфраструктуры.

Continuous batching — техника, при которой GPU не ждёт завершения всех запросов в батче. Как только один запрос закончил генерацию, engine немедленно добавляет новый в обработку. Результат: утилизация GPU растёт с 30% до 85%+ при высоком RPS.

KV-cache — главный потребитель VRAM в инференсе. Для модели 70B на контексте 32K токенов KV-cache занимает ~40 GB. Решения: PagedAttention (виртуализация кэша, устранение фрагментации), Multi-Head Latent Attention (сжатие KV-векторов в 4–6×) и prefix caching (переиспользование системных промптов между запросами).

Speculative decoding даёт 2–3× ускорение для latency-sensitive сценариев: маленькая «драфт-модель» генерирует черновик токенов, большая модель верифицирует их за один forward pass. Работает лучше всего на код-генерации и структурированных форматах. Для творческих задач speculative decoding бесполезна — предсказать следующее слово в свободном повествовании невозможно.

Важный нюанс: декодирование со спекуляцией (speculative decoding) требует дополнительной памяти под драфт-модель. На H100 с 80 GB это не проблема. На L4 с 24 GB — уже ограничение. Выбор драфт-модели — это trade-off между качеством черновика и overhead на её запуск. Оптимальное соотношение: драфт-модель в 10–20× меньше целевой.

Кэширование: бесплатные токены не существуют — почти

Самый недооценённый рычаг оптимизации — не квантизация, а кэширование. Большинство production-систем тратит 40–60% вычислительных ресурсов на повторную обработку одних и тех же системных промптов.

Prefix caching (кэширование префиксов) — техника, при которой engine сохраняет состояния attention для повторяющихся начальных частей запроса: системный промпт, инструкции, контекст пользователя. SGLang с RadixAttention достигает 70–90% cache hit на типовых агентных сценариях. Результат: throughput растёт в 2× без дополнительного железа.

Semantic caching идёт дальше: engine запоминает не точные префиксы, а семантически близкие запросы. Если пользователь спрашивает «как оптимизировать инференс?», а через минуту — «как ускорить LLM?», semantic cache возвращает готовый ответ. На повторяющихся запросах (call center, код-ревью, support) это даёт 3–5× снижение latency.

Ограничение: semantic caching работает только для idempotent-запросов — тех, где ответ не меняется от раза к разу. Для творческих задач и генерации кода — нет.

Ещё один cache-сценарий — prompt compression. Техника CompactContext сжимает историю диалога в 5–10× без потери смысла. Средний контекст агентной сессии из 30 шагов — 15K–30K токенов. После compaction — 3K–5K. Скорость compaction — 33K токенов в секунду. Затраты на сжатие окупаются на втором же шаге сессии. Особенно эффективно для customer support и document processing.

Экономика железа: считать стоимость токена

Главный сдвиг 2026 года — от cost-per-GPU-hour к cost-per-token. H100 выдаёт ~3× больше токенов на доллар, чем A100. L40S и специализированные ASIC (Groq LPU, Amazon Inferentia) — ещё 3–5× сверху.

Blackwell B200 — 2–4× прирост throughput по сравнению с H100 при сопоставимой цене. AMD MI350 и Intel Gaudi 3 добавляют конкурентное давление. Результат: стоимость инференса снижается на 40–50% в год только за счёт нового железа.

Парадокс сохраняется — даже при таком падении цены совокупный рынок инференса продолжит расти и превысит $50 млрд в 2026 году против $38 млрд в 2025-м. Причина: каждое снижение цены открывает новые категории применения.

Для команды, выбирающей инфраструктуру, правило простое: считайте не cost-per-GPU-hour, а cost-per-task. H100 за $3/час может быть дешевле L4 за $0,75/час, если выполняет задачу в 10× быстрее. GPUnex Research приводит типичный пример: инференс Llama 3.1 70B на H100 стоит $0,0012 за запрос, на L40S — $0,0009, на A100 — $0,0021. Разница в 2,3× между лучшим и худшим вариантом — при одинаковом качестве ответа.

Отдельная тема — выбор между self-hosted и API. Anthropic Claude Sonnet 4 стоит $3/$15 за миллион входных/выходных токенов. Self-hosted Llama 3.1 70B на H100 — $0,40/миллион при 80% утилизации. Разрыв — 7–35×. Для объёмов от 100M токенов в месяц self-hosted почти всегда выгоднее. Исключение — burst-сценарии с коэффициентом вариации >5×: здесь API дешевле из-за отсутствия простоев GPU.

Ещё один скрытый фактор — cold start. Serverless-инференс (Baseten, Modal, Replicate) платит за холодные старты контейнеров: 2–5 секунд загрузки весов модели. Для burst-трафика это означает, что эффективная стоимость первого запроса может быть в 50× выше стабильного состояния. Pre-warmed pools и pinning решают проблему, но требуют минимального гарантированного объёма трафика.

Практический чеклист развёртывания

На основе проанализированных конфигураций — порядок действий для команды, которая оптимизирует инференс с нуля.

Первый шаг — квантизация. Всегда. FP8 на Hopper, AWQ INT4 на старых GPU. Это 30–70% снижения стоимости токена без изменения кода.

Второй шаг — vLLM. Замена стандартного HuggingFace pipeline на vLLM с PagedAttention и continuous batching даёт 5–23× прирост throughput. Миграция — один день инженерной работы.

Третий шаг — prefix caching. Если ваш сценарий использует длинные системные промпты — включите кэширование. SGLang или vLLM с enable_prefix_caching. Это 1,5–2× снижения latency.

Четвёртый шаг — подбор GPU не по цене инстанса, а по cost-per-token на вашей конкретной нагрузке. Бенчмарк на реальных запросах, а не на synthetic benchmark. Результат может удивить: L40S часто выгоднее H100 для low-RPS сценариев. Для батчевой обработки (offline) — A100 даёт лучший throughput-per-dollar. Для real-time — H100 или L40S. Универсального лидера нет.

Отдельная рекомендация: не смешивайте train и inference на одном GPU. У них разные профили памяти и разные оптимальные конфигурации batching. Выделите отдельные инстансы под inference — это упростит мониторинг, масштабирование и cost attribution.

Пятый шаг — speculative decoding для latency-sensitive путей. Только после оптимизации всего остального — это техника последней мили. Даёт 2–3× на код-генерации, 0× на свободном тексте. Без baseline-оптимизации speculative decoding просто множит неэффективность.

Мониторинг: что измерять, чтобы не платить вслепую

Оптимизация без данных — гадание. Без мониторинга вы не знаете, что именно работает. В production инференса нужно измерять четыре метрики, и ни одна из них не очевидна на первый взгляд.

Первая — p95 latency и p95 time-to-first-token. Не средняя, а 95-й перцентиль. В инференсе распределение latency тяжелохвостое: 5% запросов могут быть в 10× дороже остальных из-за KV-cache-промахов и contention на GPU. Langfuse и Helicone покрывают этот сценарий из коробки.

Вторая — cache hit ratio (доля попаданий в кэш). Semantic и prefix caching превращают дорогой инференс в дешёвый lookup. Если hit ratio ниже 60% — вы неправильно настроили кэш или ваш сценарий не подходит для кэширования. В любом случае это сигнал к пересмотру архитектуры.

Третья — cost-per-user-per-session. В агентных сценариях один пользователь может генерировать 50–200 вызовов за сессию. Средний cost-per-user часто скрывает, что 10% пользователей генерируют 60% затрат. Без per-user-трекинга вы субсидируете самых дорогих пользователей за счёт маржи.

Четвёртая — throughput-per-dollar. Не raw throughput, а throughput, нормированный на стоимость инфраструктуры. Это единственная метрика, которая позволяет сравнивать H100 и L40S, self-hosted и API, AWS и GCP. При прочих равных — выбирайте конфигурацию с максимальным throughput-per-dollar.

Границы оптимизации

Не все техники работают для всех сценариев. Speculative decoding бесполезна для творческих задач с непредсказуемой структурой. Квантизация ниже 4 бит заметно деградирует на математике и рассуждениях. Мульти-арендность при фракциональном выделении GPU может приводить к tail-latency в 5–10× выше медианы.

Важное ограничение: GPU-утилизация 70–80% — это потолок для большинства конфигураций. Дальнейший прирост требует не софтверных оптимизаций, а перехода к инференс-специфичным чипам.

И второй структурный предел: контекстное окно растёт быстрее, чем объём HBM. Модели с 1M+ токенов уже реальность — FlashAttention-3 и MLA делают их возможными, но не дешёвыми. Стоимость long-context инференса остаётся в 5–20× выше short-context.

Сигналы: что дальше

Три тренда определят следующий виток.

Первый — инференс-специфичные чипы. Groq, Cerebras, d-Matrix, MatX проектируют архитектуры, оптимизированные исключительно под decode-фазу. Если они достигнут заявленных характеристик, cost-per-token может упасть ещё на порядок.

Второй — FP4 и ниже. Blackwell поддерживает NVFP4 на уровне ядра. Следующие поколения GPU будут нативно работать с 2-битными форматами. Для большинства приложений это означает «инференс практически бесплатен, платишь только за хранение весов». Бенчмарки показывают: NVFP4 даёт 1,6× прирост throughput над BF16 при 41% снижения энергопотребления и всего 2–4% потери качества. Это меняет экономику для high-volume сценариев.

Третий — fused-архитектуры модели и движка. DeepSeek-V3 с Multi-Head Latent Attention — первый пример модели, спроектированной под конкретный inference engine. Тренд будет усиливаться: следующие frontier-модели будут поставляться с предоптимизированным engine под каждое железо.

Четвёртый — edge inference. К 2028 году 75% данных будет обрабатываться на устройстве, а не в облаке. Lattice Semiconductor и Apple уже встраивают NPU для on-device LLM. Consumer Blackwell GPU (RTX 5090) показали 3,5–4,6× прирост throughput над предыдущим поколением при инференсе Qwen3-8B и Gemma3-27B. Для SME-сектора self-hosted инференс на потребительских GPU окупается за 4 месяца при 30M токенов в день.

Пятый — агентный инференс как отдельная категория. Multi-step reasoning меняет профиль нагрузки: длинные chain-of-thought, итеративные вызовы инструментов, чтение и запись в ранние контексты. TensorRT-LLM и vLLM уже добавляют специализированные scheduling policies под agentic workloads. Отдельные бенчмарки для agentic inference появятся в MLPerf к концу 2026 года.

Эти пять трендов не альтернатива текущим техникам — они наслаиваются. Пока индустрия проходит через каждый этап, cost-per-token продолжит снижаться на 40–60% в год. Но порог «достаточно дёшево» будет сдвигаться вслед за открывающимися сценариями.

Вывод

Главный парадокс AI-инференса никуда не исчезнет. Оптимизация не снижает совокупные расходы индустрии — она расширяет рынок. Но для конкретной команды выбор правильной комбинации техник — квантизация + vLLM + prefix caching + continuous batching — снижает стоимость токена в 5–10×. Этого достаточно, чтобы превратить убыточный AI-продукт в прибыльный.

Показательный пример: сервис AI-кодирования снизил cost-per-запрос с $0,008 до $0,0007 за счёт перехода с GPT-4 API на self-hosted Llama 3.1 70B с AWQ INT4 квантизацией и speculative decoding. Разница — 11,4×. Ни одной новой функции не добавили — только оптимизировали инфраструктуру. Без оптимизации тот же проект при текущем объёме трафика был бы убыточным на 40%.

Единственная стратегия, которая не работает — не оптимизировать вообще. Чем раньше команда начинает измерять cost-per-token, тем меньше денег сжигает впустую.

На практике это означает следующее: baseline-конфигурация (HuggingFace pipeline на одном GPU без квантизации) стоит примерно $0,003–0,005 за запрос к Llama 3.1 70B. После применения описанных выше техник — квантизация FP8, vLLM с continuous batching, prefix caching — стоимость падает до $0,0003–0,0006. Пятикратная разница. На объёме 10M запросов в месяц — $30 000 против $6000.

Второй порядок величины доступен при переходе от API к self-hosted: $0,0001–0,00004 за запрос на H100 при 80% утилизации. Ещё 3–4× выигрыша даёт правильный подбор GPU под конкретную нагрузку вместо стандартного «возьмём H100, потому что все берут».

Третья декада — speculative decoding и semantic caching. Но это опции для команд, которые уже выбрали все «низкие яблоки». Каждая следующая техника даёт меньший прирост, чем предыдущая — закон убывающей отдачи работает и здесь. Поэтому порядок имеет значение: начинать надо с квантизации, заканчивать — мониторингом cost-per-token, чтобы видеть, где остановиться.

Источники

Mastering LLM Inference Techniques
Руководство NVIDIA по оптимизации инференса: от квантизации до развёртывания NIM microservices
Базовый reference по техникам ускорения инференса от производителя GPU
Private LLM Inference on Consumer Blackwell GPUs
Бенчмарки 79 конфигураций инференса на RTX 5060 Ti, 5070 Ti и 5090 с данными стоимости и энергопотребления
Систематическое сравнение cost-per-token на потребительских GPU против облачных API
Optimized Inference Deployment — HuggingFace LLM Course
Практическое руководство по TGI, vLLM и llama.cpp с критериями выбора фреймворка
Курс от HF: production-развёртывание LLM с конкретными конфигурациями
AI Inference Economics: The 1,000× Cost Collapse Reshaping GPUs
Анализ рынка инференса: цены, hardware и переход от training к inference как главный драйвер GPU-спроса
Данные по динамике рынка: от $38 млрд в 2025 до $55 млрд в 2026