Чем эффективнее становится AI-инференс, тем больше компаний на него тратят. Это не баг — это структурный парадокс всей индустрии.
Стоимость инференса упала в 1000× за три года — с $20 до $0,40 за миллион токенов. Но совокупные расходы растут: объём вычислений удваивается каждые 6–8 месяцев.
Четыре техники дают 80% эффекта: квантизация (FP8/INT4), continuous batching, speculative decoding и KV-cache-оптимизация. В комбинации они снижают стоимость токена в 5–10×.
Рынок инфраструктуры инференса превысит $50 млрд в 2026 году — впервые обогнав рынок training compute.
Базовый сценарий: одна H100 стоит $3/час и обрабатывает 50 токенов в секунду без оптимизации. С continuous batching — 16 000 токенов в секунду. Разница — не в «железе». В софте.
Эта статья — карта техник, которые реально работают в production. Без маркетинга. С цифрами.
Мы собрали данные по 79 конфигурациям инференса — от AWS p4d до локального RTX 5090 — и выделили четыре техники, которые дают 80% эффекта: квантизация, continuous batching, speculative decoding и KV-cache-оптимизация. Каждая снижает стоимость токена в 2–3×. В комбинации — в 5–10×.
Но есть нюанс: совокупные расходы индустрии на инференс растут, а не падают. Потому что каждая оптимизация открывает новые сценарии, которые потребляют ещё больше токенов. Это не баг — это структурная логика рынка.
Цена инференса — главный KPI 2026 года
Парадокс инференса звучит так: каждый процент снижения стоимости токена ведёт к росту потребления на 2–3%. Механизм простой — как только цена проходит порог, открываются новые сценарии использования.
Как мы писали в июне, за три года стоимость инференса упала в 1000× — GPT-4-equivalent стоит $0,40 за миллион токенов против $20 в конце 2022-го. Падение вызвано не одним фактором, а комбинацией четырёх: новое железо (каждое поколение GPU даёт 2–3× больше токенов на доллар), софтверная оптимизация (vLLM, TensorRT-LLM, SGLang подняли утилизацию GPU с 30–40% до 70–80%), архитектурная эффективность (MoE-модели активируют лишь часть параметров на токен) и конкуренция провайдеров.
Но объём потребления растёт быстрее, чем падает цена. Агентные пайплайны делают 50–200 LLM-вызовов на задачу. Средний многопользовательский контекст вырос с 4K токенов в 2024-м до 32K в 2026-м. Инференс теперь составляет 80–90% совокупной стоимости владения AI-системой.
Квантизация: 80% эффекта за 20% усилий
Квантизация снижает точность весов модели — и это даёт наибольший ROI среди всех техник оптимизации.
FP8 стал стандартом для Hopper GPU: 33% ускорения при потере 0,1–0,3% перплексии. На H100 FP8-квантизация — near-lossless. Для Blackwell доступен NVFP4 — ещё 2–4× throughput при 2–4% потери качества. Метод AWQ для INT4 сохраняет ~95% точности при сокращении VRAM в 3–4×.
Утилизация GPU: софт догоняет железо
Благодаря continuous batching и PagedAttention современные фреймворки утилизируют GPU на 70–80% против 30–40% два года назад · данные vLLM, 2026
Правило простое: всегда применяйте квантизацию. Это единственная техника, которая даёт прирост без компромиссов для большинства сценариев.
Фреймворки инференса: сравнительная карта 2026
Выбор inference engine значит больше, чем выбор модели. Неправильный engine — и вы теряете 3–10× производительности.
На 2026 год рынок поделён между пятью production-grade фреймворками. vLLM — абсолютный лидер по широте экосистемы. Его PagedAttention сократил потери KV-cache с 60–80% до 4%, а continuous batching даёт до 23× прирост throughput. Для типовых сценариев — лучший выбор.
SGLang доминирует в сценариях со сложными агентными пайплайнами благодаря RadixAttention — переиспользование префиксов даёт 70–90% cache hit. TensorRT-LLM — чемпион по raw throughput на NVIDIA, но требует десятков минут компиляции и крайне негибок. TGI от HuggingFace — стабильный выбор для простых развёртываний. llama.cpp — для CPU и edge.
🥇 vLLM — универсальный выбор, 80% сценариев
🥇 SGLang — сложные агенты, мульти-шаговые пайплайны
🥉 TensorRT-LLM — max throughput на NVIDIA, если готовы ждать компиляцию
🥉 Ollama / llama.cpp — локальные и edge-развёртывания
Пакетная обработка и KV-кэш: инженерный уровень
Системный уровень оптимизации даёт больший прирост, чем модельный — но требует глубоких знаний инфраструктуры.
Continuous batching — техника, при которой GPU не ждёт завершения всех запросов в батче. Как только один запрос закончил генерацию, engine немедленно добавляет новый в обработку. Результат: утилизация GPU растёт с 30% до 85%+ при высоком RPS.
KV-cache — главный потребитель VRAM в инференсе. Для модели 70B на контексте 32K токенов KV-cache занимает ~40 GB. Решения: PagedAttention (виртуализация кэша, устранение фрагментации), Multi-Head Latent Attention (сжатие KV-векторов в 4–6×) и prefix caching (переиспользование системных промптов между запросами).
Speculative decoding даёт 2–3× ускорение для latency-sensitive сценариев: маленькая «драфт-модель» генерирует черновик токенов, большая модель верифицирует их за один forward pass. Работает лучше всего на код-генерации и структурированных форматах. Для творческих задач speculative decoding бесполезна — предсказать следующее слово в свободном повествовании невозможно.
Важный нюанс: декодирование со спекуляцией (speculative decoding) требует дополнительной памяти под драфт-модель. На H100 с 80 GB это не проблема. На L4 с 24 GB — уже ограничение. Выбор драфт-модели — это trade-off между качеством черновика и overhead на её запуск. Оптимальное соотношение: драфт-модель в 10–20× меньше целевой.
Кэширование: бесплатные токены не существуют — почти
Самый недооценённый рычаг оптимизации — не квантизация, а кэширование. Большинство production-систем тратит 40–60% вычислительных ресурсов на повторную обработку одних и тех же системных промптов.
Prefix caching (кэширование префиксов) — техника, при которой engine сохраняет состояния attention для повторяющихся начальных частей запроса: системный промпт, инструкции, контекст пользователя. SGLang с RadixAttention достигает 70–90% cache hit на типовых агентных сценариях. Результат: throughput растёт в 2× без дополнительного железа.
Semantic caching идёт дальше: engine запоминает не точные префиксы, а семантически близкие запросы. Если пользователь спрашивает «как оптимизировать инференс?», а через минуту — «как ускорить LLM?», semantic cache возвращает готовый ответ. На повторяющихся запросах (call center, код-ревью, support) это даёт 3–5× снижение latency.
Ограничение: semantic caching работает только для idempotent-запросов — тех, где ответ не меняется от раза к разу. Для творческих задач и генерации кода — нет.
Ещё один cache-сценарий — prompt compression. Техника CompactContext сжимает историю диалога в 5–10× без потери смысла. Средний контекст агентной сессии из 30 шагов — 15K–30K токенов. После compaction — 3K–5K. Скорость compaction — 33K токенов в секунду. Затраты на сжатие окупаются на втором же шаге сессии. Особенно эффективно для customer support и document processing.
Экономика железа: считать стоимость токена
Главный сдвиг 2026 года — от cost-per-GPU-hour к cost-per-token. H100 выдаёт ~3× больше токенов на доллар, чем A100. L40S и специализированные ASIC (Groq LPU, Amazon Inferentia) — ещё 3–5× сверху.
Blackwell B200 — 2–4× прирост throughput по сравнению с H100 при сопоставимой цене. AMD MI350 и Intel Gaudi 3 добавляют конкурентное давление. Результат: стоимость инференса снижается на 40–50% в год только за счёт нового железа.
Парадокс сохраняется — даже при таком падении цены совокупный рынок инференса продолжит расти и превысит $50 млрд в 2026 году против $38 млрд в 2025-м. Причина: каждое снижение цены открывает новые категории применения.
Для команды, выбирающей инфраструктуру, правило простое: считайте не cost-per-GPU-hour, а cost-per-task. H100 за $3/час может быть дешевле L4 за $0,75/час, если выполняет задачу в 10× быстрее. GPUnex Research приводит типичный пример: инференс Llama 3.1 70B на H100 стоит $0,0012 за запрос, на L40S — $0,0009, на A100 — $0,0021. Разница в 2,3× между лучшим и худшим вариантом — при одинаковом качестве ответа.
Отдельная тема — выбор между self-hosted и API. Anthropic Claude Sonnet 4 стоит $3/$15 за миллион входных/выходных токенов. Self-hosted Llama 3.1 70B на H100 — $0,40/миллион при 80% утилизации. Разрыв — 7–35×. Для объёмов от 100M токенов в месяц self-hosted почти всегда выгоднее. Исключение — burst-сценарии с коэффициентом вариации >5×: здесь API дешевле из-за отсутствия простоев GPU.
Ещё один скрытый фактор — cold start. Serverless-инференс (Baseten, Modal, Replicate) платит за холодные старты контейнеров: 2–5 секунд загрузки весов модели. Для burst-трафика это означает, что эффективная стоимость первого запроса может быть в 50× выше стабильного состояния. Pre-warmed pools и pinning решают проблему, но требуют минимального гарантированного объёма трафика.
Практический чеклист развёртывания
На основе проанализированных конфигураций — порядок действий для команды, которая оптимизирует инференс с нуля.
Первый шаг — квантизация. Всегда. FP8 на Hopper, AWQ INT4 на старых GPU. Это 30–70% снижения стоимости токена без изменения кода.
Второй шаг — vLLM. Замена стандартного HuggingFace pipeline на vLLM с PagedAttention и continuous batching даёт 5–23× прирост throughput. Миграция — один день инженерной работы.
Третий шаг — prefix caching. Если ваш сценарий использует длинные системные промпты — включите кэширование. SGLang или vLLM с enable_prefix_caching. Это 1,5–2× снижения latency.
Четвёртый шаг — подбор GPU не по цене инстанса, а по cost-per-token на вашей конкретной нагрузке. Бенчмарк на реальных запросах, а не на synthetic benchmark. Результат может удивить: L40S часто выгоднее H100 для low-RPS сценариев. Для батчевой обработки (offline) — A100 даёт лучший throughput-per-dollar. Для real-time — H100 или L40S. Универсального лидера нет.
Отдельная рекомендация: не смешивайте train и inference на одном GPU. У них разные профили памяти и разные оптимальные конфигурации batching. Выделите отдельные инстансы под inference — это упростит мониторинг, масштабирование и cost attribution.
Пятый шаг — speculative decoding для latency-sensitive путей. Только после оптимизации всего остального — это техника последней мили. Даёт 2–3× на код-генерации, 0× на свободном тексте. Без baseline-оптимизации speculative decoding просто множит неэффективность.
Мониторинг: что измерять, чтобы не платить вслепую
Оптимизация без данных — гадание. Без мониторинга вы не знаете, что именно работает. В production инференса нужно измерять четыре метрики, и ни одна из них не очевидна на первый взгляд.
Первая — p95 latency и p95 time-to-first-token. Не средняя, а 95-й перцентиль. В инференсе распределение latency тяжелохвостое: 5% запросов могут быть в 10× дороже остальных из-за KV-cache-промахов и contention на GPU. Langfuse и Helicone покрывают этот сценарий из коробки.
Вторая — cache hit ratio (доля попаданий в кэш). Semantic и prefix caching превращают дорогой инференс в дешёвый lookup. Если hit ratio ниже 60% — вы неправильно настроили кэш или ваш сценарий не подходит для кэширования. В любом случае это сигнал к пересмотру архитектуры.
Третья — cost-per-user-per-session. В агентных сценариях один пользователь может генерировать 50–200 вызовов за сессию. Средний cost-per-user часто скрывает, что 10% пользователей генерируют 60% затрат. Без per-user-трекинга вы субсидируете самых дорогих пользователей за счёт маржи.
Четвёртая — throughput-per-dollar. Не raw throughput, а throughput, нормированный на стоимость инфраструктуры. Это единственная метрика, которая позволяет сравнивать H100 и L40S, self-hosted и API, AWS и GCP. При прочих равных — выбирайте конфигурацию с максимальным throughput-per-dollar.
Границы оптимизации
Не все техники работают для всех сценариев. Speculative decoding бесполезна для творческих задач с непредсказуемой структурой. Квантизация ниже 4 бит заметно деградирует на математике и рассуждениях. Мульти-арендность при фракциональном выделении GPU может приводить к tail-latency в 5–10× выше медианы.
Важное ограничение: GPU-утилизация 70–80% — это потолок для большинства конфигураций. Дальнейший прирост требует не софтверных оптимизаций, а перехода к инференс-специфичным чипам.
И второй структурный предел: контекстное окно растёт быстрее, чем объём HBM. Модели с 1M+ токенов уже реальность — FlashAttention-3 и MLA делают их возможными, но не дешёвыми. Стоимость long-context инференса остаётся в 5–20× выше short-context.
Сигналы: что дальше
Три тренда определят следующий виток.
Первый — инференс-специфичные чипы. Groq, Cerebras, d-Matrix, MatX проектируют архитектуры, оптимизированные исключительно под decode-фазу. Если они достигнут заявленных характеристик, cost-per-token может упасть ещё на порядок.
Второй — FP4 и ниже. Blackwell поддерживает NVFP4 на уровне ядра. Следующие поколения GPU будут нативно работать с 2-битными форматами. Для большинства приложений это означает «инференс практически бесплатен, платишь только за хранение весов». Бенчмарки показывают: NVFP4 даёт 1,6× прирост throughput над BF16 при 41% снижения энергопотребления и всего 2–4% потери качества. Это меняет экономику для high-volume сценариев.
Третий — fused-архитектуры модели и движка. DeepSeek-V3 с Multi-Head Latent Attention — первый пример модели, спроектированной под конкретный inference engine. Тренд будет усиливаться: следующие frontier-модели будут поставляться с предоптимизированным engine под каждое железо.
Четвёртый — edge inference. К 2028 году 75% данных будет обрабатываться на устройстве, а не в облаке. Lattice Semiconductor и Apple уже встраивают NPU для on-device LLM. Consumer Blackwell GPU (RTX 5090) показали 3,5–4,6× прирост throughput над предыдущим поколением при инференсе Qwen3-8B и Gemma3-27B. Для SME-сектора self-hosted инференс на потребительских GPU окупается за 4 месяца при 30M токенов в день.
Пятый — агентный инференс как отдельная категория. Multi-step reasoning меняет профиль нагрузки: длинные chain-of-thought, итеративные вызовы инструментов, чтение и запись в ранние контексты. TensorRT-LLM и vLLM уже добавляют специализированные scheduling policies под agentic workloads. Отдельные бенчмарки для agentic inference появятся в MLPerf к концу 2026 года.
Эти пять трендов не альтернатива текущим техникам — они наслаиваются. Пока индустрия проходит через каждый этап, cost-per-token продолжит снижаться на 40–60% в год. Но порог «достаточно дёшево» будет сдвигаться вслед за открывающимися сценариями.
Вывод
Главный парадокс AI-инференса никуда не исчезнет. Оптимизация не снижает совокупные расходы индустрии — она расширяет рынок. Но для конкретной команды выбор правильной комбинации техник — квантизация + vLLM + prefix caching + continuous batching — снижает стоимость токена в 5–10×. Этого достаточно, чтобы превратить убыточный AI-продукт в прибыльный.
Показательный пример: сервис AI-кодирования снизил cost-per-запрос с $0,008 до $0,0007 за счёт перехода с GPT-4 API на self-hosted Llama 3.1 70B с AWQ INT4 квантизацией и speculative decoding. Разница — 11,4×. Ни одной новой функции не добавили — только оптимизировали инфраструктуру. Без оптимизации тот же проект при текущем объёме трафика был бы убыточным на 40%.
Единственная стратегия, которая не работает — не оптимизировать вообще. Чем раньше команда начинает измерять cost-per-token, тем меньше денег сжигает впустую.
На практике это означает следующее: baseline-конфигурация (HuggingFace pipeline на одном GPU без квантизации) стоит примерно $0,003–0,005 за запрос к Llama 3.1 70B. После применения описанных выше техник — квантизация FP8, vLLM с continuous batching, prefix caching — стоимость падает до $0,0003–0,0006. Пятикратная разница. На объёме 10M запросов в месяц — $30 000 против $6000.
Второй порядок величины доступен при переходе от API к self-hosted: $0,0001–0,00004 за запрос на H100 при 80% утилизации. Ещё 3–4× выигрыша даёт правильный подбор GPU под конкретную нагрузку вместо стандартного «возьмём H100, потому что все берут».
Третья декада — speculative decoding и semantic caching. Но это опции для команд, которые уже выбрали все «низкие яблоки». Каждая следующая техника даёт меньший прирост, чем предыдущая — закон убывающей отдачи работает и здесь. Поэтому порядок имеет значение: начинать надо с квантизации, заканчивать — мониторингом cost-per-token, чтобы видеть, где остановиться.