Один и тот же LLM на одном и том же H100. Разница в пропускной способности — 29%. В деньгах — $15 000 в месяц экономии на каждый миллион ежедневных запросов. Всё решает выбор фреймворка инференса.

🎯
Три вывода

SGLang и LMDeploy — лидеры по сырому throughput: ~16 200 токенов/с на H100 с Llama 3.1 8B. vLLM отстаёт на 29% (12 500 токенов/с), но выигрывает экосистемой и простотой развёртывания.

TensorRT-LLM — король задержки: на 20–40% ниже конкурентов на batch=1, но привязан к NVIDIA и требует экспертной настройки.

Выбор фреймворка зависит от сценария: SGLang для RAG и агентов (RadixAttention даёт 6,4× при повторяющихся префиксах), LMDeploy для квантованных моделей, vLLM для production с широкой совместимостью.

Рынок фреймворков инференса LLM в 2026 году — это не гонка одного победителя. Это портфель решений, каждое со своей архитектурой, компромиссами и зоной оптимального применения. Как мы писали в июле, AI-инфраструктура переходит в runtime-режим — выбор фреймворка становится критическим решением, от которого зависят и операционные расходы, и пользовательский опыт.

Шесть открытых фреймворков доминируют на рынке: vLLM, SGLang, TensorRT-LLM, LMDeploy, TGI и Ollama. Ещё два — Modular MAX и Aphrodite Engine — набирают обороты. Каждый использует разную архитектуру, разные алгоритмы управления памятью и разные стратегии батчеринга. Разница в throughput на одинаковом H100 достигает 29% между лидером и ближайшим конкурентом — и это без учёта специфики нагрузки.

Выбор фреймворка инференса стал стратегическим решением. Для стартапа, запускающего первый AI-продукт, ошибка означает сожжённый бюджет на GPU. Для enterprise-команды — переплату в миллионы долларов в год. Рынок фреймворков созрел — «просто взять vLLM» больше не очевидно правильный ответ.

16 200 токенов/с на H100 ↑ 29% vs vLLM

Лидеры по пропускной способности

SGLang v0.4.3 на H100 с Llama 3.1 8B в FP16 выдаёт 16 200 токенов/с. LMDeploy — 16 100 токенов/с. vLLM v0.18+ — 12 500 токенов/с. Разница в 29% даёт ~$15 000 экономии в месяц при миллионе запросов в день. · Genαi Benchmark, 2026

400K+ GPU под управлением

Масштаб в эксплуатации

SGLang работает на 400 000+ GPU по всему миру, генерируя триллионы токенов в день. RadixAttention — ключевое архитектурное преимущество для сценариев с повторяющимися системными промптами. · LMSYS, 2026

Растущий сегмент: фреймворки с кешированием префиксов

SGLang — самый быстрорастущий фреймворк 2026 года. Его ключевое отличие — RadixAttention: структура данных в виде radix-дерева, которая кеширует KV-кэш для повторяющихся префиксов промптов. В сценариях RAG и агентов с общими системными промптами (5–15 тыс. токенов) это даёт не 10–20%, а 2–4× эффективного прироста пропускной способности.

Разница особенно заметна на multi-turn задачах. Когда пользователь отправляет десять сообщений в одном чате, каждый следующий запрос содержит всю историю диалога. SGLang переиспользует KV-кэш для повторяющихся префиксов — time to first token (TTFT) на втором и последующих запросах падает в разы. vLLM с PagedAttention тоже кеширует, но на уровне страниц, а не префиксов — эффективность ниже.

В феврале 2026 года SGLang совместно с NVIDIA показал 25× прирост производительности DeepSeek R1 на GB300 NVL72 по сравнению с H200. Blackwell Ultra даёт 1,5× пикового NVFP4 throughput, 2× softmax throughput и 1,5× HBM3e. Когда эти три ускорения складываются с RadixAttention, результат — не линейный, а мультипликативный.

SGLang не привязан к NVIDIA — работает на AMD ROCm и поддерживает все основные open-source архитектуры. Установка через pip, но для продвинутой настройки требуется понимание внутренней архитектуры.

Угасающий сегмент: Text Generation Inference

Text Generation Inference от Hugging Face с декабря 2025 года — в maintenance mode. Новых оптимизаций не выходит. Hugging Face рекомендует мигрировать на vLLM или SGLang. TGI остаётся выбором только для тех, кто глубоко интегрирован в экосистему Hugging Face и не готов менять стек.

Даже в своей нише TGI проигрывает по throughput: на одинаковом H100 с одинаковой моделью SGLang быстрее на 35–50%. Для нового проекта выбирать TGI в 2026 году — значит закладывать технический долг с первого дня.

Новый игрок на рынке инференса

LMDeploy от Shanghai AI Laboratory — тёмная лошадка. Его движок TurboMind на C++ показывает пропускную способность на уровне SGLang (~16 100 токенов/с), но с уникальным преимуществом: лучшая в классе поддержка квантованных моделей. На Int4 LMDeploy работает в 2,4× быстрее конкурентов.

TurboMind использует persistent batch scheduling (планировщик постоянного пакетного обслуживания) — алгоритм, минимизирующий оверхед на переключение между запросами. В тестах с высокой конкурентностью это даёт более стабильную задержку, чем у vLLM, у которого TTFT быстрее деградирует при росте числа параллельных запросов.

Минус: оптимизирован преимущественно под NVIDIA GPU. Поддержка ROCm есть, но менее зрелая. Время компиляции — 5–10 минут против 30–60 у TensorRT-LLM, что делает TurboMind хорошим выбором для команд, которым нужен баланс между производительностью и гибкостью.

Сравнение шести фреймворков инференса

ПараметрvLLMSGLangTensorRT-LLMLMDeployTGIOllama
Throughput H100 12 500 tok/s 16 200 tok/s 1 600-2 200 tok/s* 16 100 tok/s ~10 000 tok/s 200-800 tok/s
Задержка (batch=1) baseline на уровне ✗ 20-40% ниже на уровне выше выше
Контекст 1M+ ✔ native ✔ native ✔ multi-block ◐ ограниченно ◐ ограниченно ◐ ограниченно
MoE ✔ wide EP ✔ expert routing ✔ native ◐ частично ✗ нет ✗ нет
Сложность настройки 4/10 7/10 ✗ 8/10 7/10 3/10 1/10
Привязка к железу Низкая (ROCm) Низкая (ROCm) ✗ Только NVIDIA Низкая (ROCm) Низкая Нет

Genαi, Spheron H100 Benchmark, LeetLLM 2026. *TensorRT-LLM throughput на Llama 3.1 70B (модель крупнее), на 8B показатели сопоставимы с vLLM

Экономика выбора фреймворка не ограничивается throughput. TensorRT-LLM даёт лучшую задержку на единичных запросах — если ваш сценарий требует минимального TTFT для каждого отдельного пользователя, а не максимальной суммарной пропускной способности, TensorRT-LLM может быть правильным выбором несмотря на более низкий aggregate throughput. Цена — привязка к NVIDIA и высокий порог входа: сборка и компиляция движка занимают 30–60 минут, а каждая новая модель требует повторной компиляции.

vLLM остаётся стандартом де-факто для production-сценариев. Не самый быстрый, но самый удобный: pip install, OpenAI-совместимый API, крупнейшее сообщество, широкая поддержка моделей и форматов. Для команды, которая запускает первый LLM-сервис, vLLM — правильный старт.

Ollama занимает отдельную нишу — локальная разработка и эксперименты. 200–800 токенов/с на H100, но работает на чём угодно, включая Apple Silicon и Windows. Для продакшена не годится, для быстрого прототипирования — незаменим. Установка в одну команду, модели скачиваются автоматически.

Как выбрать фреймворк для своего сценария

Универсального ответа нет, но есть чёткие паттерны. Если ваш сценарий — RAG или агент с большими системными промптами и многократными вызовами, SGLang с RadixAttention даст 2–4× преимущество, которое не покажет ни один одноразовый бенчмарк. Если вы обслуживаете квантованные модели на ограниченном бюджете VRAM, LMDeploy с Int4 работает в 2,4× быстрее альтернатив.

Для API-сервиса общего назначения, где пользователи переключаются между 50+ разными моделями, vLLM остаётся самым прагматичным выбором. Он не лидирует по сырой производительности, но стабильность API и экосистема перевешивают 29% разницы в throughput для большинства команд.

Если ваша инфраструктура завязана на NVIDIA и вам нужна минимальная задержка на каждый отдельный запрос, TensorRT-LLM — ваш вариант. Но будьте готовы к высокому порогу входа: каждая новая модель требует перекомпиляции движка (30–60 минут), а привязка к NVIDIA означает отсутствие возможности мигрировать на AMD или другие платформы.

Главный практический совет: не доверяйте vendor-бенчмаркам. Запускайте тесты на своём железе со своим трафиком. Open-source бенчмарки вроде llm-serving-benchmark позволяют воспроизвести тесты на одинаковом hardware. Ожидайте деградации на 30–50% при переходе от синтетических тестов к реальной нагрузке — это нормально для всех фреймворков.

Для команд, которые уже используют один фреймворк, миграция — нетривиальная задача. Прямая замена vLLM на SGLang не работает: они используют разные форматы кеша, разные API для advanced features и разные стратегии управления памятью. План миграции должен включать параллельный запуск двух движков на канарейке, замеры реальной производительности на своём трафике и rollback-план.

Экономический эффект от правильного выбора фреймворка измеряется не только в throughput. На масштабе 10 млн запросов в день разница между SGLang и vLLM составляет ~$150 000 в месяц при текущих ценах на H100. Это цена senior-инженера в команду инфраструктуры. Решение, принятое сегодня, будет влиять на P&L продукта весь следующий год.

Рынок движется быстро. Ещё год назад выбор был между vLLM и TGI. Сегодня — шесть серьёзных опций плюс emerging игроки. Фреймворки, которые лидируют по throughput сейчас, могут оказаться в maintenance mode через 12 месяцев, как это случилось с TGI. Единственная устойчивая стратегия — сохранять гибкость и не завязываться на один движок.

Ключевые сигналы для отслеживания

📊
Ключевые сигналы для отслеживания

MLPerf Inference v6.0 добавил стандартизированные LLM-бенчмарки с задачей GPT-OSS 120B — теперь можно сравнивать фреймворки по единой методологии, а не по разрозненным vendor-бенчмаркам.

Modular MAX с графовыми компилированными ядрами на Mojo показывает результаты выше vLLM на плотных моделях при высокой конкурентности — четвёртый серьёзный игрок на горизонте.

BitNet.cpp от Microsoft запускает 100B 1-bit LLM на CPU со скоростью 5-7 токенов/с — инференс без GPU меняет экономику edge-устройств.

Simplismart привлёк $7 млн от Accel на «самый быстрый инференс-движок», превышающий TogetherAI и FireworksAI по throughput на Llama 3.1 8B.

Один из главных уроков 2026 года: не существует какого-то лучшего фреймворка — существует лучший фреймворк для вашей конкретной нагрузки. SGLang выигрывает на RAG и агентах. TensorRT-LLM — на сценариях, где каждая миллисекунда задержки стоит денег. vLLM — там, где важны совместимость и скорость развёртывания. LMDeploy — для квантованных моделей на ограниченном бюджете памяти.

Лучшая стратегия для команды — сохранять архитектурную гибкость. Выбирайте фреймворк не по сегодняшним бенчмаркам, а по траектории развития команды и способности мигрировать, когда рыночная ситуация изменится. Через год лидеры могут поменяться.

Sources

vLLM vs TensorRT-LLM vs SGLang: H100 Benchmarks (2026)
Независимые бенчмарки трёх фреймворков на одинаковом H100 с одинаковой моделью. Базовые цифры throughput и latency.
Основной источник данных для сравнительной таблицы — тесты на идентичном железе
VLLM vs TensorRT-LLM vs SGLang: 2026 Serving Benchmark
Сводный анализ с данными из Spheron, LeetLLM и собственных замеров. Методология: same-hardware, same-model, same-load-shape.
Кросс-валидация цифр — используется для верификации расхождений между источниками
25x DeepSeek R1 Performance on GB300 with SGLang
Как SGLang и NVIDIA достигли 25× прироста на GB300 NVL72 за счёт архитектурных оптимизаций Blackwell Ultra.
Ключевой источник по растущему сегменту — масштабирование SGLang до 400К+ GPU