Один и тот же LLM на одном и том же H100. Разница в пропускной способности — 29%. В деньгах — $15 000 в месяц экономии на каждый миллион ежедневных запросов. Всё решает выбор фреймворка инференса.
SGLang и LMDeploy — лидеры по сырому throughput: ~16 200 токенов/с на H100 с Llama 3.1 8B. vLLM отстаёт на 29% (12 500 токенов/с), но выигрывает экосистемой и простотой развёртывания.
TensorRT-LLM — король задержки: на 20–40% ниже конкурентов на batch=1, но привязан к NVIDIA и требует экспертной настройки.
Выбор фреймворка зависит от сценария: SGLang для RAG и агентов (RadixAttention даёт 6,4× при повторяющихся префиксах), LMDeploy для квантованных моделей, vLLM для production с широкой совместимостью.
Рынок фреймворков инференса LLM в 2026 году — это не гонка одного победителя. Это портфель решений, каждое со своей архитектурой, компромиссами и зоной оптимального применения. Как мы писали в июле, AI-инфраструктура переходит в runtime-режим — выбор фреймворка становится критическим решением, от которого зависят и операционные расходы, и пользовательский опыт.
Шесть открытых фреймворков доминируют на рынке: vLLM, SGLang, TensorRT-LLM, LMDeploy, TGI и Ollama. Ещё два — Modular MAX и Aphrodite Engine — набирают обороты. Каждый использует разную архитектуру, разные алгоритмы управления памятью и разные стратегии батчеринга. Разница в throughput на одинаковом H100 достигает 29% между лидером и ближайшим конкурентом — и это без учёта специфики нагрузки.
Выбор фреймворка инференса стал стратегическим решением. Для стартапа, запускающего первый AI-продукт, ошибка означает сожжённый бюджет на GPU. Для enterprise-команды — переплату в миллионы долларов в год. Рынок фреймворков созрел — «просто взять vLLM» больше не очевидно правильный ответ.
Лидеры по пропускной способности
SGLang v0.4.3 на H100 с Llama 3.1 8B в FP16 выдаёт 16 200 токенов/с. LMDeploy — 16 100 токенов/с. vLLM v0.18+ — 12 500 токенов/с. Разница в 29% даёт ~$15 000 экономии в месяц при миллионе запросов в день. · Genαi Benchmark, 2026
Масштаб в эксплуатации
SGLang работает на 400 000+ GPU по всему миру, генерируя триллионы токенов в день. RadixAttention — ключевое архитектурное преимущество для сценариев с повторяющимися системными промптами. · LMSYS, 2026
Растущий сегмент: фреймворки с кешированием префиксов
SGLang — самый быстрорастущий фреймворк 2026 года. Его ключевое отличие — RadixAttention: структура данных в виде radix-дерева, которая кеширует KV-кэш для повторяющихся префиксов промптов. В сценариях RAG и агентов с общими системными промптами (5–15 тыс. токенов) это даёт не 10–20%, а 2–4× эффективного прироста пропускной способности.
Разница особенно заметна на multi-turn задачах. Когда пользователь отправляет десять сообщений в одном чате, каждый следующий запрос содержит всю историю диалога. SGLang переиспользует KV-кэш для повторяющихся префиксов — time to first token (TTFT) на втором и последующих запросах падает в разы. vLLM с PagedAttention тоже кеширует, но на уровне страниц, а не префиксов — эффективность ниже.
В феврале 2026 года SGLang совместно с NVIDIA показал 25× прирост производительности DeepSeek R1 на GB300 NVL72 по сравнению с H200. Blackwell Ultra даёт 1,5× пикового NVFP4 throughput, 2× softmax throughput и 1,5× HBM3e. Когда эти три ускорения складываются с RadixAttention, результат — не линейный, а мультипликативный.
SGLang не привязан к NVIDIA — работает на AMD ROCm и поддерживает все основные open-source архитектуры. Установка через pip, но для продвинутой настройки требуется понимание внутренней архитектуры.
Угасающий сегмент: Text Generation Inference
Text Generation Inference от Hugging Face с декабря 2025 года — в maintenance mode. Новых оптимизаций не выходит. Hugging Face рекомендует мигрировать на vLLM или SGLang. TGI остаётся выбором только для тех, кто глубоко интегрирован в экосистему Hugging Face и не готов менять стек.
Даже в своей нише TGI проигрывает по throughput: на одинаковом H100 с одинаковой моделью SGLang быстрее на 35–50%. Для нового проекта выбирать TGI в 2026 году — значит закладывать технический долг с первого дня.
Новый игрок на рынке инференса
LMDeploy от Shanghai AI Laboratory — тёмная лошадка. Его движок TurboMind на C++ показывает пропускную способность на уровне SGLang (~16 100 токенов/с), но с уникальным преимуществом: лучшая в классе поддержка квантованных моделей. На Int4 LMDeploy работает в 2,4× быстрее конкурентов.
TurboMind использует persistent batch scheduling (планировщик постоянного пакетного обслуживания) — алгоритм, минимизирующий оверхед на переключение между запросами. В тестах с высокой конкурентностью это даёт более стабильную задержку, чем у vLLM, у которого TTFT быстрее деградирует при росте числа параллельных запросов.
Минус: оптимизирован преимущественно под NVIDIA GPU. Поддержка ROCm есть, но менее зрелая. Время компиляции — 5–10 минут против 30–60 у TensorRT-LLM, что делает TurboMind хорошим выбором для команд, которым нужен баланс между производительностью и гибкостью.
Сравнение шести фреймворков инференса
| Параметр | vLLM | SGLang | TensorRT-LLM | LMDeploy | TGI | Ollama |
|---|---|---|---|---|---|---|
| Throughput H100 | 12 500 tok/s | 16 200 tok/s | 1 600-2 200 tok/s* | 16 100 tok/s | ~10 000 tok/s | 200-800 tok/s |
| Задержка (batch=1) | baseline | на уровне | ✗ 20-40% ниже | на уровне | выше | выше |
| Контекст 1M+ | ✔ native | ✔ native | ✔ multi-block | ◐ ограниченно | ◐ ограниченно | ◐ ограниченно |
| MoE | ✔ wide EP | ✔ expert routing | ✔ native | ◐ частично | ✗ нет | ✗ нет |
| Сложность настройки | 4/10 | 7/10 | ✗ 8/10 | 7/10 | 3/10 | 1/10 |
| Привязка к железу | Низкая (ROCm) | Низкая (ROCm) | ✗ Только NVIDIA | Низкая (ROCm) | Низкая | Нет |
Genαi, Spheron H100 Benchmark, LeetLLM 2026. *TensorRT-LLM throughput на Llama 3.1 70B (модель крупнее), на 8B показатели сопоставимы с vLLM
Экономика выбора фреймворка не ограничивается throughput. TensorRT-LLM даёт лучшую задержку на единичных запросах — если ваш сценарий требует минимального TTFT для каждого отдельного пользователя, а не максимальной суммарной пропускной способности, TensorRT-LLM может быть правильным выбором несмотря на более низкий aggregate throughput. Цена — привязка к NVIDIA и высокий порог входа: сборка и компиляция движка занимают 30–60 минут, а каждая новая модель требует повторной компиляции.
vLLM остаётся стандартом де-факто для production-сценариев. Не самый быстрый, но самый удобный: pip install, OpenAI-совместимый API, крупнейшее сообщество, широкая поддержка моделей и форматов. Для команды, которая запускает первый LLM-сервис, vLLM — правильный старт.
Ollama занимает отдельную нишу — локальная разработка и эксперименты. 200–800 токенов/с на H100, но работает на чём угодно, включая Apple Silicon и Windows. Для продакшена не годится, для быстрого прототипирования — незаменим. Установка в одну команду, модели скачиваются автоматически.
Как выбрать фреймворк для своего сценария
Универсального ответа нет, но есть чёткие паттерны. Если ваш сценарий — RAG или агент с большими системными промптами и многократными вызовами, SGLang с RadixAttention даст 2–4× преимущество, которое не покажет ни один одноразовый бенчмарк. Если вы обслуживаете квантованные модели на ограниченном бюджете VRAM, LMDeploy с Int4 работает в 2,4× быстрее альтернатив.
Для API-сервиса общего назначения, где пользователи переключаются между 50+ разными моделями, vLLM остаётся самым прагматичным выбором. Он не лидирует по сырой производительности, но стабильность API и экосистема перевешивают 29% разницы в throughput для большинства команд.
Если ваша инфраструктура завязана на NVIDIA и вам нужна минимальная задержка на каждый отдельный запрос, TensorRT-LLM — ваш вариант. Но будьте готовы к высокому порогу входа: каждая новая модель требует перекомпиляции движка (30–60 минут), а привязка к NVIDIA означает отсутствие возможности мигрировать на AMD или другие платформы.
Главный практический совет: не доверяйте vendor-бенчмаркам. Запускайте тесты на своём железе со своим трафиком. Open-source бенчмарки вроде llm-serving-benchmark позволяют воспроизвести тесты на одинаковом hardware. Ожидайте деградации на 30–50% при переходе от синтетических тестов к реальной нагрузке — это нормально для всех фреймворков.
Для команд, которые уже используют один фреймворк, миграция — нетривиальная задача. Прямая замена vLLM на SGLang не работает: они используют разные форматы кеша, разные API для advanced features и разные стратегии управления памятью. План миграции должен включать параллельный запуск двух движков на канарейке, замеры реальной производительности на своём трафике и rollback-план.
Экономический эффект от правильного выбора фреймворка измеряется не только в throughput. На масштабе 10 млн запросов в день разница между SGLang и vLLM составляет ~$150 000 в месяц при текущих ценах на H100. Это цена senior-инженера в команду инфраструктуры. Решение, принятое сегодня, будет влиять на P&L продукта весь следующий год.
Рынок движется быстро. Ещё год назад выбор был между vLLM и TGI. Сегодня — шесть серьёзных опций плюс emerging игроки. Фреймворки, которые лидируют по throughput сейчас, могут оказаться в maintenance mode через 12 месяцев, как это случилось с TGI. Единственная устойчивая стратегия — сохранять гибкость и не завязываться на один движок.
Ключевые сигналы для отслеживания
MLPerf Inference v6.0 добавил стандартизированные LLM-бенчмарки с задачей GPT-OSS 120B — теперь можно сравнивать фреймворки по единой методологии, а не по разрозненным vendor-бенчмаркам.
Modular MAX с графовыми компилированными ядрами на Mojo показывает результаты выше vLLM на плотных моделях при высокой конкурентности — четвёртый серьёзный игрок на горизонте.
BitNet.cpp от Microsoft запускает 100B 1-bit LLM на CPU со скоростью 5-7 токенов/с — инференс без GPU меняет экономику edge-устройств.
Simplismart привлёк $7 млн от Accel на «самый быстрый инференс-движок», превышающий TogetherAI и FireworksAI по throughput на Llama 3.1 8B.
Один из главных уроков 2026 года: не существует какого-то лучшего фреймворка — существует лучший фреймворк для вашей конкретной нагрузки. SGLang выигрывает на RAG и агентах. TensorRT-LLM — на сценариях, где каждая миллисекунда задержки стоит денег. vLLM — там, где важны совместимость и скорость развёртывания. LMDeploy — для квантованных моделей на ограниченном бюджете памяти.
Лучшая стратегия для команды — сохранять архитектурную гибкость. Выбирайте фреймворк не по сегодняшним бенчмаркам, а по траектории развития команды и способности мигрировать, когда рыночная ситуация изменится. Через год лидеры могут поменяться.