AIBrix, проект с открытым исходным кодом под управлением vLLM, выпустил версию 0.7.0. В ней — консоль управления для data scientists, Batch API для самостоятельного хостинга (self-hosted batch) и разделение prefill и decode через KV-кеш без RDMA на GPU уровня L20.
AIBrix — это оркестратор системного уровня (system-level) для LLM-инференса. Он не оптимизирует отдельную модель или движок — он управляет слоем поверх: автодополнением, роутингом запросов, LoRA-адаптерами, распределённым развёртыванием и гетерогенными GPU.
Проект родился в ByteDance как внутренняя платформа для серверного инференса. В феврале 2025 года его открыли под лицензией Apache 2.0 в организации vLLM. С тех пор AIBrix прошёл семь релизов, набрал почти 5 000 звёзд на GitHub и получил доклад на KubeCon EU 2025 — совместно с Google.
Релиз v0.7.0 собрал 242 PR за три месяца. Четыре ключевых изменения.
Консоль управления
Веб-интерфейс на React с Go-бэкендом для data scientists, которые не хотят работать через kubectl. Позволяет регистрировать модели, деплоить через шаблоны, запускать batch-задачи и мониторить их выполнение. OIDC-аутентификация включена. Для небольших инсталляций используется SQLite, для крупных — MySQL.
Batch API для самостоятельного хостинга
OpenAI-совместимые эндпоинты для асинхронного инференса. Загружаешь JSONL — получаешь результаты на своих GPU или, в превью-режиме, на арендованных мощностях Lambda Cloud и RunPod. Без комиссии за каждый запрос (per-request fee) — платишь только за GPU.
Третий движок за одним шлюзом
За одним шлюзом (gateway) теперь работают vLLM, SGLang и TensorRT-LLM — с метриками и роутингом под каждый движок. Выбор движка перестал быть архитектурным решением: инженеры могут переключаться между ними без перестройки платформы.
Разделение P/D через KV-кеш
Разделение prefill и decode через KV-cache-centric serving path (путь обслуживания с KV-кешем в центре) на базе PrisKV. Ключевой результат: одноузловое P/D без RDMA работает на GPU уровня L20. Раньше для этого требовался InfiniBand — сетевая инфраструктура, доступная только крупным дата-центрам. AIBrix делает disaggregated inference доступным для обычных Kubernetes-кластеров.
Для рынка AI-инфраструктуры open-source control plane (плоскость управления) такого уровня означает, что LLM-инференс перестаёт быть прерогативой hyperscaler'ов. Любая команда с Kubernetes может развернуть production-grade инфраструктуру — с автодополнением, LoRA, гетерогенными GPU и KV-кешем — без привязки к вендору (vendor lock-in).
Инференс — главная статья расходов AI-продуктов. По данным HN-обсуждений 2026 года, команды платят от $3 000 до $5 000 в месяц ещё до выхода на соответствие продукта рынку (product-market fit). AIBrix не снижает стоимость токена — он снижает стоимость владения инфраструктурой: даёт выбрать движок, провайдера GPU и архитектуру развёртывания без перестройки платформы при каждом изменении.
Gateway в v0.7.0 получил поддержку репликации с zero-downtime upgrade через Redis state-sync. Алгоритмы роутинга теперь компонуются через weighted soft-scoring. Подключаемые KV-transfer коннекторы — SHFS, NIXL, Mooncake — позволяют адаптировать систему под конкретную сетевую топологию.
AIBrix уже используют в production за пределами ByteDance. Об этом говорит активность в Slack-сообществе vllm-dev и пул-реквесты от сторонних контрибьюторов. Релиз v0.7.0 доступен на GitHub.