AIBrix, проект с открытым исходным кодом под управлением vLLM, выпустил версию 0.7.0. В ней — консоль управления для data scientists, Batch API для самостоятельного хостинга (self-hosted batch) и разделение prefill и decode через KV-кеш без RDMA на GPU уровня L20.

AIBrix — это оркестратор системного уровня (system-level) для LLM-инференса. Он не оптимизирует отдельную модель или движок — он управляет слоем поверх: автодополнением, роутингом запросов, LoRA-адаптерами, распределённым развёртыванием и гетерогенными GPU.

Проект родился в ByteDance как внутренняя платформа для серверного инференса. В феврале 2025 года его открыли под лицензией Apache 2.0 в организации vLLM. С тех пор AIBrix прошёл семь релизов, набрал почти 5 000 звёзд на GitHub и получил доклад на KubeCon EU 2025 — совместно с Google.

Релиз v0.7.0 собрал 242 PR за три месяца. Четыре ключевых изменения.

Консоль управления

Веб-интерфейс на React с Go-бэкендом для data scientists, которые не хотят работать через kubectl. Позволяет регистрировать модели, деплоить через шаблоны, запускать batch-задачи и мониторить их выполнение. OIDC-аутентификация включена. Для небольших инсталляций используется SQLite, для крупных — MySQL.

Batch API для самостоятельного хостинга

OpenAI-совместимые эндпоинты для асинхронного инференса. Загружаешь JSONL — получаешь результаты на своих GPU или, в превью-режиме, на арендованных мощностях Lambda Cloud и RunPod. Без комиссии за каждый запрос (per-request fee) — платишь только за GPU.

Третий движок за одним шлюзом

За одним шлюзом (gateway) теперь работают vLLM, SGLang и TensorRT-LLM — с метриками и роутингом под каждый движок. Выбор движка перестал быть архитектурным решением: инженеры могут переключаться между ними без перестройки платформы.

Разделение P/D через KV-кеш

Разделение prefill и decode через KV-cache-centric serving path (путь обслуживания с KV-кешем в центре) на базе PrisKV. Ключевой результат: одноузловое P/D без RDMA работает на GPU уровня L20. Раньше для этого требовался InfiniBand — сетевая инфраструктура, доступная только крупным дата-центрам. AIBrix делает disaggregated inference доступным для обычных Kubernetes-кластеров.

💡
AIBrix закрывает разрыв между оптимизациями на уровне моделей и операционной сложностью: разнородные GPU, движки и модели работают как одна платформа, а не как набор скриптов.

Для рынка AI-инфраструктуры open-source control plane (плоскость управления) такого уровня означает, что LLM-инференс перестаёт быть прерогативой hyperscaler'ов. Любая команда с Kubernetes может развернуть production-grade инфраструктуру — с автодополнением, LoRA, гетерогенными GPU и KV-кешем — без привязки к вендору (vendor lock-in).

Инференс — главная статья расходов AI-продуктов. По данным HN-обсуждений 2026 года, команды платят от $3 000 до $5 000 в месяц ещё до выхода на соответствие продукта рынку (product-market fit). AIBrix не снижает стоимость токена — он снижает стоимость владения инфраструктурой: даёт выбрать движок, провайдера GPU и архитектуру развёртывания без перестройки платформы при каждом изменении.

Gateway в v0.7.0 получил поддержку репликации с zero-downtime upgrade через Redis state-sync. Алгоритмы роутинга теперь компонуются через weighted soft-scoring. Подключаемые KV-transfer коннекторы — SHFS, NIXL, Mooncake — позволяют адаптировать систему под конкретную сетевую топологию.

AIBrix уже используют в production за пределами ByteDance. Об этом говорит активность в Slack-сообществе vllm-dev и пул-реквесты от сторонних контрибьюторов. Релиз v0.7.0 доступен на GitHub.

Источники

vllm-project/aibrix
Репозиторий проекта — 4 964 звезды, Apache 2.0, 1 274 коммита
Основной репозиторий с кодом и документацией
AIBrix v0.7.0 Release
Официальный анонс релиза от команды проекта
Подробный разбор каждого изменения
AIBrix: Towards Scalable, Cost-Effective LLM Inference Infrastructure
Научная работа об архитектуре AIBrix
White paper, описывающий system-level оркестрацию инференса