В 2026 году рынок AI-инфраструктуры — это семь слоёв технологий, каждый со своими провайдерами, ценообразованием и компромиссами. GPU-облака, платформы инференса, оркестрация, векторные базы, MLOps, наблюдаемость (observability) и управление (governance). Выбрать неправильную комбинацию — значит переплатить в 2–4 раза.
Рынок инференса разделился на поминутную оплату (per-token) и безлимитные подписки — выбор зависит от профиля нагрузки, а не от громкости бренда.
Семь слоёв AI-инфраструктуры независимы: лучшие компоненты на каждом слое (best-of-breed) дают лучший TCO, чем единый вендор.
Сколько стоит GPU-облако в 2026 году
Час аренды H100 SXM стоит от $1,99 у RunPod до $3,78 у Lambda Labs. Разница в цене — не главное. Главное — коэффициент загрузки (utilisation rate): GPU загружены в среднем на 40%. Остальное — простой, за который вы платите. Как мы писали в июне, рынок AI-инфраструктуры столкнулся с разрывом между $700 млрд капитальных расходов и $1 трлн потенциальной выручки — и этот разрыв никуда не делся.
Специализированные neocloud-провайдеры доминируют в сегменте GPU-as-a-service. Гиперскейлеры (AWS, GCP, Azure) берут не скоростью, а экосистемой: интеграция с S3, BigQuery, Kubernetes — но за это вы платите премию 50–70%.
B200 только выходит на рынок, и спрос превышает предложение. Провайдер, который указывает $3,49/ч за B200, не имеет значения, если GPU в листе ожидания на 6 недель. Реальная availability — первый критерий выбора, опережающий цену.
Вилка цен на H100
RunPod — от $1.99/ч, Lambda — от $2.86/ч, Hyperstack — от $2.40/ч, Nebius — от $2.00/ч. Цены упали на 30% с 2025 года за счёт роста предложения B200 и H200. · Hyperstack, RunPod, 2026
Семь слоёв AI-инфраструктуры
Термин «AI-инфраструктура» в 2022 означал просто облачные VM. В 2026 — это семь независимых слоёв, каждый со своим рынком и поставщиками. GPU-облака и compute — первый слой. Над ним — платформы инференса и сервинга (vLLM, SGLang, Together AI). Третий — оркестрация тренировки и fine-tuning (LangGraph, LlamaIndex Workflows). Четвёртый — векторные базы и RAG (Pinecone, Weaviate, Qdrant). Пятый — MLOps и пайплайны (Langfuse, Arize Phoenix). Шестой — наблюдаемость и мониторинг. Седьмой — управление и guardrails.
Собирать стек из разных поставщиков на каждом слое — нормальная практика. Проблема не в совместимости, а в operational overhead: каждая интеграция требует настройки. Готовые платформы вроде Spheron или Nebius предлагают предсобранные комбинации — но за это вы платите премию 15–20%.
Что растёт
Спрос на инференс растёт быстрее тренировки. SambaNova привлекла $1 млрд при оценке $11 млрд — всего через 5 месяцев после предыдущего раунда. Nscale закрыл $1,4 млрд за неделю до этого. Рынок движется от «кто построит самый большой кластер» к «кто сделает инференс дёшево».
Безлимитные подписки на инференс — главный тренд 2026. Featherless, Inference.net и другие предлагают доступ за $10–75/мес. Для стартапов это меняет экономику: предсказуемые затраты вместо тревоги за каждый токен.
Ещё один растущий сегмент — ASIC-ускорители для инференса. Groq, Etched, Rebellions проектируют чипы, заточенные под конкретные архитектуры трансформеров. Они дают 3–5× лучшую производительность на ватт, чем H100. Rebellions закрыл $400 млн в pre-IPO раунде в первом квартале 2026 — рынок оценивает потенциал специализированного «железа» в миллиарды.
Что падает
Доля гиперскейлеров в GPU-нагрузках снижается второй год подряд. AWS, GCP и Azure контролируют ~55% рынка облачных GPU — год назад было 65%. Причина не в цене (у AWS H100 стоит $3,50/ч — дороже всех), а в появлении специализированных платформ с лучшим временем до первого результата (time-to-value).
TGI (Text Generation Inference) от HuggingFace ушёл в режим поддержки (maintenance mode) в декабре 2025. Рынок движков инференса консолидировался вокруг двух основных платформ — все новые проекты стартуют на них. Первая остаётся стандартом для общего случая: широкая поддержка hardware, зрелая экосистема, 17 000+ звёзд на GitHub. Вторая берёт производительностью в сценариях с длинным контекстом и RAG за счёт RadixAttention (радикс-дерево с кэшированием prefix на уровне токенов).
| Параметр | vLLM | SGLang | TensorRT-LLM |
|---|---|---|---|
| Производительность (Llama 3.1 8B, H100) | ✔ ~12 500 tok/s | ✔ ~16 200 tok/s | ✔ ~18 000 tok/s |
| Сложность настройки | ✔ Низкая | ✔ Низкая–средняя | ✗ Высокая |
| Поддержка hardware | ✔ NVIDIA, AMD, Intel, Trainium, TPU | ✔ NVIDIA, AMD | ✗ NVIDIA только |
| Кэширование prefix | ◐ Block-level hash | ✔ Radix tree (уровень токенов) | ◐ Engine-level |
| OpenAI-совместимость | ✔ Нативная | ✔ Нативная | ✔ Через trtllm-serve |
Сравнение движков инференса. Данные: Techsy, n1n.ai, Jarvis Labs, 2026
Что появляется
Третий слой рынка — платформы, заточенные под инференс. Не GPU-облака и не API-прокси, а прослойка, которая берёт на себя оркестрацию моделей, роутинг запросов и автомасштабирование. Каждый из провайдеров — со своей специализацией.
Inworld Router даёт доступ к 220+ моделям через один endpoint, совместимый с OpenAI. Другие платформы предлагают безлимитные подписки или широкий выбор open-source моделей с конкурентными ценами. Разница между ними — не в качестве инференса, а в operational overhead: сколько времени команда тратит на интеграцию вместо разработки продукта.
Edge-инференс на ARM-чипах — ещё один emerging слой. Phi-4-mini-flash с 3,8 млрд параметров отвечает за 90–100 мс на смартфоне, без обращения к облаку. Для GDPR-комплаенса и сценариев, где данные не должны покидать устройство, это меняет архитектуру решений.
GPU-as-a-service консолидируется: Hydra Host привлёк $100 млн, Positron ведёт переговоры о раунде на $750 млн при оценке $5 млрд
ASIC-ускорители (Etched, Groq) начинают отъедать долю у лидеров рынка — специализированные чипы дают 3–5× лучшую производительность на ватт
Edge-инференс на ARM: Phi-4-mini-flash отвечает за 90–100 мс без облака — комплаенс с GDPR как драйвер
Регуляторика: SEC и ESMA ужесточают требования к объяснимости ИИ — это меняет архитектуру инференса в финансах
Гонка чипов для инференса
Пока лидер рынка доминирует в тренировке моделей с долей рынка ~80%, сегмент инференса открыт для конкуренции. Groq с его LPU (процессор языковых вычислений) показывает задержку в 2–3 мс на токен против 8–12 мс у H100. Etched разрабатывает чип, заточенный исключительно под архитектуру Transformer — без поддержки CNN или RNN, но с 10× лучшей производительностью на инференсе. Rebellions из Южной Кореи привлёк $400 млн pre-IPO для массового производства своих AI-чипов REBEL.
Ключевой вопрос для покупателя инфраструктуры в 2026 — не «какой чип быстрее», а «какая комбинация слоёв даёт минимальную стоимость токена для моей задачи». Ответ зависит от сценария: для пакетного инференса ночью выгоден TensorRT-LLM на выделенных H100, для чата в реальном времени — современный движок на разделяемой инфраструктуре, для прототипа — управляемый API без собственных GPU. Каждый сценарий требует своего стека, и универсального победителя нет.
Глобальный рынок AI-инфраструктуры оценивается в $120 млрд в 2026 году, по данным исследовательских отчётов. Из них ~$45 млрд приходится на GPU-облака и compute, ~$30 млрд — на inference-as-a-service, остальное — оркестрация, MLOps, векторные базы и governance. Рынок растёт на 40–50% в год, но структура сильно фрагментирована: ни один провайдер не контролирует больше 15% ни в одном из семи слоёв, кроме лидера в compute. Это создаёт окно возможностей для стартапов, которые предлагают интегрированные решения — но и риск собрать стек, который не получится масштабировать.
Параллельно растёт рынок FPGA и ASIC для AI. Ayar Labs закрыл $500 млн на производство оптических интерконнектов — это про пропускную способность между GPU, а не про сами чипы. Плотность соединений становится узким местом: при переходе от H100 к B200 пропускная способность памяти выросла на 40%, но inter-GPU bandwidth — только на 15%. Оптика решает именно эту проблему.
Кто платит за инфраструктуру
Структура спроса на AI-инфраструктуру в 2026 отличается от предыдущих лет. Гиперскейлеры (Meta, Google, Microsoft) — крупнейшие покупатели GPU, но они строят для себя. Стартапы и средний бизнес арендуют у neocloud-провайдеров. Корпоративный сегмент (банки, страховые, фарма) выбирает managed платформы с compliance-сертификацией.
Рынок кредитной инфраструктуры тоже меняется. Венчурные фонды всё чаще дают portfolio companies не деньги, а GPU-кредиты. Inception от NVIDIA и Microsoft Founders Hub — $10 000–150 000 на стартап без доли. Это снижает порог входа: чтобы запустить инференс на H100, не нужно $3 млн на подписку — достаточно получить кредит и платить за utilisation.
Как собирать стек: сценарии
Прототип / низкий объём — управляемый API (Together AI, Fireworks) без собственной инфраструктуры. Средний масштаб — spot H100 у neocloud-провайдера + vLLM или SGLang на инстансе + Langfuse для наблюдаемости. Production — bare-metal H100/B200 + SGLang с multi-GPU + полный стек мониторинга. Каждый переход удваивает сложность, но снижает стоимость на токен (cost-per-token) в 3–5 раз.
Выбор между поминутной оплатой и безлимитной подпиской зависит от профиля нагрузки. Постоянный трафик — подписка выгоднее. Непредсказуемые пики — поминутная оплата. Универсального ответа нет: каждая команда должна тестировать на своих данных.
Стартапам стоит активировать Inception и Microsoft Founders Hub немедленно — $10 000–150 000 кредитов без доли. Но не тратить их на исследование. Кредиты — для продакшн-валидации, не для экспериментов. Это частая ошибка: команда сжигает $50 000 на exploration, а когда приходит время масштабировать инференс, кредитов уже нет.
Следующие 12–18 месяцев определят, кто станет лидерами рынка inference-as-a-service. Консолидация неизбежна: из 30+ neocloud-провайдеров 2025 года к 2027 останутся 8–10. Вопрос не в том, кто выживет, а в том, какой стек они предложат. Победит не самый дешёвый GPU-провайдер, а платформа, которая минимизирует совокупную стоимость владения от выбора модели до продакшна. Это рынок, где операционная эффективность важнее сырой цены GPU.
Не спрашивайте «какой провайдер дешевле». Спрашивайте «какой провайдер минимизирует время от выделения GPU до ответа модели на продакшн-трафик». Операционные расходы почти всегда превышают разницу в почасовой ставке.