В 2026 году рынок AI-инфраструктуры — это семь слоёв технологий, каждый со своими провайдерами, ценообразованием и компромиссами. GPU-облака, платформы инференса, оркестрация, векторные базы, MLOps, наблюдаемость (observability) и управление (governance). Выбрать неправильную комбинацию — значит переплатить в 2–4 раза.

🎯
Специализированные GPU-облака (RunPod, Lambda, CoreWeave) на 50–70% дешевле гиперскейлеров для тренировки моделей, но уступают в управляемых сервисах.

Рынок инференса разделился на поминутную оплату (per-token) и безлимитные подписки — выбор зависит от профиля нагрузки, а не от громкости бренда.

Семь слоёв AI-инфраструктуры независимы: лучшие компоненты на каждом слое (best-of-breed) дают лучший TCO, чем единый вендор.

Сколько стоит GPU-облако в 2026 году

Час аренды H100 SXM стоит от $1,99 у RunPod до $3,78 у Lambda Labs. Разница в цене — не главное. Главное — коэффициент загрузки (utilisation rate): GPU загружены в среднем на 40%. Остальное — простой, за который вы платите. Как мы писали в июне, рынок AI-инфраструктуры столкнулся с разрывом между $700 млрд капитальных расходов и $1 трлн потенциальной выручки — и этот разрыв никуда не делся.

Специализированные neocloud-провайдеры доминируют в сегменте GPU-as-a-service. Гиперскейлеры (AWS, GCP, Azure) берут не скоростью, а экосистемой: интеграция с S3, BigQuery, Kubernetes — но за это вы платите премию 50–70%.

B200 только выходит на рынок, и спрос превышает предложение. Провайдер, который указывает $3,49/ч за B200, не имеет значения, если GPU в листе ожидания на 6 недель. Реальная availability — первый критерий выбора, опережающий цену.

$2–6 $/час за H100 SXM ↓ 30% vs 2025

Вилка цен на H100

RunPod — от $1.99/ч, Lambda — от $2.86/ч, Hyperstack — от $2.40/ч, Nebius — от $2.00/ч. Цены упали на 30% с 2025 года за счёт роста предложения B200 и H200. · Hyperstack, RunPod, 2026

Семь слоёв AI-инфраструктуры

Термин «AI-инфраструктура» в 2022 означал просто облачные VM. В 2026 — это семь независимых слоёв, каждый со своим рынком и поставщиками. GPU-облака и compute — первый слой. Над ним — платформы инференса и сервинга (vLLM, SGLang, Together AI). Третий — оркестрация тренировки и fine-tuning (LangGraph, LlamaIndex Workflows). Четвёртый — векторные базы и RAG (Pinecone, Weaviate, Qdrant). Пятый — MLOps и пайплайны (Langfuse, Arize Phoenix). Шестой — наблюдаемость и мониторинг. Седьмой — управление и guardrails.

Собирать стек из разных поставщиков на каждом слое — нормальная практика. Проблема не в совместимости, а в operational overhead: каждая интеграция требует настройки. Готовые платформы вроде Spheron или Nebius предлагают предсобранные комбинации — но за это вы платите премию 15–20%.

Что растёт

Спрос на инференс растёт быстрее тренировки. SambaNova привлекла $1 млрд при оценке $11 млрд — всего через 5 месяцев после предыдущего раунда. Nscale закрыл $1,4 млрд за неделю до этого. Рынок движется от «кто построит самый большой кластер» к «кто сделает инференс дёшево».

Безлимитные подписки на инференс — главный тренд 2026. Featherless, Inference.net и другие предлагают доступ за $10–75/мес. Для стартапов это меняет экономику: предсказуемые затраты вместо тревоги за каждый токен.

Ещё один растущий сегмент — ASIC-ускорители для инференса. Groq, Etched, Rebellions проектируют чипы, заточенные под конкретные архитектуры трансформеров. Они дают 3–5× лучшую производительность на ватт, чем H100. Rebellions закрыл $400 млн в pre-IPO раунде в первом квартале 2026 — рынок оценивает потенциал специализированного «железа» в миллиарды.

Что падает

Доля гиперскейлеров в GPU-нагрузках снижается второй год подряд. AWS, GCP и Azure контролируют ~55% рынка облачных GPU — год назад было 65%. Причина не в цене (у AWS H100 стоит $3,50/ч — дороже всех), а в появлении специализированных платформ с лучшим временем до первого результата (time-to-value).

TGI (Text Generation Inference) от HuggingFace ушёл в режим поддержки (maintenance mode) в декабре 2025. Рынок движков инференса консолидировался вокруг двух основных платформ — все новые проекты стартуют на них. Первая остаётся стандартом для общего случая: широкая поддержка hardware, зрелая экосистема, 17 000+ звёзд на GitHub. Вторая берёт производительностью в сценариях с длинным контекстом и RAG за счёт RadixAttention (радикс-дерево с кэшированием prefix на уровне токенов).

ПараметрvLLMSGLangTensorRT-LLM
Производительность (Llama 3.1 8B, H100) ✔ ~12 500 tok/s ✔ ~16 200 tok/s ✔ ~18 000 tok/s
Сложность настройки ✔ Низкая ✔ Низкая–средняя ✗ Высокая
Поддержка hardware ✔ NVIDIA, AMD, Intel, Trainium, TPU ✔ NVIDIA, AMD ✗ NVIDIA только
Кэширование prefix ◐ Block-level hash ✔ Radix tree (уровень токенов) ◐ Engine-level
OpenAI-совместимость ✔ Нативная ✔ Нативная ✔ Через trtllm-serve

Сравнение движков инференса. Данные: Techsy, n1n.ai, Jarvis Labs, 2026

Что появляется

Третий слой рынка — платформы, заточенные под инференс. Не GPU-облака и не API-прокси, а прослойка, которая берёт на себя оркестрацию моделей, роутинг запросов и автомасштабирование. Каждый из провайдеров — со своей специализацией.

Inworld Router даёт доступ к 220+ моделям через один endpoint, совместимый с OpenAI. Другие платформы предлагают безлимитные подписки или широкий выбор open-source моделей с конкурентными ценами. Разница между ними — не в качестве инференса, а в operational overhead: сколько времени команда тратит на интеграцию вместо разработки продукта.

Edge-инференс на ARM-чипах — ещё один emerging слой. Phi-4-mini-flash с 3,8 млрд параметров отвечает за 90–100 мс на смартфоне, без обращения к облаку. Для GDPR-комплаенса и сценариев, где данные не должны покидать устройство, это меняет архитектуру решений.

📊
Ключевые сигналы для отслеживания

GPU-as-a-service консолидируется: Hydra Host привлёк $100 млн, Positron ведёт переговоры о раунде на $750 млн при оценке $5 млрд
ASIC-ускорители (Etched, Groq) начинают отъедать долю у лидеров рынка — специализированные чипы дают 3–5× лучшую производительность на ватт
Edge-инференс на ARM: Phi-4-mini-flash отвечает за 90–100 мс без облака — комплаенс с GDPR как драйвер
Регуляторика: SEC и ESMA ужесточают требования к объяснимости ИИ — это меняет архитектуру инференса в финансах

Гонка чипов для инференса

Пока лидер рынка доминирует в тренировке моделей с долей рынка ~80%, сегмент инференса открыт для конкуренции. Groq с его LPU (процессор языковых вычислений) показывает задержку в 2–3 мс на токен против 8–12 мс у H100. Etched разрабатывает чип, заточенный исключительно под архитектуру Transformer — без поддержки CNN или RNN, но с 10× лучшей производительностью на инференсе. Rebellions из Южной Кореи привлёк $400 млн pre-IPO для массового производства своих AI-чипов REBEL.

Ключевой вопрос для покупателя инфраструктуры в 2026 — не «какой чип быстрее», а «какая комбинация слоёв даёт минимальную стоимость токена для моей задачи». Ответ зависит от сценария: для пакетного инференса ночью выгоден TensorRT-LLM на выделенных H100, для чата в реальном времени — современный движок на разделяемой инфраструктуре, для прототипа — управляемый API без собственных GPU. Каждый сценарий требует своего стека, и универсального победителя нет.

Глобальный рынок AI-инфраструктуры оценивается в $120 млрд в 2026 году, по данным исследовательских отчётов. Из них ~$45 млрд приходится на GPU-облака и compute, ~$30 млрд — на inference-as-a-service, остальное — оркестрация, MLOps, векторные базы и governance. Рынок растёт на 40–50% в год, но структура сильно фрагментирована: ни один провайдер не контролирует больше 15% ни в одном из семи слоёв, кроме лидера в compute. Это создаёт окно возможностей для стартапов, которые предлагают интегрированные решения — но и риск собрать стек, который не получится масштабировать.

Параллельно растёт рынок FPGA и ASIC для AI. Ayar Labs закрыл $500 млн на производство оптических интерконнектов — это про пропускную способность между GPU, а не про сами чипы. Плотность соединений становится узким местом: при переходе от H100 к B200 пропускная способность памяти выросла на 40%, но inter-GPU bandwidth — только на 15%. Оптика решает именно эту проблему.

Кто платит за инфраструктуру

Структура спроса на AI-инфраструктуру в 2026 отличается от предыдущих лет. Гиперскейлеры (Meta, Google, Microsoft) — крупнейшие покупатели GPU, но они строят для себя. Стартапы и средний бизнес арендуют у neocloud-провайдеров. Корпоративный сегмент (банки, страховые, фарма) выбирает managed платформы с compliance-сертификацией.

Рынок кредитной инфраструктуры тоже меняется. Венчурные фонды всё чаще дают portfolio companies не деньги, а GPU-кредиты. Inception от NVIDIA и Microsoft Founders Hub — $10 000–150 000 на стартап без доли. Это снижает порог входа: чтобы запустить инференс на H100, не нужно $3 млн на подписку — достаточно получить кредит и платить за utilisation.

Как собирать стек: сценарии

Прототип / низкий объём — управляемый API (Together AI, Fireworks) без собственной инфраструктуры. Средний масштаб — spot H100 у neocloud-провайдера + vLLM или SGLang на инстансе + Langfuse для наблюдаемости. Production — bare-metal H100/B200 + SGLang с multi-GPU + полный стек мониторинга. Каждый переход удваивает сложность, но снижает стоимость на токен (cost-per-token) в 3–5 раз.

Выбор между поминутной оплатой и безлимитной подпиской зависит от профиля нагрузки. Постоянный трафик — подписка выгоднее. Непредсказуемые пики — поминутная оплата. Универсального ответа нет: каждая команда должна тестировать на своих данных.

Стартапам стоит активировать Inception и Microsoft Founders Hub немедленно — $10 000–150 000 кредитов без доли. Но не тратить их на исследование. Кредиты — для продакшн-валидации, не для экспериментов. Это частая ошибка: команда сжигает $50 000 на exploration, а когда приходит время масштабировать инференс, кредитов уже нет.

Следующие 12–18 месяцев определят, кто станет лидерами рынка inference-as-a-service. Консолидация неизбежна: из 30+ neocloud-провайдеров 2025 года к 2027 останутся 8–10. Вопрос не в том, кто выживет, а в том, какой стек они предложат. Победит не самый дешёвый GPU-провайдер, а платформа, которая минимизирует совокупную стоимость владения от выбора модели до продакшна. Это рынок, где операционная эффективность важнее сырой цены GPU.

💡
Правило выбора
Не спрашивайте «какой провайдер дешевле». Спрашивайте «какой провайдер минимизирует время от выделения GPU до ответа модели на продакшн-трафик». Операционные расходы почти всегда превышают разницу в почасовой ставке.

Источники

AI Infrastructure Companies in 2026: GPU Cloud, Inference, Training, and MLOps Providers
Полная карта семи слоёв AI-инфраструктуры с провайдерами, ценами и сценариями использования
Наиболее полный обзор рынка AI-инфраструктуры — охватывает все семь слоёв стека
10+ Leading Cloud GPU Providers: Compared by Pricing, GPU Options, and Use Case
Сравнение 10 GPU-провайдеров с актуальными ценами и анализом производительности
Подробный сравнительный анализ с ценами на H100, B200 и рекомендациями по сценариям
Best AI Cloud Platforms 2026: GPU + LLM + MLOps Compared
Сравнение специализированных GPU-облаков, гиперскейлеров и MLOps-платформ
Трёхуровневая классификация провайдеров с ценами и критериями выбора