Четыре года назад AI-индустрия потратила на обучение моделей в три раза больше, чем на их эксплуатацию. Сейчас пропорция перевернулась. Инференс — самая быстрорастущая статья расходов в технологическом секторе.

McKinsey прогнозирует: к 2030 году inference-нагрузки будут занимать больше половины всех AI-вычислений в дата-центрах, а их доля в общем спросе на мощности центров обработки данных вырастет до 30–40%. Это не эволюция — это смена режима. Инфраструктура, оптимизированная под обучение моделей, перестаёт быть адекватной.

Как мы писали в июле, парадокс цены и объёма в экономике LLM-инференса остаётся ключевым драйвером рынка. За прошедшие недели тезис только уплотнился.

Почему инференс стал доминирующей нагрузкой

Обучение происходит один раз. Инференс — непрерывен. Каждый запрос к чат-боту, каждая сгенерированная строка кода в Copilot, каждый кадр в AI-видео — это цикл инференса. Чем больше моделей уходит в промышленную эксплуатацию, тем быстрее растёт этот пул.

Deloitte оценивает, что общий спрос на AI-вычисления удваивается каждые 3–4 месяца до 2030 года — и почти весь прирост идёт за счёт инференса. По данным F5, 78% организаций уже запускают инференс как собственную нагрузку, а 77% сообщили, что эта задача стала их доминирующим AI-активити, обогнав обучение.

Рынок реагирует структурно.

SambaNova привлекла $1 млрд при оценке $11 млрд — на чип SN50, который выдаёт в три раза больше пропускной способности, чем NVIDIA B200, но только на инференсе. Etched вышел из стелса с $800 млн на ASIC-ускоритель, спроектированный исключительно под выполнение уже обученных моделей. OpenAI совместно с Broadcom представила Jalapeño — первый собственный чип для инференса, который, по заявлениям, на 50% дешевле GPU при той же производительности.

💰
Капитал идёт в инфраструктуру, а не в модели

В 2026 году AI-инфраструктура привлекла более $650 млрд capex от Big Tech и фондов. При этом доля чисто inference-стартапов в этом пуле выросла с 12% в 2024 до 41% в первом полугодии 2026. Рынок голосует деньгами против тезиса «дообучим на своих данных — и хватит».

Что ломается в архитектуре

Инференс и обучение предъявляют разные требования к «железу». Для обучения критична сырая вычислительная мощность FP8/FP16 и пропускная способность межсоединений. Для инференса — latency (задержка), throughput per dollar (пропускная способность на доллар затрат) и энергоэффективность. GPU, оптимизированные под оба сценария, компромиссны в каждом.

Стартапы вроде Fractile ($220 млн) идут дальше: они физически перемежают память и вычислительные блоки на кристалле, чтобы устранить узкое место — перемещение данных между RAM и процессором. Их целевой показатель — тысячи токенов в секунду для тысяч одновременных пользователей при разумном энергопотребления.

Параллельно происходит расслоение самого инференса. Sail Research ($80 млн) строит инфраструктуру для длительных AI-агентских сценариев (long-horizon reasoning) — нагрузка, которая потребляет в 100–1000 раз больше токенов, чем чат, и требует принципиально иного планировщика выполнения.

Открытые веса как инфраструктурный слой

Наиболее радикальный аргумент выдвинул в марте исследователь Джаред Гроган в препринте «The End of the Foundation Model Era» (arXiv:2604.06217): pre-training перестаёт быть конкурентным преимуществом, потому что open-weight модели достигли frontier-качества при околонулевой стоимости инференса.

Это не просто техническое наблюдение — оно меняет экономику всей цепочки. Если раньше ценность была в самой модели (закрытый вес = монополия), то теперь ценность смещается в инфраструктуру вокруг неё: оркестрация, мониторинг, security, комплаенс. Именно здесь, а не в очередном scaling law, формируется добавленная стоимость.

Гроган называет это «пост-foundation-эрой». Индустрия уже в ней.

Куда движутся деньги — три сигнала

Сигнал 1: Custom silicon под инференс. За полгода анонсировано минимум пять чипов, спроектированных исключительно под inference-нагрузки: SN50 (SambaNova), Jalapeño (OpenAI+Broadcom), Fractile, Etched, Acrab. Ни один из них не предназначен для обучения.

Сигнал 2: Enterprise берёт инференс на себя. 78% организаций запускают inference собственными силами — не через API frontier-лабораторий. Это меняет модель закупок: вместо подписки на модель — capex на инфраструктуру.

Сигнал 3: Инференс-специфичные стартапы получают премию. SambaNova, Fractile, Sail Research, Etched — все вышли на раунды от $80M до $1B в 2026 году с оценками, существенно превышающими раунды универсальных AI-платформ.

Переход от обучения к инференсу как доминирующей нагрузке — не очередной цикл хайпа. Это структурный сдвиг, который переопределяет, кому принадлежит ценность в AI-стеке. Компании, владеющие инфраструктурой инференса — чипами, сетями, оркестраторами — получают позицию, аналогичную той, что AWS и Azure заняли в облачную эру.

Модели становятся товаром. Инфраструктура вокруг них — нет.

Источники

The future of AI workloads — McKinsey
Прогноз McKinsey: к 2030 году inference обгонит training по доле в AI-вычислениях дата-центров, достигнув 35% CAGR.
Базовый источник данных по структуре AI-нагрузок и прогнозу до 2030 года
The End of the Foundation Model Era — arXiv
Препринт Джареда Грогана: структурный анализ четырёх осей перехода AI-индустрии от foundation models к инфраструктуре инференса.
Ключевой концептуальный источник — тезис об окончании эры foundation-моделей
Inference Is Overtaking Training as the Dominant AI Workload
Аналитическая заметка о том, что инфраструктура, построенная под приоритеты обучения, уже показывает свои ограничения.
Независимое подтверждение тренда от отраслевого аналитика