Четыре года назад AI-индустрия потратила на обучение моделей в три раза больше, чем на их эксплуатацию. Сейчас пропорция перевернулась. Инференс — самая быстрорастущая статья расходов в технологическом секторе.
McKinsey прогнозирует: к 2030 году inference-нагрузки будут занимать больше половины всех AI-вычислений в дата-центрах, а их доля в общем спросе на мощности центров обработки данных вырастет до 30–40%. Это не эволюция — это смена режима. Инфраструктура, оптимизированная под обучение моделей, перестаёт быть адекватной.
Как мы писали в июле, парадокс цены и объёма в экономике LLM-инференса остаётся ключевым драйвером рынка. За прошедшие недели тезис только уплотнился.
Почему инференс стал доминирующей нагрузкой
Обучение происходит один раз. Инференс — непрерывен. Каждый запрос к чат-боту, каждая сгенерированная строка кода в Copilot, каждый кадр в AI-видео — это цикл инференса. Чем больше моделей уходит в промышленную эксплуатацию, тем быстрее растёт этот пул.
Deloitte оценивает, что общий спрос на AI-вычисления удваивается каждые 3–4 месяца до 2030 года — и почти весь прирост идёт за счёт инференса. По данным F5, 78% организаций уже запускают инференс как собственную нагрузку, а 77% сообщили, что эта задача стала их доминирующим AI-активити, обогнав обучение.
Рынок реагирует структурно.
SambaNova привлекла $1 млрд при оценке $11 млрд — на чип SN50, который выдаёт в три раза больше пропускной способности, чем NVIDIA B200, но только на инференсе. Etched вышел из стелса с $800 млн на ASIC-ускоритель, спроектированный исключительно под выполнение уже обученных моделей. OpenAI совместно с Broadcom представила Jalapeño — первый собственный чип для инференса, который, по заявлениям, на 50% дешевле GPU при той же производительности.
В 2026 году AI-инфраструктура привлекла более $650 млрд capex от Big Tech и фондов. При этом доля чисто inference-стартапов в этом пуле выросла с 12% в 2024 до 41% в первом полугодии 2026. Рынок голосует деньгами против тезиса «дообучим на своих данных — и хватит».
Что ломается в архитектуре
Инференс и обучение предъявляют разные требования к «железу». Для обучения критична сырая вычислительная мощность FP8/FP16 и пропускная способность межсоединений. Для инференса — latency (задержка), throughput per dollar (пропускная способность на доллар затрат) и энергоэффективность. GPU, оптимизированные под оба сценария, компромиссны в каждом.
Стартапы вроде Fractile ($220 млн) идут дальше: они физически перемежают память и вычислительные блоки на кристалле, чтобы устранить узкое место — перемещение данных между RAM и процессором. Их целевой показатель — тысячи токенов в секунду для тысяч одновременных пользователей при разумном энергопотребления.
Параллельно происходит расслоение самого инференса. Sail Research ($80 млн) строит инфраструктуру для длительных AI-агентских сценариев (long-horizon reasoning) — нагрузка, которая потребляет в 100–1000 раз больше токенов, чем чат, и требует принципиально иного планировщика выполнения.
Открытые веса как инфраструктурный слой
Наиболее радикальный аргумент выдвинул в марте исследователь Джаред Гроган в препринте «The End of the Foundation Model Era» (arXiv:2604.06217): pre-training перестаёт быть конкурентным преимуществом, потому что open-weight модели достигли frontier-качества при околонулевой стоимости инференса.
Это не просто техническое наблюдение — оно меняет экономику всей цепочки. Если раньше ценность была в самой модели (закрытый вес = монополия), то теперь ценность смещается в инфраструктуру вокруг неё: оркестрация, мониторинг, security, комплаенс. Именно здесь, а не в очередном scaling law, формируется добавленная стоимость.
Гроган называет это «пост-foundation-эрой». Индустрия уже в ней.
Куда движутся деньги — три сигнала
Сигнал 2: Enterprise берёт инференс на себя. 78% организаций запускают inference собственными силами — не через API frontier-лабораторий. Это меняет модель закупок: вместо подписки на модель — capex на инфраструктуру.
Сигнал 3: Инференс-специфичные стартапы получают премию. SambaNova, Fractile, Sail Research, Etched — все вышли на раунды от $80M до $1B в 2026 году с оценками, существенно превышающими раунды универсальных AI-платформ.
Переход от обучения к инференсу как доминирующей нагрузке — не очередной цикл хайпа. Это структурный сдвиг, который переопределяет, кому принадлежит ценность в AI-стеке. Компании, владеющие инфраструктурой инференса — чипами, сетями, оркестраторами — получают позицию, аналогичную той, что AWS и Azure заняли в облачную эру.
Модели становятся товаром. Инфраструктура вокруг них — нет.