Пять архитектур чипов — Nvidia CUDA, AMD ROCm, Google TPU, Apple Metal и Intel Arc. Один сервер. Бесплатно. 8 июля 2026 года парижский стартап ZML выпустил LLMD — инференс-сервер, который работает с открытыми LLM на любом оборудовании, без vendor lock-in (привязки к конкретному производителю чипов).

Основатель ZML Стив Морен (Steeve Morin) называет это «возвращением разработчикам контроля над собственной инфраструктурой». Два года назад, когда Морен впервые обсуждал эту идею с венчурными инвесторами, большинство отвечали: стоимость инференса будет стремиться к нулю, оптимизировать нечего.

Они ошиблись.

Рынок AI-инференса — сейчас самый быстрорастущий сегмент вычислительной инфраструктуры. По данным JPMorgan, глобальные CAPEX на AI-инфраструктуру превысят $600 млрд в 2026 году, причём основная доля придётся на инференс, а не на тренировку моделей. IDC прогнозирует, что к 2027 году расходы на инференс обгонят тренировочные — и Япония уже считает 2026 год точкой перелома.

Проблема в том, что инференс сегодня — это экосистема закрытых «силосов». Каждый чип требует своей оптимизации. Каждая архитектура — своего стека. Nvidia доминирует не столько потому, что её hardware лучше, сколько потому, что CUDA стал стандартом де-факто, к которому привязаны все производственные пайплайны.

ZML/LLMD — попытка разрушить эту привязку одним релизом.

ZML: от фреймворка к продукту

ZML — не вчерашний стартап. Компания была основана в 2024 году и сначала выпустила открытый ML-фреймворк. Но настоящий продукт, LLMD, оказался закрытым исходным кодом — стратегическое решение, которое Морен объясняет просто: «Сначала мы хотим понять, где концентрируется usage, а потом решать, за что брать деньги».

За плечами Морена — инженерный опыт в Google и Exalead, должность VP Engineering в Zenly (куплен Snap за $213 млн в 2017) и соосновательство в Veezio. Он не раз проходил путь от исследовательской задачи до production-решения.

В LLMD стек написан на Zig — языке системного программирования, который даёт контроль над памятью без сборщика мусора. Это важно для инференса: каждая микросекунда задержки имеет значение, а накладные расходы рантайма напрямую конвертируются в операционные затраты.

Как это работает

LLMD — это инференс-сервер. Он принимает запросы от клиентов, загружает модель и выполняет обработку. Ключевое отличие от аналогов: он не требует отдельной оптимизации под каждый тип чипа. Разработчик разворачивает один сервер — и модель работает на Nvidia H100, AMD MI300X, Google TPU v5 или Apple M4 Ultra с максимальной для этой архитектуры скоростью.

💡
Что под капотом
LLMD использует JIT-компиляцию для каждой архитектуры чипа, динамическую оптимизацию графа вычислений и KV-cache management. В текущей альфа-версии — поддержка моделей семейств Llama и Qwen, single-GPU режим. Размер контейнера — 2,4 ГБ.

Это не означает, что LLMD решит все проблемы инференса за одну ночь. Версия — альфа. Single-GPU. Ограниченный набор моделей. Но направление выбрано точно: абстракция hardware — единственный способ сделать инференс по-настоящему конкурентным рынком.

Финансирование и команда

8 июля 2026 года ZML объявила о закрытии seed-раунда на $20 млн. Инвесторы — Kindred Capital VC, LocalGlobe, Drysdale Ventures, 20VC, Kima Ventures и AAL VC. Среди бизнес-ангелов — Тьюринг-лауреат Ян Лекун (Yann LeCun), Соломон Хайкс (основатель Docker) и Габриэль Синнаев (Meta AI).

Тот факт, что Лекун лично endorse-ит LLMD, придаёт проекту вес, выходящий за рамки типичного стартап-релиза. Лекун известен последовательным скепсисом в отношении монополизации AI-инфраструктуры — его поддержка сигнализирует, что проблема vendor lock-in в инференсе достигла точки, где требуется системное решение, а не очередной proprietary-чип.

Почему это важно сейчас

AI-инференс перестал быть технической деталью. Он стал главной статьёй расходов для компаний, внедряющих AI в production. Amazon CTO Вернер Фогельс на днях заявил, что некоторые компании тратят $500 млн в месяц на инференс — и это без контроля со стороны сотрудников.

На этом фоне ZML — не единственный игрок, пытающийся демократизировать доступ к разным чипам. OpenAI разрабатывает собственный чип для инференса, DeepSeek — свой. SambaNova привлекла $1 млрд при оценке $11 млрд. Но подход ZML отличается: они не создают новый чип, а делают софт, который объединяет существующие.

📊
Ключевые сигналы для отслеживания

Адаптация LLMD в production — появится ли бенчмарк сравнения скорости на разных чипах
Партнёрство с европейскими производителями чипов (Axelera, Kalray, SiPearl, SpiNNcloud)
Модель монетизации — когда и за что ZML начнёт брать деньги
Реакция Nvidia — будет ли ответный шаг в сторону открытой экосистемы

Выпуск LLMD — это не просто релиз стартапа. Это тест на зрелость индустрии: готов ли рынок платить за независимость от вендора, а не только за голую производительность? Результат этого теста определит, какой будет AI-инфраструктура в 2027–2028 годах.

Европейский контекст

ZML — часть более широкого тренда: Париж превращается в центр европейской AI-инфраструктуры. Mistral (французский конкурент OpenAI), ZML, H — три стартапа, которые строят стек альтернативы американской монополии. Морен подчёркивает: «Я не мог бы делать ZML нигде, кроме Парижа».

Стратегический альянс LLMD с европейскими производителями чипов — Axelera, Fractile, Kalray, OLIX, Q.ANT, SiPearl, SpiNNcloud, VSORA — не случайность. Если LLMD станет стандартом де-факто для мульти-чипового инференса, он автоматически откроет рынок для десятков небольших производителей, которые сегодня не могут конкурировать с Nvidia именно из-за отсутствия софтверной экосистемы.

Для европейского tech-суверенитета ставка ещё выше: контроль над AI-инфраструктурой сегодня — это контроль над следующим поколением промышленности. Как мы писали сегодня в материале о General Compute, битва за независимость от Nvidia только начинается — и ZML выбрала софтверное оружие.

Что дальше

LLMD пока в альфе. Ближайшие кварталы покажут, сможет ли команда из ~20 человек масштабировать продукт до enterprise-уровня. Морен планирует расширять поддержку моделей и архитектур, а параллельно — собирать данные о том, где usage концентрируется, чтобы определить модель монетизации.

Независимо от того, выиграет ZML или нет, LLMD уже сделал важное дело: он сдвинул рамку обсуждения. Вопрос больше не в том, «чей чип быстрее». Вопрос в том, «на чьём софте мы запускаем то, что у нас уже есть».

Источники

Hot French startup ZML releases free product to speed inference across lots of AI chips
Первоисточник: ZML/LLMD — мульти-чиповый инференс-сервер, интервью со Стивом Мореном
Основной источник — оригинальный репортаж Анны Хайм с деталями запуска и цитатами основателя
France's ZML wants to break Nvidia lock-in with free cross-chip AI software
Репортаж TNW о запуске LLMD и его значении для рынка AI-чипов
Контекст о конкуренции AI-чипов и значении LLMD для европейских производителей
ZML's Steeve Morin releases free LLMD to loosen AI inference from Nvidia
Глубокий анализ технической архитектуры LLMD и бэкграунда команды ZML
Детали о стеке на Zig, предыдущем опыте Морена и стратегии продукта