Инженерная команда тратит от шести месяцев до двух лет, чтобы новый AI-чип научился быстро запускать нейросети. Infinity.inc сократила этот срок до одного дня. С помощью AI-агента, который сам пишет и оптимизирует код.

🎯
Ключевые выводы

Infinity.inc привлекла $15 млн seed-раунда при оценке $100 млн от Touring Capital, Principal VC и ангелов из OpenAI и Anthropic.

AI-агент Ignition пишет и оптимизирует низкоуровневые compute-ядра для новых чипов без участия человека, сокращая процесс с лет до дней.

В тестах на чипе d-Matrix Corsair Ignition достиг 92% теоретической пиковой производительности за 10 часов и дал 14-кратный прирост throughput на Qwen3-8B за один день.

Главный боттлнек AI-инфраструктуры

NVIDIA удерживает ~80% рынка AI-ускорителей дата-центров. Не потому, что её чипы объективно лучше всех — альтернативы существуют, и некоторые превосходят H100/B200 по сырой производительности на ватт. Проблема в софте.

CUDA — это и язык программирования, и слой, на котором построены PyTorch и TensorFlow. Разработчик пишет на Python, использует привычный фреймворк — и код работает на NVIDIA. Чтобы запустить ту же модель на другом чипе, нужно вручную писать compute-ядра — низкоуровневые программы, управляющие тем, как именно чип выполняет матричные умножения.

Таких инженеров в мире — единицы. Процесс занимает месяцы. Новые чипы выходят на рынок с сырым софтом, и покупатели не видят их реальной производительности.

Ignition: AI-агент, который пишет ядра быстрее людей

Infinity.inc основал Джереми Никсон в августе 2025 года. Бывший исследователь Google Brain (и сооснователь хакерского комьюнити AGI House) решил, что автоматизация kernel-инжиниринга — более эффективный путь, чем найм редких специалистов.

Ignition — это AI-исследовательский агент, который автономно пишет, тестирует и оптимизирует compute-ядра для конкретной связки «чип + модель». Без человека в цикле.

Архитектура агента построена на принципе «автоматизированного изобретения» — концепции, которую Никсон сформулировал как «AI-системы могут быть мета-технологией». Ignition использует RL-цикл: генерирует ядро, запускает его на реальном чипе, измеряет производительность, корректирует — и повторяет, пока не выйдет на плато.

Цифры, которые меняют правила

14× прирост throughput за 1 день ↑ с 1,4K до 20K токенов/с

Ignition — Qwen3-8B на чипе d-Matrix Corsair

Infinity улучшила throughput на Qwen3-8B с ~1 400 до более 20 000 токенов в секунду — 14-кратный рост за один день. Результат на 34% превосходит vLLM на том же чипе. · Infinity.inc, июль 2026

Второй тест — на чипе Corsair от d-Matrix. Ignition достиг 92% теоретической пиковой производительности чипа за 10 часов. Для контекста: типичная команда kernel-инженеров считает успехом 70-80% после 6-12 месяцев работы.

Основатель: от Google Brain до собственного стартапа

Никсон пришёл в AI-инфраструктуру не как chip-архитектор, а как исследователь алгоритмов. В Google Brain он работал над эффективностью ML-моделей. В 2021 году Forbes писал о его предыдущем проекте Omniscience. AGI House, комьюнити, которое он соосновал, запустило сотни стартапов и стало заметным явлением в кремниевой долине.

Убеждение Никсона: если AI может генерировать код, то он может генерировать и код для самого себя — оптимизировать собственную инфраструктуру. Эту идею «автоматизированного изобретения» он называет мета-технологией.

Доля от прироста вместо лицензий

Infinity не продаёт софт за upfront-плату. Компания берёт долю от прироста производительности, который её агент обеспечивает на чипе партнёра. Если Ignition не даёт измеримого ускорения — Infinity не получает ничего.

По данным компании, модель уже приносит «миллионы долларов» годовой recurring-выручки. Первый дизайн-партнёр — d-Matrix, чей Corsair теперь работает в продакшене через Infinity d-Matrix Cloud.

Раунд на $15 млн при оценке $100 млн возглавили Touring Capital и Principal VC. Среди ангелов — исследователи OpenAI и Anthropic, топ-менеджеры крупных chip-компаний и сам Никсон.

Что это меняет в индустрии

NVIDIA — классический пример вертикальной интеграции: собственный чип, собственный софт, собственная экосистема. Любой альтернативный чип должен превзойти NVIDIA по сырым характеристикам — но даже это не гарантирует успеха без софта, сравнимого с CUDA.

Ignition делает этот софт автоматически. Для любого чипа.

Прямое следствие: время вывода нового AI-ускорителя на рынок сокращается с 12-24 месяцев до недель. Косвенное — исчезает главный барьер входа для конкурентов NVIDIA. Если любой чип может получить production-ready inference-стек за дни, преимущество CUDA как экосистемы размывается.

Ограничения

Пока Ignition работает на уровне отдельных compute-kernel. Полный inference-стек современной модели включает сотни таких ядер, работу с памятью, планирование операций и orchestration. Infinity автоматизирует ключевой, но не единственный этап.

Второй вопрос — масштабирование на десятки типов чипов. Каждый новый акселератор имеет свою архитектуру памяти, систему команд и боттлнеки. Ignition нужно время, чтобы «выучить» каждую платформу.

Третий — NVIDIA не стоит на месте. Blackwell Ultra, анонсированный в начале 2026 года, обещает 50-кратный прирост производительности для agentic AI-нагрузок. CUDA тоже эволюционирует.

Контекст рынка

Рынок AI-инференса — $103 млрд в 2025 году, прогноз — $255 млрд к 2030-му. Количество inference-провайдеров выросло с 27 до ~90 за год. Цены на API LLMs упали на 80% за тот же период.

В этом ландшафте автоматизация kernel-инжиниринга — структурный сдвиг, а не нишевая оптимизация. Чем больше чипов может конкурировать за inference-нагрузки, тем ниже цены и выше доступность compute.

Infinity — один из примерно десятка стартапов, целящихся в CUDA-замок NVIDIA. Разница в подходе: вместо того чтобы строить лучший чип, Infinity строит софт, который делает любой чип конкурентоспособным.

Что дальше

$15 млн seed-раунда пойдут на расширение команды research-инженеров, развитие партнёрств с chip-производителями и масштабирование библиотеки Infy — универсального inference-слоя для всех архитектур.

Компания ведёт активные переговоры с несколькими крупными производителями чипов. Если Ignition подтвердит результаты на 3-5 разных архитектурах, модель «AI-агент как инфраструктурный слой» станет новым стандартом для полупроводниковой индустрии.

📊
Ключевые сигналы для отслеживания

Новые дизайн-партнёрства Infinity с chip-производителями за пределами d-Matrix

Публичные бенчмарки Ignition на архитектурах, отличных от SRAM-чипов (GPU, NPU, systolic arrays)

Ответ NVIDIA: изменится ли стратегия CUDA-лицензирования или появятся собственные инструменты автоматизации kernel-генерации

Источники

Infinity Raises $15 Million in Seed Funding
Официальный анонс: детали раунда, продукт Ignition, результаты тестов на d-Matrix Corsair
Первичный источник — все цифры и партнёрства подтверждены компанией
Inference startup Infinity raises $15M from Touring Capital, OpenAI and Anthropic researchers
TechCrunch: интервью с основателем, контекст CUDA-замка NVIDIA, стратегия компании
Редакционный разбор: почему Ignition — структурная атака на CUDA, а не рядовой стартап
Infinity raises $15M to run AI inference on any chipset
SiliconANGLE: технические детали Ignition, бизнес-модель revenue-share
Независимый источник — подтверждает цифры производительности и модель монетизации