ZeroGPU не строит дата-центры. Не покупает GPU. И не запускает фундаментальные модели. Компания из Остина собирает инфраструктуру AI-инференса из того, что уже существует: idle-вычислители на edge-устройствах, игровых ноутбуках и серверах, объединённые в распределённую сеть. Её тезис — 70–80% production-запросов к LLM не требуют frontier-модели. Их можно выполнить на специализированных small language models (SLM, компактные языковые модели для узких задач) в 10 раз быстрее и вдвое дешевле.
Стартап основан в 2025 году, вышел на Product Hunt 9 июня 2026 года (#2 дня, 345 upvotes) и уже работает с production-клиентами через OpenAI-совместимый API.
Ключевой вопрос: станет ли ZeroGPU прослойкой, которая меняет экономику инференса, или останется нишевым слоем для задач adtech и модерации?
Слой эффективности между приложением и моделью
ZeroGPU не заменяет LLM. Она располагается между приложением и моделью-провайдером и перехватывает запросы, которые не требуют frontier-level reasoning (рассуждений уровня передовых моделей). Это classification, summarization, PII-detection, content moderation, signal extraction — задачи, составляющие, по оценке компании, 70–80% всего production-трафика AI.
Архитектура состоит из трёх уровней:
Specialized model layer — каталог purpose-built SLM и nano-моделей для конкретных задач: zlm-v1-iab-classify-cloud для IAB-классификации доменов, zlm-v1-pii-redaction для обнаружения персональных данных, модели для sentiment analysis и intent extraction.
Execution layer — распределённая сеть edge-устройств: оптимизированные серверы, GPU-ноутбуки, mobile-девайсы, approved edge capacity с облачным fallback. ZeroGPU агрегирует idle-вычислители, которые уже существуют, вместо того чтобы строить новые кластеры.
Как мы писали на прошлой неделе в материале о General Compute, рынок ищет альтернативы GPU-монополии Nvidia. ZeroGPU идёт другим путём — не через custom ASIC, а через оркестрацию существующего железа.
Orchestration layer — geo-aware routing, который направляет запрос на ближайший узел сети на основе производительности, доступности и стоимости. Если edge-узел недоступен — автоматический fallback на облачный инференс.
Всё это доступно через OpenAI-совместимый API: разработчик меняет base URL и api-key, и часть трафика уходит на ZeroGPU без изменения кода.
ZeroGPU: перенос инференса на малые модели
Доля production-запросов, которые можно выполнить на специализированных малых моделях без потери качества. Компания приводит бенчмарк: zlm-v1-iab-classify побеждает GPT-5.4 Nano на задаче классификации IAB-категорий. · ZeroGPU, июнь 2026
От рекламных технологий до AI-агентов: кто платит
Первый production-клиент ZeroGPU — Dappier, платформа AI-ответов для медиаиздателей. До ZeroGPU Dappier использовал GPT-5.4-nano в связке с Pinecone RAG для IAB-классификации и извлечения intent-сигналов. Замена на специализированную zlm-модель ZeroGPU сократила latency до 100 мс на запрос и снизила стоимость инференса «значительно» — компания не раскрывает точные цифры, но опубликовала case study.
Второй сценарий — AI-агенты. ZeroGPU выпустила MCP-сервер, который позволяет Claude Desktop, Claude Code, Cursor и другим agent-рантаймам делегировать рутинные вызовы nano-моделям. 11 инструментов поверх Model Context Protocol: от классификации контента до извлечения PII. Каждый вызов возвращает breakdown экономии.
Not every task needs a frontier model. Our purpose-built, edge-optimized models run 10x faster, 50% cheaper and offload 70–80% of production tasks to small models with frontier-level accuracy.— ZeroGPU, Product Hunt launch, 9 июня 2026
Третий сценарий — AdTech. ZeroGPU выпустила zlm-v1-iab-domain-classifier, который по одному только домену (например, espn.com) возвращает IAB-категории, темы, ключевые слова и intent-сигналы. Это решает проблему bidstream-инвентаря, где страницы не рендерятся, а краулинг каждого URL на скорости аукциона не масштабируется.
Экономика без GPU
Бизнес-модель ZeroGPU — pay-per-inference с бесплатным tier. Компания не раскрывает точные цены, но позиционируется как «до 50% дешевле GPU-облаков». При этом ZeroGPU не владеет железом — он агрегирует idle-мощности, что даёт принципиально другую структуру CAPEX.
Основатели — Maddy Arvapally (бывший инженер GoPro, опыта scaled streaming-сервисов «от нуля до 5 млн подписчиков») и Joshua Goikhman. Команда — 2 человека по данным LinkedIn. Компания основана в 2025 году в Остине, Техас. Раунд funding не раскрыт, что типично для pre-seed/seed-стартапов на ранней стадии.
Конкуренты — General Compute (ASIC-native neocloud), Groq (LPU-инференс), Baseten (inference orchestration), но ZeroGPU единственный, кто строит distributed edge inference grid без собственного «железа».
Почему сейчас: триггеры спроса
Интерес к compute efficiency layer подогревается не технологическими, а финансовыми причинами. Salesforce заявила, что потратит $300 млн на Anthropic в 2025 году — и Марк Бениофф публично заметил, что не каждый токен должен обрабатываться frontier-моделью. Coinbase подтвердила, что уже роутит часть запросов на малые модели, чтобы удерживать costs flat при росте usage.
Это не истории про экономию центов. Это сигнал, что на уровне enterprise-биллинга AI — значимая статья расходов, и CFO начали задавать вопросы. ZeroGPU — первый продукт, который отвечает на этот вопрос в формате «просто добавь API-ключ».
Deloitte прогнозирует, что inference workloads составят две трети всех AI-вычислений в 2026 году — до $50 млрд только на чипах. Даже 5% этого объёма, переключённых на edge/nano-слой, создают рынок в $2,5 млрд. ZeroGPU хочет быть прослойкой, через которую проходит этот трафик.
Прямые конкуренты — Baseten ($1,5 млрд раунд, inference orchestration для enterprise), General Compute (ASIC-native neocloud, о котором мы писали на прошлой неделе) и Groq (LPU-инференс). Но ни один из них не строит distributed edge grid. ZeroGPU — единственный, кто делает ставку на агрегацию существующего idle compute, а не на собственное железо.
Что будет с рынком инференса через год?
Вероятность: 65% — тренд подтверждается движением Salesforce (Марк Бениофф объявил $300 млн на Anthropic с оговоркой «не каждый токен требует frontier-модели») и Coinbase (Брайан Армстронг подтвердил роутинг на малые модели для удержания cost-flat при росте объёмов).
✅ Аргументы за
Salesforce и Coinbase уже подтвердили паттерн роутинга на малые модели на уровне C-level. ZeroGPU — первый продукт, который предлагает это как сервис.
Технология OpenAI-совместимого API снижает барьер внедрения до нуля: zero-code migration для существующих приложений.
Критерии подтверждения: ZeroGPU привлекает раунд Series A в течение 12 месяцев; число production-клиентов превышает 50.
❌ Аргументы против
Рынок inference orchestration быстро уплотняется: Baseten привлёк $1,5 млрд, General Compute запустил ASIC-native cloud. ZeroGPU рискует оказаться между нишами.
Ключевое допущение — что 70–80% трафика не требует frontier-моделей — верно сегодня, но может разрушиться, если стоимость frontier-инференса продолжит падать 10× в год.
Критерии опровержения: GPT-5.6 и Claude Fable 5 снижают стоимость токена до уровня nano-моделей; hyperscaler (AWS/Azure/GCP) встраивают аналогичный routing нативными средствами.
Сценарии развития
🟢 Оптимистичный (35%)
Последствия: категория «compute efficiency layer» закрепляется как отдельный сегмент AI-инфраструктуры, оцениваемый в $3–5 млрд к 2028.
🟡 Базовый (40%)
Последствия: поглощение крупным игроком (DataDog, Cloudflare) за $50–100 млн в течение 2–3 лет.
🔴 Пессимистичный (25%)
Последствия: стартап сворачивает distributed edge grid и фокусируется на white-label API для AdTech.
Раунд Series A ZeroGPU — объём и лид-инвестор покажут, верит ли рынок в compute efficiency layer.
Релиз собственных бенчмарков против GPT-5.4 Nano и Llama 4 — независимые тесты подтвердят или опровергнут заявленное превосходство.
Расширение модельного каталога за пределы text inference: embedding, audio, vision — сигнал зрелости платформы.
Партнёрство с крупным model-провайдером (Mistral, Cohere) для native routing.