Робототехнические лаборатории собирают петабайты данных: видео с камер телеоперации, телеметрию суставов, сотни часов демонстраций. Нехватки данных нет. Хронический дефицит — в том, что пригодно для обучения.
Суть. По аудиту Voxel51 пригодны ~4% траекторий SayCan (около 12 000 из 276 000), а от 20 до 40% открытых наборов содержат контаминацию. Hebbian Robotics (YC S26) открыла SDK HFlow — конвейер контроля качества данных для обучения роботов; репозиторий запущен 18 августа, к 1 сентября — 229 звёзд и 54 контрибьютора. Как «данные для роботов» превращаются в продукт — в хронике ниже.
ХРОНИКА: От уборочных роботов — к данным для обучения
────────────────────────────────────────────────────────────
2019────── 2022────── 2024────── 18.08.26────── 13.09.26
🧹 📊 🔧 🚀 ◉ СЕЙЧАС
Онг: Куан: Оба HFlow стар- YC S26,
уборочные инфра- уходят тует как публич-
роботы структ. в данные open-source ный за-
LionsBot Verkada (Apache 2.0) пуск
Хроника по данным GitHub hflow, профиля YC и Launch HN
Точка отсчёта. 26 дней между первым коммитом и публичным запуском: 5 релизов за 10 дней, 222 коммита, 54 контрибьютора при двух основателях.
Пригодность данных SayCan
Из 276 000 траекторий Google SayCan после очистки к обучению пригодны около 12 000 · Аудит Voxel51, 2026
Цена грязных данных
Четвёрка процентов — цена для всей индустрии: SayCan, один из самых цитируемых робототехнических наборов Google, при очистке под нужды базовых моделей потерял 96% объёма. Замёрзшие линзы, потерянные кадры, рассинхронизированные потоки, задублированные эпизоды.
Каждый потерянный эпизод — потерянная физика: часы телеоперации, износ реального манипулятора, зарплата оператора. Выбросить 96% собранного экономически странно. Технически — вынужденно: грязный эпизод ломает модель быстрее, чем его отсутствие.
«Пригодность» в робототехнике — не про отдельные пиксели. Эпизод жив, если целостна вся сцена: оператор подвёл руку к чашке, камера не замерзала, команды совпали с картинкой. Рвётся одна нить — обесценивается всё.
Очистка — ручной труд разметчиков, пересматривающих часы записи. Индустрия не превращает это в метрику: показывать инвестору, как выбрасывается 90% собранного, никто не торопится.
Аудит открытых наборов от Voxel51 называет диапазон от 20 до 40% контаминации — до двух наборов из пяти необучаемы без переработки.
Грязь — плата за масштаб. Её никто не считает публично.
Как роботы учились до конвейеров
Пятнадцать лет назад робота программировали скриптом: жёсткая траектория, фиксированная поза, никаких данных. Позже пришли политики на симуляциях — sim-to-real (перенос из симуляции в реальность) удешевил обучение, но разрыв между симуляцией и реальностью остался.
Настоящий сдвиг — большие наборы демонстраций: RT-1, DROID, Open X-Embodiment. Миллионы эпизодов с инструкциями. Здесь впервые встал вопрос, который индустрия языковых моделей решила раньше: сколько в этих данных мусора.
Разметка инструкциями оказалась отдельной инженерной задачей: моделям нужны пары «инструкция — траектория», и заметная часть пар гибнет уже на этапе разметки, задолго до обучения.
У LLM за пять лет выросла отдельная профессия — инженер данных. Фильтрация, дедупликация, автоматические проверки качества. В робототехнике эту работу продолжают сами исследователи: самодельными скриптами, без стандарта провенанса, у каждой лаборатории свои правила.
Цена разнобоя видна на масштабе: один университетский набор, очищенный домашним пайплайном, другой — отраслевым. Модели, обученные на обоих, ведут себя по-разному. Объяснить почему, не получается до сих пор.
Причина пропасти простая: текст дёшев, физика дорога. Языковые корпуса можно перегенерировать за ночь, а робототехнический эпизод — только часами операторского труда у реального манипулятора.
«Что, если превратить 4% пригодных траекторий в 90%?» — так команда представила HFlow на Launch HN.— Launch HN: Hebbian Robotics, сентябрь 2026
Фабрика проверок: что внутри HFlow
HFlow — SDK с открытой лицензией Apache 2.0: фабрика контроля качества для данных роботов. Четыре стадии: сбор (collection), приёмка (ingestion), чистка (curation), выдача (delivery). Стандартный формат записей MCAP хранит видео, силы на суставах и команды оператора в одном потоке — распарсить этого мало, нужно убедиться, что кадры не потерялись между каналами, а команды сошлись с картинкой.
Оркестрация — на Airflow, аналитика — на DuckDB поверх записей MCAP. Каждый эпизод получает провенанс (историю происхождения): какие обработчики его касались, какой версией кода, какие проверки пройдены. Повторный запуск конвейера даёт одинаковый результат.
Выбор знакомого стека не случайность: Airflow и DuckDB знает любой data-инженер, порог входа минимален. Открытая лицензия — осознанный ход: малые команды получают инструменты больших лабораторий, а сообщество бесплатно дорабатывает проверки.
Основатели — пара с несовпадающими биографиями. Брэндон Онг строил серийные уборочные роботы в LionsBot; Кингстон Куан тянул инфраструктуру в Jane Street и Verkada. Оба сошлись в одном: узкое место робототехники — данные, а не приводы.
Публичные цифры простые: 229 звёзд, 222 коммита, 54 контрибьютора, 5 релизов за 10 дней. Отклик редкий для робототехники: софт для роботов обычно живёт в закрытых репозиториях лабораторий.
Что реально делает HFlow?
Применения команда описывает шире традиционного манипулятора: подводные аппараты, орбитальные сервисные машины, удалённые среды, куда человек не доедет. Везде общая механика — запись, проверка, сохранность демонстраций, — и везде сегодня кустарь.
Ворота для VLA-поколения
Следующее поколение моделей — vision-language-action («видение-язык-действие») — учится прямо на траекториях с инструкциями. Для них качество набора и качество политики — одно уравнение: мусор масштабирует ошибку модели.
Капитал в индустрию уже пришёл. Как мы писали в сентябре, британский Humanoid закрыл раунд на $152 млн при оценке $1,35 млрд. Деньги на модели и железо есть. Инфраструктуры качества — нет.
Сводные наборы вроде Open X-Embodiment исторически сопровождаются оговорками о разнокалиберных источниках. Чем больше агрегация, тем дороже аудит каждой строчки.
Чистый набор тянет за собой следующий: контрибьюторы докладывают эпизоды, качество растёт, обучение ускоряется — замкнутый цикл данных, которого в робототехнике пока нет.
Что меняется на глазах:
- лаборатории встраивают контроль качества до обучения, а не после;
- открытые наборы набирают популярность только вместе с метриками чистоты.
За горизонтом: рынок данных
Следующий шаг команды — коммерческий слой поверх открытого SDK: API контроля качества, платные наборы с провенансом, аудит чужих датасетов. Двое основателей, раунд $125k от YC — и задача уровня рынка.
Риски понятны. Открытый проект может не пройти путь до продукта. Крупные лаборатории могут закрыть вопрос собственными конвейерами. Индустрия может надолго остаться в кустарном режиме.
Если сценарий сработает, цепочка вытянется дальше: интеграторы, сертифицирующие наборы для производств, фабрики разметки с метриками чистоты, страховка от плохих данных. В LLM-рынке такие роли уже есть.
Даже так сигнал читается чётко: качество данных становится воротами. Кто контролирует ворота — контролирует скорость обучения.
Что дальше. Коммерческие API качества данных для роботов и платные наборы с провенансом станут обычным делом. Роль «инженера данных для роботов» выделится в отдельную профессию — как это случилось в LLM.