81,8% — столько домашних задач гуманоид выполняет с первого раза: убирает со стола, вынимает бельё, открывает шкаф. И делает это не разными моделями под каждую задачу, а одной. ω-0 научили главному, что обычно разделяют в робототехнике: ходить и манипулировать одновременно.

🎯
Один гуманоид, 11 задач, 81,8% успеха — без отдельной модели под каждое действие

Секрет не в предсказании картинки, а в предсказании смысла: модель учит латентные визуальные признаки, а не пиксели будущего кадра

Для обучения собрали ω-HOME — датасет из 40,3 часов реальных демонстраций в домашней обстановке

Одна модель вместо «ходьбы» и «рук» по отдельности

Классический подход к гуманоидам — разложить поведение на модули: отдельно локомоция, отдельно манипуляция. Робот идёт к объекту, останавливается, берёт его, потом идёт дальше. Медленно и неестественно. Современные world-action модели (world-action — «мир-действие») тоже остаются «руко-центричными» либо строят всё вокруг предсказания видео.

ω-0 от исследователей из Наньянского технологического университета, Пекинского университета, HKUST (Гуанчжоу) и Пекинской академии искусственного интеллекта (BAAI) работает иначе. На вход — языковая инструкция, текущее визуальное наблюдение и состояние робота. На выходе — управляющие команды для всего тела сразу: шаг, наклон корпуса, хватание — как единое координированное поведение.

81,8% успех на 11 домашних задачах ↑ выше pi-0.5, EgoVLA, GR00T-N1.7, psi-0

ω-0 — цельнетелесная модель мира-действия

11 задач на реальном гуманоиде, включая уборку, работу с одеждой и бытовой техникой · arXiv 2608.06375, 2026

40 часов данных — что в датасете ω-HOME

Для обучения команда собрала ω-HOME: 40,3 часа демонстраций, 4 827 эпизодов и 24 задачи, записанных на частоте 30 Гц. Данные собирались телеоперацией — оператор в VR-шлеме Pico с трекерами на ногах управлял роботом, а система записывала одновременно эгоцентричное и внешнее RGB-D видео, движения всего тела (SMPL), состояние робота и управляющие латентные векторы.

Восемь групп задач покрывают типичный быт: поиск объектов, уборку поверхностей, взаимодействие с техникой, перенос контейнеров, работу с одеждой, расстановку вещей, мобильную манипуляцию и работу инструментами на полу. Это не лабораторная парта — столы, шкафы, стиральные машины, холодильники, корзины для белья.

МодельТип подходаРезультат
ω-0 латентное предсказание мира ✔ 81,8%
pi-0.5 video-action (видео-действие) ✗ ниже
EgoVLA VLA, эгоцентричное зрение ✗ ниже
GR00T-N1.7 фреймворк NVIDIA ✗ ниже
psi-0 world-action (мир-действие) ✗ ниже
Сравнение на едином протоколе 11 домашних задач, arXiv 2608.06375

Почему предсказание смысла работает лучше предсказания видео

Большинство подходов строят будущее как картинку: сгенерировать следующий кадр, затем — действие. ω-0 вместо этого учит компактные эмбеддинги будущих наблюдений как лёгкую предсказательную цель. Итог — «визуальная предвидение» без дорогого пересоздания пикселей, поверх которого диффузионный трансформер генерирует действия всего тела. На деле: модель «понимает», что произойдёт дальше, и не тратит ресурсы на реконструкцию видео.

Основа — Qwen3-VL-2B в роли языково-визуального планировщика, замороженный энкодер V-JEPA для извлечения визуальных латентов и T5 для языка. Полученные латентные действия передаются контроллеру SONIC, который превращает их в реальные команды для гуманоида.

Методика без самообмана
Команда исключила 11 тестовых задач из предобучающей выборки ω-HOME — модель не могла «запомнить» ответы. Рост результата при добавлении реальных данных подтверждает ценность датасета, а не утечку тестовой разметки.

Что дальше

Сложность, по которой скучают по гуманоидам, — не промышленный цех, а дом. Завод — предсказуемая среда; квартира — нет: меняющийся свет, чужие вещи, новые планировки. Авторы показали, что модель переносит навыки на незнакомые объекты и новые сцены, а дообучение на данных человека улучшает результат.

ω-0 — не «робот, который убирает». Это доказательство, что один цельный механизм способен ходить, смотреть и работать одновременно. Путь от лабораторного стенда до серийного домашнего гуманоида всё ещё долгий — но разделение ходьбы и манипуляции, главное архитектурное упрощение прошлых лет, выглядит всё менее необходимым.

ω-0: латентная модель мира-действия для цельнетелесной локоманипуляции гуманоида
Оригинальная статья: архитектура, датасет ω-HOME и протокол оценки на 11 реальных домашних задачах.
Первоисточник — все цифры статьи взяты из этого документа
NTU, Пекинский университет и BAAI выпустили Omega-0
Обзор результата 81,8% и контекст: что отличает архитектуру ω-0 от предсказания пикселей.
Независимое издание подтверждает ключевые цифры модели
Omega-0 достигает 81,8% успеха в домашних задачах
Отраслевой брифинг с итогом: рост функциональности гуманоидов в бытовой среде.
Дополнительный источник для проверки ключевых показателей