81,8% — столько домашних задач гуманоид выполняет с первого раза: убирает со стола, вынимает бельё, открывает шкаф. И делает это не разными моделями под каждую задачу, а одной. ω-0 научили главному, что обычно разделяют в робототехнике: ходить и манипулировать одновременно.
Секрет не в предсказании картинки, а в предсказании смысла: модель учит латентные визуальные признаки, а не пиксели будущего кадра
Для обучения собрали ω-HOME — датасет из 40,3 часов реальных демонстраций в домашней обстановке
Одна модель вместо «ходьбы» и «рук» по отдельности
Классический подход к гуманоидам — разложить поведение на модули: отдельно локомоция, отдельно манипуляция. Робот идёт к объекту, останавливается, берёт его, потом идёт дальше. Медленно и неестественно. Современные world-action модели (world-action — «мир-действие») тоже остаются «руко-центричными» либо строят всё вокруг предсказания видео.
ω-0 от исследователей из Наньянского технологического университета, Пекинского университета, HKUST (Гуанчжоу) и Пекинской академии искусственного интеллекта (BAAI) работает иначе. На вход — языковая инструкция, текущее визуальное наблюдение и состояние робота. На выходе — управляющие команды для всего тела сразу: шаг, наклон корпуса, хватание — как единое координированное поведение.
ω-0 — цельнетелесная модель мира-действия
11 задач на реальном гуманоиде, включая уборку, работу с одеждой и бытовой техникой · arXiv 2608.06375, 2026
40 часов данных — что в датасете ω-HOME
Для обучения команда собрала ω-HOME: 40,3 часа демонстраций, 4 827 эпизодов и 24 задачи, записанных на частоте 30 Гц. Данные собирались телеоперацией — оператор в VR-шлеме Pico с трекерами на ногах управлял роботом, а система записывала одновременно эгоцентричное и внешнее RGB-D видео, движения всего тела (SMPL), состояние робота и управляющие латентные векторы.
Восемь групп задач покрывают типичный быт: поиск объектов, уборку поверхностей, взаимодействие с техникой, перенос контейнеров, работу с одеждой, расстановку вещей, мобильную манипуляцию и работу инструментами на полу. Это не лабораторная парта — столы, шкафы, стиральные машины, холодильники, корзины для белья.
| Модель | Тип подхода | Результат |
|---|---|---|
| ω-0 | латентное предсказание мира | ✔ 81,8% |
| pi-0.5 | video-action (видео-действие) | ✗ ниже |
| EgoVLA | VLA, эгоцентричное зрение | ✗ ниже |
| GR00T-N1.7 | фреймворк NVIDIA | ✗ ниже |
| psi-0 | world-action (мир-действие) | ✗ ниже |
Почему предсказание смысла работает лучше предсказания видео
Большинство подходов строят будущее как картинку: сгенерировать следующий кадр, затем — действие. ω-0 вместо этого учит компактные эмбеддинги будущих наблюдений как лёгкую предсказательную цель. Итог — «визуальная предвидение» без дорогого пересоздания пикселей, поверх которого диффузионный трансформер генерирует действия всего тела. На деле: модель «понимает», что произойдёт дальше, и не тратит ресурсы на реконструкцию видео.
Основа — Qwen3-VL-2B в роли языково-визуального планировщика, замороженный энкодер V-JEPA для извлечения визуальных латентов и T5 для языка. Полученные латентные действия передаются контроллеру SONIC, который превращает их в реальные команды для гуманоида.
Команда исключила 11 тестовых задач из предобучающей выборки ω-HOME — модель не могла «запомнить» ответы. Рост результата при добавлении реальных данных подтверждает ценность датасета, а не утечку тестовой разметки.
Что дальше
Сложность, по которой скучают по гуманоидам, — не промышленный цех, а дом. Завод — предсказуемая среда; квартира — нет: меняющийся свет, чужие вещи, новые планировки. Авторы показали, что модель переносит навыки на незнакомые объекты и новые сцены, а дообучение на данных человека улучшает результат.
ω-0 — не «робот, который убирает». Это доказательство, что один цельный механизм способен ходить, смотреть и работать одновременно. Путь от лабораторного стенда до серийного домашнего гуманоида всё ещё долгий — но разделение ходьбы и манипуляции, главное архитектурное упрощение прошлых лет, выглядит всё менее необходимым.