> ## Content Index
> Fetch the complete content index at: https://eclibra.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# ω-0: одна модель заставила гуманоида ходить и убирать одновременно — 81,8% на 11 домашних задачах
- URL: https://eclibra.com/omega-zero-humanoid-household-2026/
- Published: 2026-08-12T05:06:31.000Z
- Updated: 2026-08-12T05:06:32.000Z
- Description: Один гуманоид, 11 домашних задач, 81,8% успеха — без отдельной модели под каждое действие. Секрет ω-0: предсказание смысла, а не пикселей. Для обучения собрали датасет ω-HOME — 40,3 часа реальных демонстраций в домашней обстановке.
- Author: Rob
- Tags: Физический ИИ и роботы, #mode-2, #hook-number, #track-A

81,8% — столько домашних задач гуманоид выполняет с первого раза: убирает со стола, вынимает бельё, открывает шкаф. И делает это не разными моделями под каждую задачу, а одной. ω-0 научили главному, что обычно разделяют в робототехнике: ходить и манипулировать одновременно.

🎯

Один гуманоид, 11 задач, 81,8% успеха — без отдельной модели под каждое действие  
  
Секрет не в предсказании картинки, а в предсказании смысла: модель учит латентные визуальные признаки, а не пиксели будущего кадра  
  
Для обучения собрали ω-HOME — датасет из 40,3 часов реальных демонстраций в домашней обстановке 

## Одна модель вместо «ходьбы» и «рук» по отдельности

Классический подход к гуманоидам — разложить поведение на модули: отдельно локомоция, отдельно манипуляция. Робот идёт к объекту, останавливается, берёт его, потом идёт дальше. Медленно и неестественно. Современные world-action модели (world-action — «мир-действие») тоже остаются «руко-центричными» либо строят всё вокруг предсказания видео.

ω-0 от исследователей из Наньянского технологического университета, Пекинского университета, HKUST (Гуанчжоу) и Пекинской академии искусственного интеллекта (BAAI) работает иначе. На вход — языковая инструкция, текущее визуальное наблюдение и состояние робота. На выходе — управляющие команды для всего тела сразу: шаг, наклон корпуса, хватание — как единое координированное поведение.

81,8% успех на 11 домашних задачах ↑ выше pi-0.5, EgoVLA, GR00T-N1.7, psi-0 

#### ω-0 — цельнетелесная модель мира-действия

11 задач на реальном гуманоиде, включая уборку, работу с одеждой и бытовой техникой · *arXiv 2608.06375, 2026*

## 40 часов данных — что в датасете ω-HOME

Для обучения команда собрала ω-HOME: 40,3 часа демонстраций, 4 827 эпизодов и 24 задачи, записанных на частоте 30 Гц. Данные собирались телеоперацией — оператор в VR-шлеме Pico с трекерами на ногах управлял роботом, а система записывала одновременно эгоцентричное и внешнее RGB-D видео, движения всего тела (SMPL), состояние робота и управляющие латентные векторы.

Восемь групп задач покрывают типичный быт: поиск объектов, уборку поверхностей, взаимодействие с техникой, перенос контейнеров, работу с одеждой, расстановку вещей, мобильную манипуляцию и работу инструментами на полу. Это не лабораторная парта — столы, шкафы, стиральные машины, холодильники, корзины для белья.

| Модель         | Тип подхода                   | Результат |
| -------------- | ----------------------------- | --------- |
| **ω-0**        | латентное предсказание мира   | ✔ 81,8%   |
| **pi-0.5**     | video-action (видео-действие) | ✗ ниже    |
| **EgoVLA**     | VLA, эгоцентричное зрение     | ✗ ниже    |
| **GR00T-N1.7** | фреймворк NVIDIA              | ✗ ниже    |
| **psi-0**      | world-action (мир-действие)   | ✗ ниже    |

Сравнение на едином протоколе 11 домашних задач, arXiv 2608.06375

## Почему предсказание смысла работает лучше предсказания видео

Большинство подходов строят будущее как картинку: сгенерировать следующий кадр, затем — действие. ω-0 вместо этого учит компактные эмбеддинги будущих наблюдений как лёгкую предсказательную цель. Итог — «визуальная предвидение» без дорогого пересоздания пикселей, поверх которого диффузионный трансформер генерирует действия всего тела. На деле: модель «понимает», что произойдёт дальше, и не тратит ресурсы на реконструкцию видео.

Основа — Qwen3-VL-2B в роли языково-визуального планировщика, замороженный энкодер V-JEPA для извлечения визуальных латентов и T5 для языка. Полученные латентные действия передаются контроллеру SONIC, который превращает их в реальные команды для гуманоида.

✅

**Методика без самообмана**  
Команда исключила 11 тестовых задач из предобучающей выборки ω-HOME — модель не могла «запомнить» ответы. Рост результата при добавлении реальных данных подтверждает ценность датасета, а не утечку тестовой разметки. 

## Что дальше

Сложность, по которой скучают по гуманоидам, — не промышленный цех, а дом. Завод — предсказуемая среда; квартира — нет: меняющийся свет, чужие вещи, новые планировки. Авторы показали, что модель переносит навыки на незнакомые объекты и новые сцены, а дообучение на данных человека улучшает результат.

ω-0 — не «робот, который убирает». Это доказательство, что один цельный механизм способен ходить, смотреть и работать одновременно. Путь от лабораторного стенда до серийного домашнего гуманоида всё ещё долгий — но разделение ходьбы и манипуляции, главное архитектурное упрощение прошлых лет, выглядит всё менее необходимым.

[ ω-0: латентная модель мира-действия для цельнетелесной локоманипуляции гуманоида Оригинальная статья: архитектура, датасет ω-HOME и протокол оценки на 11 реальных домашних задачах. arXiv ](https://arxiv.org/abs/2608.06375?ref=eclibra.com) 

Первоисточник — все цифры статьи взяты из этого документа

[ NTU, Пекинский университет и BAAI выпустили Omega-0 Обзор результата 81,8% и контекст: что отличает архитектуру ω-0 от предсказания пикселей. Pandaily ](https://pandaily.com/ntu-pku-baaian-omega-0-world-action-model-home-success-81-8-percent-aug2026?ref=eclibra.com) 

Независимое издание подтверждает ключевые цифры модели

[ Omega-0 достигает 81,8% успеха в домашних задачах Отраслевой брифинг с итогом: рост функциональности гуманоидов в бытовой среде. RobotToday ](https://robottoday.com/industry-briefing/omega-0-model-achieves-81-8-percent-success-in-home-tasks-by-nanyang-technological-university-and-partners/10532?ref=eclibra.com) 

Дополнительный источник для проверки ключевых показателей