
NVIDIA описала новый подход к управлению роботами — World Action Models, или WAM. Такие модели должны не только распознавать команду и выбирать действие, но и заранее представлять, как после этого изменится окружающая сцена. В одном из опубликованных NVIDIA сравнений успех робота вырос с 28,1 до 36,8%. Это заметный результат, но не анонс готового домашнего робота: речь идёт о моделях и лабораторных испытаниях для разработчиков.
Главное отличие от привычного подхода можно объяснить так. Модель VLA связывает изображение, текстовую команду и действие: видит предмет, понимает просьбу и выдаёт движения манипулятора. WAM добавляет прогноз будущего — пытается представить, что произойдёт с предметом и сценой после каждого движения. Для робота это важно: стакан можно не только распознать, но и опрокинуть, если выбрать неверную траекторию.
Что именно показала NVIDIA
В техническом материале NVIDIA от 4 августа компания разбирает несколько архитектур WAM, а не один товарный продукт. В основе находится модель мира, обученная по изображениям и видео. После дообучения она одновременно предсказывает будущие кадры и действия робота.
Для семейства Cosmos компания указывает большой набор предварительного обучения: около 767 млн изображений, 348 млн видео и 8 млн примеров действий. Перечислены модели на 4, 16 и 64 млрд параметров. Эти числа говорят о масштабе обучения, но сами по себе не показывают, насколько хорошо конкретный робот справится с уборкой квартиры или сортировкой предметов на складе.
Самое полезное сравнение проведено на наборе DROID. NVIDIA пишет, что при одинаковых рецепте обучения, данных и вычислительном бюджете использование универсального контрольного состояния Cosmos повысило успешность в RoboLab с 28,1 до 36,8%. Разница составляет 8,7 процентного пункта. Это не означает, что робот стал безошибочным: даже после улучшения успешными были немного больше трети попыток в указанной проверке.
Независимые исследовательские работы также рассматривают WAM как отдельное направление. Одна работа сравнивает обобщающую способность WAM и VLA на робототехнических наборах задач, а обзор World Action Models систематизирует их данные и способы оценки. Они подтверждают существование направления, но не превращают результат NVIDIA в независимый потребительский тест.

Зачем модели нужно «воображать» следующий кадр
Обычная связка «вижу команду — выдаю движение» может хорошо работать на знакомых сценах, но ломаться при небольшом изменении положения предмета, освещения или окружения. Прогноз будущего заставляет модель учитывать физическое последствие действия. Если захват прошёл мимо ручки кружки, следующий предполагаемый кадр будет отличаться от желаемого — и система получает дополнительный сигнал для коррекции.
Это не человеческое понимание физики. Модель строит вероятностный прогноз по обучающим данным и может ошибаться на редких объектах, прозрачных поверхностях, деформируемых материалах или в новой обстановке. Именно поэтому качество WAM нельзя оценивать только по красивому видео: нужны одинаковые задачи, повторные попытки и опубликованная доля успеха.
Может ли такая модель работать прямо на роботе
NVIDIA отдельно описывает четырёхмиллиардную версию для периферийного запуска. По данным компании, она способна обрабатывать изображение 640 × 360 точек и выдавать блок из 32 действий на платформе Jetson Thor с частотой до 15 Гц. Это показывает, что подход можно исполнять рядом с роботом, а не обязательно отправлять каждый кадр в удалённое облако.
Однако 15 Гц — не универсальная оценка скорости всего робота. Итоговая задержка зависит от камер, контроллера, механики, программного стека и сложности задачи. Заявленный результат также относится к платформе NVIDIA и выбранной конфигурации, поэтому переносить его на любой манипулятор нельзя.

Почему это пока не бытовой робот
В публикации нет серийной модели с ценой, датой поставки и перечнем домашних сценариев. WAM — инструмент для разработчиков и исследователей. Между моделью, которая улучшила результат в лабораторном наборе, и устройством, способным безопасно действовать рядом с детьми, животными и хрупкими предметами, остаются испытания, сертификация и интеграция с конкретной механикой.
Нет и подтверждённого российского релиза или локального сервиса. Для российского читателя значение новости технологическое: она показывает, каким способом производители пытаются сделать роботов устойчивее к новым ситуациям. Покупательского решения пока нет.
Как оценивать следующие демонстрации
При новом анонсе робота стоит проверить четыре вещи:
Пока самый аккуратный вывод такой: WAM действительно добавляют роботу прогноз последствий, а NVIDIA показала измеримое улучшение при контролируемом сравнении. Но 36,8% успеха в конкретном RoboLab-тесте — это аргумент в пользу дальнейшей разработки, а не доказательство появления универсального домашнего помощника.