Top.Mail.Ru
  • Новинки
  • Эксклюзив
  • Хиты продаж
  • Акции
  • Сделано Apple
  • Рекомендуем
  • Novelizer
  • Для взрослых
  • PREMIUM товары
  • Поиск по тегам
  • Статьи iG-Life
  • Фильмы iG-Kino
В каталог Публикации

NVIDIA научила модель робота предсказывать последствия действий: что доказали цифры и где предел

NVIDIA описала новый подход к управлению роботами — World Action Models, или WAM. Такие модели должны не только распознавать команду и выбирать действие, но и заранее представлять, как после этого изменится окружающая сцена. В одном из опубликованных NVIDIA сравнений успех робота вырос с 28,1 до 36,8%. Это заметный результат, но не анонс готового домашнего робота: речь идёт о моделях и лабораторных испытаниях для разработчиков.

Главное отличие от привычного подхода можно объяснить так. Модель VLA связывает изображение, текстовую команду и действие: видит предмет, понимает просьбу и выдаёт движения манипулятора. WAM добавляет прогноз будущего — пытается представить, что произойдёт с предметом и сценой после каждого движения. Для робота это важно: стакан можно не только распознать, но и опрокинуть, если выбрать неверную траекторию.

Что именно показала NVIDIA

В техническом материале NVIDIA от 4 августа компания разбирает несколько архитектур WAM, а не один товарный продукт. В основе находится модель мира, обученная по изображениям и видео. После дообучения она одновременно предсказывает будущие кадры и действия робота.

Для семейства Cosmos компания указывает большой набор предварительного обучения: около 767 млн изображений, 348 млн видео и 8 млн примеров действий. Перечислены модели на 4, 16 и 64 млрд параметров. Эти числа говорят о масштабе обучения, но сами по себе не показывают, насколько хорошо конкретный робот справится с уборкой квартиры или сортировкой предметов на складе.

Самое полезное сравнение проведено на наборе DROID. NVIDIA пишет, что при одинаковых рецепте обучения, данных и вычислительном бюджете использование универсального контрольного состояния Cosmos повысило успешность в RoboLab с 28,1 до 36,8%. Разница составляет 8,7 процентного пункта. Это не означает, что робот стал безошибочным: даже после улучшения успешными были немного больше трети попыток в указанной проверке.

Независимые исследовательские работы также рассматривают WAM как отдельное направление. Одна работа сравнивает обобщающую способность WAM и VLA на робототехнических наборах задач, а обзор World Action Models систематизирует их данные и способы оценки. Они подтверждают существование направления, но не превращают результат NVIDIA в независимый потребительский тест.

Зачем модели нужно «воображать» следующий кадр

Обычная связка «вижу команду — выдаю движение» может хорошо работать на знакомых сценах, но ломаться при небольшом изменении положения предмета, освещения или окружения. Прогноз будущего заставляет модель учитывать физическое последствие действия. Если захват прошёл мимо ручки кружки, следующий предполагаемый кадр будет отличаться от желаемого — и система получает дополнительный сигнал для коррекции.

Это не человеческое понимание физики. Модель строит вероятностный прогноз по обучающим данным и может ошибаться на редких объектах, прозрачных поверхностях, деформируемых материалах или в новой обстановке. Именно поэтому качество WAM нельзя оценивать только по красивому видео: нужны одинаковые задачи, повторные попытки и опубликованная доля успеха.

Может ли такая модель работать прямо на роботе

NVIDIA отдельно описывает четырёхмиллиардную версию для периферийного запуска. По данным компании, она способна обрабатывать изображение 640 × 360 точек и выдавать блок из 32 действий на платформе Jetson Thor с частотой до 15 Гц. Это показывает, что подход можно исполнять рядом с роботом, а не обязательно отправлять каждый кадр в удалённое облако.

Однако 15 Гц — не универсальная оценка скорости всего робота. Итоговая задержка зависит от камер, контроллера, механики, программного стека и сложности задачи. Заявленный результат также относится к платформе NVIDIA и выбранной конфигурации, поэтому переносить его на любой манипулятор нельзя.

Почему это пока не бытовой робот

В публикации нет серийной модели с ценой, датой поставки и перечнем домашних сценариев. WAM — инструмент для разработчиков и исследователей. Между моделью, которая улучшила результат в лабораторном наборе, и устройством, способным безопасно действовать рядом с детьми, животными и хрупкими предметами, остаются испытания, сертификация и интеграция с конкретной механикой.

Нет и подтверждённого российского релиза или локального сервиса. Для российского читателя значение новости технологическое: она показывает, каким способом производители пытаются сделать роботов устойчивее к новым ситуациям. Покупательского решения пока нет.

Как оценивать следующие демонстрации

При новом анонсе робота стоит проверить четыре вещи:

  • Названа ли точная модель робота и конфигурация вычислителя.
  • Опубликовано ли число попыток и доля успеха, а не только удачный ролик.
  • Сравнивались ли системы на одинаковых данных и вычислительном бюджете.
  • Есть ли независимая проверка на незнакомых сценах и предметах.

Пока самый аккуратный вывод такой: WAM действительно добавляют роботу прогноз последствий, а NVIDIA показала измеримое улучшение при контролируемом сравнении. Но 36,8% успеха в конкретном RoboLab-тесте — это аргумент в пользу дальнейшей разработки, а не доказательство появления универсального домашнего помощника.

В тренде 🔥
Текстура и зерно на iPhone: кому Apple обещает новые настройки фото
Apple обещает добавить в «Фотографические стили» — Photographic Styles — регуляторы текстуры и зерна. Они заявлены с iOS 27 для конкретного списка iPhone, в котором есть и прежние модели. Поэтому покупать iPhone 18 Pro только ради этих двух настроек, судя
Зачем HONOR Robot Phone снимает в LogC3 и что делать с видео после съёмки
LogC3 в HONOR Robot Phone рассчитан на съёмку с последующей коррекцией цвета. По описанию производителя, основная камера записывает 10-битное видео ARRI LogC3 в режиме ARRI CINEMA. Польза этой функции раскрывается, когда автор планирует обрабатывать матер
Что исправили в WebKit для iPhone XS и XR — и зачем проверить обновления
В iOS 18.7.10 и iPadOS 18.7.10 Apple исправила ошибки WebKit, из-за которых вредоносный сайт мог получить данные другого веб-источника. Исправления адресованы iPhone XS, XS Max, XR и iPad 7-го поколения. Их практическая польза — закрыть конкретные пути во
Два окна на iPhone Duo: для чего Apple предлагает Split View
Сравниваете две страницы в браузере или выбираете фотографию для письма — и постоянно возвращаетесь из одного окна в другое. Для iPhone Duo Apple заявила Split View: режим, в котором два приложения видны рядом. Компания описывает также два окна Safari, пе
Как оценить макроснимок украшения: пример HONOR Magic7 Pro и Magic8 Pro
Красивое размытие фона ещё не отвечает на вопрос, хорошо ли получилось само украшение. В фотосерии Галины Белки на HONOR Club снимок Magic8 Pro понравился автору деталями и фоном, но часть предмета оказалась нерезкой. У Magic7 Pro почти всё украшение было
AirPods 5 против AirPods 4 с ANC: что меняется и стоит ли обновляться
Владельцу исправных AirPods 4 с шумоподавлением стоит оценивать AirPods 5 по двум заявленным изменениям: подавлению внешнего шума и времени работы. Apple обещает улучшения, но независимого сравнения в этих источниках нет
"Garmin за 3 копейки": в сети появились первые отзывы о Amazfit Active Max с оффлайн-картами
В сети наконец появились отзывы пользователей Amazfit Active Max. Рассказываем, какие преимущества и недостатки уже замечены.
Honor Magic 8 Pro Air уже в продаже: сколько просят за 5500 мАч в корпусе толщиной всего 6,1 мм?
Honor Magic 8 Pro Air тоньше iPhone, но живёт дольше: в чём секрет?
Реально удобно? Появись первые отзывы об "умных очках без дисплея" от Xioami
Появились первые отзывы об умных очках от Xiaomi. Рассказываем, что говорят пользователи.
Infinix Note 60 Ultra от Pininfarina умеет звонить через спутник
Infinix Note 60 Ultra получил дизайн от Pininfarina! И это далеко не единственная фича новинки!
Хотите видеть меньше сообщений? Зарегистрируйтесь или войдите в аккаунт