Top.Mail.Ru
  • Новинки
  • Эксклюзив
  • Хиты продаж
  • Акции
  • Сделано Apple
  • Рекомендуем
  • Novelizer
  • Для взрослых
  • PREMIUM товары
  • Поиск по тегам
  • Статьи iG-Life
В каталог Публикации

AgiBot обошла Gemini и Qwen в тесте для роботов — но разница оказалась минимальной

Китайская AgiBot представила предварительную версию WITA-Omni — модели искусственного интеллекта, которая должна одновременно понимать изображение, звук и последовательность событий вокруг робота. В независимой таблице Daily-Omni она получила среднюю точность 85,21% и заняла первое место, опередив Qwen3.5-Omni-Plus и Gemini 3.1 Pro Preview.

Но отрыв от ближайшего соперника составляет всего 0,53 процентного пункта. Кроме того, Daily-Omni проверяет ответы на вопросы по готовым видеороликам, а не способность физического робота безопасно работать рядом с человеком. Поэтому результат действительно важен для развития более естественного общения с роботами, но пока не доказывает ни автономность, ни готовность WITA-Omni к массовому применению.

Что именно произошло

AgiBot 28 июля сообщила, что WITA-Omni Preview возглавила рейтинг Daily-Omni. Разработчик описывает её как «роботонативную» мультимодальную модель: она должна не только слышать речь и видеть изображение, но и учитывать, кто говорит, что происходит в этот момент и когда роботу следует отвечать.

Само первое место подтверждается не только релизом компании. В открытой таблице Daily-Omni, которую ведут исследователи Фуданьского университета, WITA-Omni действительно стоит первой среди моделей, получающих одновременно видео и звук.

Пять верхних результатов сейчас выглядят так:

МодельТипСредняя точность
AGIBOT X-Lab WITA-Omni Previewзакрытая85,21%
Qwen3.5-Omni-Plusзакрытая84,68%
Gemini 3.1 Pro Previewзакрытая82,79%
Doubao Seed 2.0 Liteзакрытая82,12%
NVIDIA Nemotron 3 Nano Omni 30B A3Bоткрытая74,52%

Наша проверка даёт две полезные величины. WITA-Omni опережает ближайшую Qwen3.5-Omni-Plus на 0,53 процентного пункта, а лучшую открытую модель в таблице — на 10,69 пункта. Первая разница слишком мала, чтобы говорить о безусловном технологическом отрыве. Вторая уже заметна, но сравнивает закрытую систему с моделью, код и веса которой доступны исследователям.

Что проверяет Daily-Omni

Daily-Omni — не тест ловкости робота и не экзамен по безопасной работе в квартире. Согласно описанию исследования, набор состоит из 684 реальных видеороликов и 1197 вопросов с выбором ответа. Вопросы разделены на шесть семейств и требуют одновременно сопоставлять звук, изображение и время события.

Например, модели может понадобиться понять, какой звук относится к какому объекту, что произошло раньше, кто из людей говорит или почему видимое действие не совпадает с услышанным комментарием. Случайный выбор дал бы около 25% правильных ответов.

Такой тест ближе к реальной обстановке, чем отдельное распознавание картинки или аудиозаписи. Домашний либо сервисный робот тоже должен отличить обращённую к нему команду от фонового разговора, связать звук упавшего предмета с происходящим в комнате и не перебить человека ответом в неподходящий момент.

В таблице WITA-Omni показала лучший результат или разделила первое место в шести из восьми опубликованных срезов. При этом она не стала лучшей по пониманию контекста и по отдельной категории рассуждений. Это ещё одна причина не сводить сложный результат к фразе «ИИ AgiBot победил всех».

Почему AgiBot называет модель роботонативной

Компания описывает WITA-Omni через три логических слоя: Thinker анализирует происходящее, Talker формирует речевой ответ, а Actor связывает реакцию с движениями и выражением робота. Идея состоит в том, чтобы речь, жест и действие не собирались последовательно из нескольких плохо согласованных модулей.

Для человека разница должна выглядеть просто. Обычная голосовая система сначала распознаёт фразу, потом придумывает ответ и лишь затем запускает заранее подготовленную анимацию. Робот с общей моделью взаимодействия теоретически сможет продолжать наблюдать за собеседником во время ответа, выбрать адресата в группе и синхронизировать слова с движением.

Однако это пока описание разработчика. AgiBot не опубликовала веса WITA-Omni, открытый программный интерфейс, цену доступа и перечень серийных роботов, на которых покупатель сможет воспроизвести новый результат. В открытой таблице модель прямо помечена как закрытая.

Чего результат не доказывает

Во-первых, рейтинг оценивает ответы по заранее собранным видео. Он не проверяет навигацию, манипуляции руками, устойчивость, время реакции приводов и способность остановиться перед неожиданным препятствием.

Во-вторых, высокая средняя точность не равна безошибочности. Даже результат 85,21% означает, что часть вопросов осталась без правильного ответа. В физическом мире значение ошибки зависит от задачи: неверно выбрать собеседника неприятно, а неверно распознать опасное действие рядом с человеком уже рискованно.

В-третьих, репозиторий проекта Daily-Omni сообщает, что новые результаты были добавлены 26 июля и что данные для оценки нескольких конкурирующих систем предоставила AgiBot. Публичная таблица позволяет сверить цифры, но не заменяет независимый тест готового робота в одинаковых условиях.

Наконец, компания не объявила доступность WITA-Omni в России, поддержку русского языка, локальную обработку записей или правила хранения видео и звука. Поэтому российскому пользователю пока нечего покупать или устанавливать на основании этого анонса.

Что должно произойти дальше

Чтобы WITA-Omni превратилась из сильного исследовательского результата в проверяемую функцию робота, понадобятся как минимум четыре следующих шага:

  • AgiBot должна назвать конкретные модели роботов и версии программного обеспечения, в которых работает WITA-Omni.
  • Нужен воспроизводимый тест живого взаимодействия: несколько людей, шум, перебивания, неожиданные события и одинаковые задания для конкурентов.
  • Разработчику предстоит раскрыть задержку ответа, требования к вычислениям, режим обработки данных и ограничения безопасности.
  • Для российского рынка потребуются подтверждённые русский язык, канал поставки, сервис и правила работы с пользовательскими записями.

Пока подтверждён только первый технический сигнал: модель AgiBot лучше всех представленных участников ответила на набор вопросов Daily-Omni. Она сильна в совместном понимании звука, изображения и времени, но отрыв от Qwen3.5-Omni-Plus составляет лишь 0,53 пункта. Это заметный результат для системы общения, а не доказательство автономной и безопасной работы робота в доме, магазине или на производстве.

В тренде 🔥
После июльского обновления Galaxy S25 быстрее разряжается? Что проверить до сброса
Несколько владельцев Samsung Galaxy S25 и S25 Ultra сообщили о быстром разряде или нагреве после июльского обновления. Редакция нашла пять отдельных публичных сообщений на Samsung Community и Reddit, но это ранний пользовательский сигнал, а не доказательс
«Одиссея» за 12 рублей: как распознать поддельный кино-сайт и что делать после списания
Сайт, который предлагает посмотреть новый фильм «Одиссея» за 12 рублей, может оказаться не дешёвым кинотеатром, а платёжной ловушкой. «Лаборатория Касперского» сообщила о двух схемах для русскоязычных пользователей: в одной после первого небольшого платеж
Приложение МТС «Защитник» закрывается: когда отключится и куда перейти
Отдельное мобильное приложение МТС «Защитник», которое блокировало спам-звонки по подписке, прекращает работу. Автопродление уже отключено, доступ закончится вместе с оплаченным периодом не позднее 14 августа 2026 года, а 17 августа МТС завершит техническ
Моющий пылесос Roborock F25 RT или Dreame H14 Dual: стоит ли платить вдвое больше
Моющий пылесос Roborock F25 RT RU и Dreame H14 Dual выглядят как устройства одного класса, но покупатель получает системы разного масштаба. Roborock за 27 130 рублей специализируется на твёрдом полу: одновременно собирает мусор и моет поверхность. Dreame
Беспроводные наушники Realme Buds Air 8 Pro или Redmi Buds 8 Pro: одни яснее звучат, другие лучше гасят дорогу
Беспроводные наушники realme Buds Air 8 Pro и Redmi Buds 8 Pro оказались гораздо ближе, чем можно решить по коробкам. У обеих моделей сильное активное шумоподавление, хорошие микрофоны и управление громкостью свайпом. Но прямой тест выявил два разных хара
Роботы-пылесосы Roborock Q8 Max или Qrevo S: за что просят ещё 25 720 рублей
Роботы-пылесосы Roborock Q8 Max Black RU и Qrevo S Black RU в одном российском фирменном магазине стоят 24 270 и 49 990 рублей. Разница составляет 25 720 рублей, то есть более дорогая модель обходится примерно вдвое дороже.
Планшеты Xiaomi Pad 8 или Pad 7: новый быстрее, но старый дешевле почти на 8 000 рублей
Планшеты Xiaomi Pad 8 Wi‑Fi 8/256 GB и Pad 7 относятся к соседним поколениям. Новый получил более мощный Snapdragon 8s Gen 4, батарею 9 200 мА·ч и HyperOS 3. Однако экран почти не изменился: у обоих 11,2-дюймовая IPS-панель 3.2K с частотой до 144 Гц, а за
Умные часы Apple Watch Series 11 или SE 3: стоит ли доплачивать за здоровье и ещё 6 часов батареи
Умные часы Apple Watch SE 3 получили тот же чип S10, always-on экран, быструю зарядку и 64 GB памяти, что резко сократило разрыв с Series 11. В России GPS-версия SE 3 в алюминии сейчас стоит примерно от 20 690 рублей, а Series 11 — от 27 690 рублей.
Wildberries начал выплаты за пострадавшие товары: какие документы собрать и чем поможет АПМ
Wildberries начал первые выплаты за пострадавшие товары. Рассказываем, какие отчёты сохранить, как проверить начисление и как АПМ помогает селлерам систематизировать подтверждённые случаи.
HONOR Robot Phone открыли для предзаказа: зачем смартфону камера на роботизированной руке
HONOR 18 июля открыла в Китае предзаказ Robot Phone — необычного смартфона, у которого основная камера выдвигается из корпуса на миниатюрном механическом подвесе. Это уже не очередной выставочный прототип: компания начала собирать заявки перед коммерчески
Хотите видеть меньше сообщений? Зарегистрируйтесь или войдите в аккаунт