
Китайская AgiBot представила предварительную версию WITA-Omni — модели искусственного интеллекта, которая должна одновременно понимать изображение, звук и последовательность событий вокруг робота. В независимой таблице Daily-Omni она получила среднюю точность 85,21% и заняла первое место, опередив Qwen3.5-Omni-Plus и Gemini 3.1 Pro Preview.
Но отрыв от ближайшего соперника составляет всего 0,53 процентного пункта. Кроме того, Daily-Omni проверяет ответы на вопросы по готовым видеороликам, а не способность физического робота безопасно работать рядом с человеком. Поэтому результат действительно важен для развития более естественного общения с роботами, но пока не доказывает ни автономность, ни готовность WITA-Omni к массовому применению.
Что именно произошло
AgiBot 28 июля сообщила, что WITA-Omni Preview возглавила рейтинг Daily-Omni. Разработчик описывает её как «роботонативную» мультимодальную модель: она должна не только слышать речь и видеть изображение, но и учитывать, кто говорит, что происходит в этот момент и когда роботу следует отвечать.
Само первое место подтверждается не только релизом компании. В открытой таблице Daily-Omni, которую ведут исследователи Фуданьского университета, WITA-Omni действительно стоит первой среди моделей, получающих одновременно видео и звук.
Пять верхних результатов сейчас выглядят так:
| Модель | Тип | Средняя точность |
| AGIBOT X-Lab WITA-Omni Preview | закрытая | 85,21% |
| Qwen3.5-Omni-Plus | закрытая | 84,68% |
| Gemini 3.1 Pro Preview | закрытая | 82,79% |
| Doubao Seed 2.0 Lite | закрытая | 82,12% |
| NVIDIA Nemotron 3 Nano Omni 30B A3B | открытая | 74,52% |
Наша проверка даёт две полезные величины. WITA-Omni опережает ближайшую Qwen3.5-Omni-Plus на 0,53 процентного пункта, а лучшую открытую модель в таблице — на 10,69 пункта. Первая разница слишком мала, чтобы говорить о безусловном технологическом отрыве. Вторая уже заметна, но сравнивает закрытую систему с моделью, код и веса которой доступны исследователям.

Что проверяет Daily-Omni
Daily-Omni — не тест ловкости робота и не экзамен по безопасной работе в квартире. Согласно описанию исследования, набор состоит из 684 реальных видеороликов и 1197 вопросов с выбором ответа. Вопросы разделены на шесть семейств и требуют одновременно сопоставлять звук, изображение и время события.
Например, модели может понадобиться понять, какой звук относится к какому объекту, что произошло раньше, кто из людей говорит или почему видимое действие не совпадает с услышанным комментарием. Случайный выбор дал бы около 25% правильных ответов.
Такой тест ближе к реальной обстановке, чем отдельное распознавание картинки или аудиозаписи. Домашний либо сервисный робот тоже должен отличить обращённую к нему команду от фонового разговора, связать звук упавшего предмета с происходящим в комнате и не перебить человека ответом в неподходящий момент.
В таблице WITA-Omni показала лучший результат или разделила первое место в шести из восьми опубликованных срезов. При этом она не стала лучшей по пониманию контекста и по отдельной категории рассуждений. Это ещё одна причина не сводить сложный результат к фразе «ИИ AgiBot победил всех».
Почему AgiBot называет модель роботонативной
Компания описывает WITA-Omni через три логических слоя: Thinker анализирует происходящее, Talker формирует речевой ответ, а Actor связывает реакцию с движениями и выражением робота. Идея состоит в том, чтобы речь, жест и действие не собирались последовательно из нескольких плохо согласованных модулей.
Для человека разница должна выглядеть просто. Обычная голосовая система сначала распознаёт фразу, потом придумывает ответ и лишь затем запускает заранее подготовленную анимацию. Робот с общей моделью взаимодействия теоретически сможет продолжать наблюдать за собеседником во время ответа, выбрать адресата в группе и синхронизировать слова с движением.
Однако это пока описание разработчика. AgiBot не опубликовала веса WITA-Omni, открытый программный интерфейс, цену доступа и перечень серийных роботов, на которых покупатель сможет воспроизвести новый результат. В открытой таблице модель прямо помечена как закрытая.

Чего результат не доказывает
Во-первых, рейтинг оценивает ответы по заранее собранным видео. Он не проверяет навигацию, манипуляции руками, устойчивость, время реакции приводов и способность остановиться перед неожиданным препятствием.
Во-вторых, высокая средняя точность не равна безошибочности. Даже результат 85,21% означает, что часть вопросов осталась без правильного ответа. В физическом мире значение ошибки зависит от задачи: неверно выбрать собеседника неприятно, а неверно распознать опасное действие рядом с человеком уже рискованно.
В-третьих, репозиторий проекта Daily-Omni сообщает, что новые результаты были добавлены 26 июля и что данные для оценки нескольких конкурирующих систем предоставила AgiBot. Публичная таблица позволяет сверить цифры, но не заменяет независимый тест готового робота в одинаковых условиях.
Наконец, компания не объявила доступность WITA-Omni в России, поддержку русского языка, локальную обработку записей или правила хранения видео и звука. Поэтому российскому пользователю пока нечего покупать или устанавливать на основании этого анонса.
Что должно произойти дальше
Чтобы WITA-Omni превратилась из сильного исследовательского результата в проверяемую функцию робота, понадобятся как минимум четыре следующих шага:
Пока подтверждён только первый технический сигнал: модель AgiBot лучше всех представленных участников ответила на набор вопросов Daily-Omni. Она сильна в совместном понимании звука, изображения и времени, но отрыв от Qwen3.5-Omni-Plus составляет лишь 0,53 пункта. Это заметный результат для системы общения, а не доказательство автономной и безопасной работы робота в доме, магазине или на производстве.