Alibaba виводить Qwen у фізичний світ: представлено стек ШІ-моделей для керування роботами

Китайський технологічний гігант Alibaba здійснив стратегічний прорив у галузі робототехніки, представивши Qwen-Robot Suite — комплексний набір фундаментальних моделей штучного інтелекту, призначених для керування фізичними агентами. Цей крок знаменує перехід від суто цифрових LLM до так званого «втіленого інтелекту» (embodied AI), де ШІ вчиться взаємодіяти з реальним світом.
Пакет включає три ключові моделі: Qwen-RobotNav для навігації, Qwen-RobotManip для маніпуляції об'єктами та Qwen-RobotWorld для прогнозування розвитку сцени. На відміну від традиційних мовних моделей, які оперують текстом і зображеннями, ці системи повинні сприймати простір, планувати траєкторії та виконувати команди природною мовою в реальних умовах. Вже зараз Suite проходить пілотні випробування у корпоративних клієнтів Alibaba Cloud у сфері робототехніки.
П'ять завдань навігації в одній моделі
Модель Qwen-RobotNav, побудована на базі Qwen3-VL, вирішує цілий спектр завдань: від слідування інструкціям і руху до заданої точки до пошуку об'єктів, відстеження цілей та автономного водіння. Вона навчена на 15,6 мільйона зразків, пов'язаних із візуально-мовним міркуванням. Показники вражають: 76,5% успішності на бенчмарку VLN-CE RxR та 90% на EVT-Bench. Це дозволяє використовувати модель як «двигун» для більших агентних систем, де верхньорівневий планувальник ставить завдання, а Qwen-RobotNav відповідає за фізичне переміщення.
Універсальний маніпулятор і модель світу
Qwen-RobotManip вирішує одну з найскладніших проблем робототехніки — гетерогенність даних. Різні роботи (маніпулятори, дворучні платформи, мобільні системи) використовують різні системи координат і формати команд. Модель приводить ці дані до спільного представлення, навчаючись на понад 38 100 годинах даних, включаючи 11 320 годин відкритих роботичних даних та 24 808 годин синтетичних демонстрацій. Результат — перше місце в RoboChallenge Table30 v1 та стійкість до нових інструкцій і незнайомих об'єктів.
Qwen-RobotWorld — це відеомодель світу, керована природною мовою. Вона прогнозує, як зміниться сцена після заданої дії, що критично важливо для планування та створення синтетичних навчальних даних. Корпус Embodied World Knowledge включає 8,6 млн пар «відео-текст» та понад 200 млн кадрів, що охоплюють 20 типів роботичних платформ. Модель посіла перші місця в EWMBench та DreamGen Bench, продемонструвавши високу узгодженість із фізичними законами, включаючи гравітацію та збереження маси.
Мій аналіз: Alibaba робить ставку на створення універсального «мозку» для роботів, що є логічним продовженням гонки LLM. Однак шлях від вражаючих бенчмарків до масового впровадження в реальному світі з його шумом сенсорів і рідкісними сценаріями залишається надзвичайно складним. Поки що це радше потужний інструмент для розробників, а не готовий продукт для споживача.