Alibaba виводить ШІ у фізичний світ: представлено стек моделей Qwen-Robot Suite для керування роботами

Alibaba офіційно представила Qwen-Robot Suite — комплексний набір фундаментальних ШІ-моделей, призначених для вирішення завдань у фізичному середовищі. До пакету увійшли три спеціалізовані моделі: Qwen-RobotNav для навігації, Qwen-RobotManip для маніпуляції об'єктами та Qwen-RobotWorld для прогнозування розвитку сцени. Розробники позиціонують цей проєкт як «повний стек для втіленого штучного інтелекту» (embodied AI). Йдеться про програмні моделі, які дозволяють фізичним агентам — роботам — сприймати навколишній простір, планувати дії та виконувати команди, віддані природною мовою. Наразі Qwen-Robot Suite проходить пілотні випробування у вибраних корпоративних клієнтів Alibaba Cloud у сфері робототехніки.
Навіщо Alibaba виводить Qwen у фізичний світ
Сучасні великі мовні та мультимодальні моделі блискуче справляються з текстом, зображеннями та відео, але для роботів цього категорично недостатньо. Фізичним агентам потрібно не просто розуміти команду, а й трансформувати її в точний рух, враховуючи просторові обмеження, властивості об'єктів, шуми сенсорів та наслідки кожної дії. Alibaba називає це напрямком physical AI, або «втіленого ШІ», де модель оперує не лише цифровими даними, а й реальним фізичним середовищем.
Qwen-RobotNav: п'ять завдань навігації в одній моделі
Модель Qwen-RobotNav, побудована на базі Qwen3-VL та навчена на 15,6 мільйона зразків, об'єднує п'ять ключових навігаційних завдань: слідування інструкціям, рух до заданої точки, пошук об'єктів, відстеження цілі та автономне водіння. Результати вражають: 76,5% успішності на бенчмарку VLN-CE RxR та 90% на EVT-Bench. Ключова особливість — модель може виступати в ролі виконавчого інструменту для більших агентних систем, де верхньорівнева модель планує завдання, а Qwen-RobotNav відповідає за фізичне переміщення. У демонстраціях показані сценарії пошуку загубленого предмета в приміщенні або перевірки стану конкретного об'єкта, де робот не просто рухається, а збирає візуальні докази.
Qwen-RobotManip: дії з об'єктами та перенесення навичок
Qwen-RobotManip вирішує одну з фундаментальних проблем робототехніки — несумісність форматів команд між різними типами пристроїв (маніпулятор, дворучна платформа, мобільна система). Модель приводить дані до спільного представлення, дозволяючи переносити навички, отримані на одному типі робота, на інший. Для навчання було використано понад 38 100 годин даних, включаючи 11 320 годин відкритих робототехнічних даних, 1933 години відео дій людини та 24 808 годин синтетичних демонстрацій. Модель посіла перше місце в RoboChallenge Table30 v1 та продемонструвала стійкість до нових інструкцій і незнайомих об'єктів.
Qwen-RobotWorld: відеомодель світу для прогнозування
Qwen-RobotWorld являє собою відеомодель світу, керовану природною мовою. Отримавши поточне спостереження та текстову команду, вона генерує ймовірний майбутній стан середовища. Корпус Embodied World Knowledge, зібраний для навчання, включає 8,6 млн пар «відео-текст» та понад 200 млн кадрів, що охоплюють 20 типів роботизованих платформ і 500 категорій дій. Модель посіла перші місця в EWMBench та DreamGen Bench, перевершивши всі відкриті аналоги в WorldModelBench та PBench. Розробники стверджують, що модель демонструє високу узгодженість з базовими фізичними закономірностями — рухом, збереженням маси та гравітацією.
До масових роботів ще далеко
Незважаючи на вражаючі заявлені показники, Qwen-Robot Suite залишається набором дослідницьких моделей, а не готовою споживчою платформою. Реальне впровадження стикається з шумом сенсорів, зносом приводів та величезною кількістю рідкісних сценаріїв, які неможливо змоделювати в бенчмарках. Alibaba поки не розкрила вартість доступу, терміни публічного запуску або конкретний список клієнтів, які тестують систему.
Думка експерта: Alibaba робить стратегічно правильний крок, об'єднуючи навігацію, маніпуляцію та прогнозування в єдиний стек. Однак ринок бачив багато багатообіцяючих робототехнічних платформ, які так і не вийшли з лабораторій. Ключовим фактором успіху стане не стільки точність на бенчмарках, скільки здатність моделей адаптуватися до реального хаосу фізичного світу. Поки що це сильний сигнал для індустрії, але не революція.