Alibaba впроваджує ШІ у фізичний світ: представлено стек моделей Qwen-Robot Suite для керування роботами

Китайський технологічний гігант Alibaba зробив значний крок у бік «втіленого штучного інтелекту» (Embodied AI), представивши набір фундаментальних моделей Qwen-Robot Suite. Цей комплекс із трьох спеціалізованих моделей призначений для вирішення ключових завдань, що стоять перед фізичними роботами: навігація, маніпуляція об'єктами та прогнозування розвитку сцени. Йдеться не про готового робота, а про програмний «мозок», який, за задумом розробників, має стати універсальним інструментом для керування різними типами механізмів.
Великі мовні моделі (LLM) вже довели свою ефективність у роботі з текстом, зображеннями та відео. Однак для роботів цього недостатньо. Їм потрібно не просто розуміти команду природною мовою, а й перекладати її в послідовність фізичних дій, враховуючи геометрію простору, властивості об'єктів та обмеження власних датчиків. Саме цю проблему і покликаний вирішити Qwen-Robot Suite, об'єднавши сприйняття, планування та виконання в єдиному стеку.
Qwen-RobotNav: універсальний навігатор
Перша модель із набору, Qwen-RobotNav, зосереджена на пересуванні. Вона об'єднує в собі п'ять різних навігаційних завдань: слідування інструкціям, рух до заданої точки, пошук об'єктів, відстеження цілі та елементи автономного водіння. Побудована на базі мультимодальної моделі Qwen3-VL, вона була навчена на 15,6 мільйона зразків даних, пов'язаних із плануванням маршрутів та візуально-мовними міркуваннями.
Результати тестування вражають: модель демонструє 76,5% успішності на бенчмарку VLN-CE RxR та 90% на EVT-Bench. Alibaba позиціонує Qwen-RobotNav не як ізольоване рішення, а як виконавчий модуль для більших агентних систем, де модель верхнього рівня ставить завдання, а навігатор відповідає за його фізичну реалізацію.
Qwen-RobotManip: майстер маніпуляцій
Друга модель, Qwen-RobotManip, відповідає за взаємодію з об'єктами: захоплення, переміщення та розміщення предметів. Ключова інновація тут — спроба вирішити проблему гетерогенності робототехнічних платформ. Різні роботи (маніпулятори, дворучні системи, мобільні платформи) використовують різні системи координат та формати команд. Qwen-RobotManip прагне створити універсальне представлення дій, дозволяючи переносити навички, отримані на одному типі робота, на інший.
Для навчання моделі було зібрано колосальний обсяг даних — понад 38 100 годин, що включає як відкриті робототехнічні набори, так і відео дій людини. Це дозволило Qwen-RobotManip посісти перше місце в престижному бенчмарку RoboChallenge Table30 v1 та продемонструвати стійкість до нових, незнайомих інструкцій та об'єктів.
Qwen-RobotWorld: передбачувач майбутнього
Третя модель, Qwen-RobotWorld, являє собою «відеомодель світу», керовану мовою. Вона аналізує поточний стан середовища та текстову команду, а потім генерує відео, що прогнозує, як розвиватиметься сцена після виконання дії. Такий підхід є критично важливим для планування складних маніпуляцій, автономного водіння та створення синтетичних даних для навчання роботів без ризику поломок у реальному світі.
Корпус даних для Qwen-RobotWorld, названий Embodied World Knowledge, включає 8,6 мільйонів пар «відео-текст» та понад 200 мільйонів кадрів, що охоплюють понад 20 типів роботів та 500 категорій дій. Модель вже посіла перші місця в бенчмарках EWMBench та DreamGen Bench, а також перевершила всі відкриті аналоги в WorldModelBench та PBench.
Аналітичний висновок
Незважаючи на вражаючі заяви та високі показники в бенчмарках, Qwen-Robot Suite залишається набором дослідницьких моделей, а не готовим комерційним продуктом. Реальні умови експлуатації роботів сповнені «шуму», зносу та непередбачуваних ситуацій, які важко змоделювати. Тим не менш, сам підхід Alibaba до створення «повного стеку» для втіленого ШІ є надзвичайно перспективним. Якщо компанії вдасться інтегрувати ці моделі в реальні виробничі та сервісні сценарії, ми станемо свідками якісного стрибка в розвитку робототехніки. Однак до масового впровадження та публічного доступу, судячи з відсутності конкретних термінів і цін, залишається ще щонайменше кілька років інтенсивних випробувань.