Новини криптоміра

17.06.2026
11:02

Alibaba впроваджує ШІ у фізичний світ: представлено стек моделей Qwen-Robot Suite для керування роботами

Tool_AI

Китайський технологічний гігант Alibaba зробив значний крок у бік «втіленого штучного інтелекту» (Embodied AI), представивши набір фундаментальних моделей Qwen-Robot Suite. Цей комплекс із трьох спеціалізованих моделей призначений для вирішення ключових завдань, що стоять перед фізичними роботами: навігація, маніпуляція об'єктами та прогнозування розвитку сцени. Йдеться не про готового робота, а про програмний «мозок», який, за задумом розробників, має стати універсальним інструментом для керування різними типами механізмів.

Великі мовні моделі (LLM) вже довели свою ефективність у роботі з текстом, зображеннями та відео. Однак для роботів цього недостатньо. Їм потрібно не просто розуміти команду природною мовою, а й перекладати її в послідовність фізичних дій, враховуючи геометрію простору, властивості об'єктів та обмеження власних датчиків. Саме цю проблему і покликаний вирішити Qwen-Robot Suite, об'єднавши сприйняття, планування та виконання в єдиному стеку.

Qwen-RobotNav: універсальний навігатор

Перша модель із набору, Qwen-RobotNav, зосереджена на пересуванні. Вона об'єднує в собі п'ять різних навігаційних завдань: слідування інструкціям, рух до заданої точки, пошук об'єктів, відстеження цілі та елементи автономного водіння. Побудована на базі мультимодальної моделі Qwen3-VL, вона була навчена на 15,6 мільйона зразків даних, пов'язаних із плануванням маршрутів та візуально-мовними міркуваннями.

Результати тестування вражають: модель демонструє 76,5% успішності на бенчмарку VLN-CE RxR та 90% на EVT-Bench. Alibaba позиціонує Qwen-RobotNav не як ізольоване рішення, а як виконавчий модуль для більших агентних систем, де модель верхнього рівня ставить завдання, а навігатор відповідає за його фізичну реалізацію.

Qwen-RobotManip: майстер маніпуляцій

Друга модель, Qwen-RobotManip, відповідає за взаємодію з об'єктами: захоплення, переміщення та розміщення предметів. Ключова інновація тут — спроба вирішити проблему гетерогенності робототехнічних платформ. Різні роботи (маніпулятори, дворучні системи, мобільні платформи) використовують різні системи координат та формати команд. Qwen-RobotManip прагне створити універсальне представлення дій, дозволяючи переносити навички, отримані на одному типі робота, на інший.

Для навчання моделі було зібрано колосальний обсяг даних — понад 38 100 годин, що включає як відкриті робототехнічні набори, так і відео дій людини. Це дозволило Qwen-RobotManip посісти перше місце в престижному бенчмарку RoboChallenge Table30 v1 та продемонструвати стійкість до нових, незнайомих інструкцій та об'єктів.

Qwen-RobotWorld: передбачувач майбутнього

Третя модель, Qwen-RobotWorld, являє собою «відеомодель світу», керовану мовою. Вона аналізує поточний стан середовища та текстову команду, а потім генерує відео, що прогнозує, як розвиватиметься сцена після виконання дії. Такий підхід є критично важливим для планування складних маніпуляцій, автономного водіння та створення синтетичних даних для навчання роботів без ризику поломок у реальному світі.

Корпус даних для Qwen-RobotWorld, названий Embodied World Knowledge, включає 8,6 мільйонів пар «відео-текст» та понад 200 мільйонів кадрів, що охоплюють понад 20 типів роботів та 500 категорій дій. Модель вже посіла перші місця в бенчмарках EWMBench та DreamGen Bench, а також перевершила всі відкриті аналоги в WorldModelBench та PBench.

Аналітичний висновок

Незважаючи на вражаючі заяви та високі показники в бенчмарках, Qwen-Robot Suite залишається набором дослідницьких моделей, а не готовим комерційним продуктом. Реальні умови експлуатації роботів сповнені «шуму», зносу та непередбачуваних ситуацій, які важко змоделювати. Тим не менш, сам підхід Alibaba до створення «повного стеку» для втіленого ШІ є надзвичайно перспективним. Якщо компанії вдасться інтегрувати ці моделі в реальні виробничі та сервісні сценарії, ми станемо свідками якісного стрибка в розвитку робототехніки. Однак до масового впровадження та публічного доступу, судячи з відсутності конкретних термінів і цін, залишається ще щонайменше кілька років інтенсивних випробувань.