Новини криптоміра

17.06.2026
11:33

Alibaba виводить ШІ у фізичний світ: представлено стек моделей Qwen-Robot Suite для керування роботами

Tool_AI

Alibaba Cloud зробила значний крок у розвитку фізичного штучного інтелекту (Physical AI), представивши Qwen-Robot Suite. Це не просто чергова мовна модель, а повноцінний стек із трьох спеціалізованих моделей, кожна з яких вирішує конкретне завдання робототехніки: навігацію, маніпуляцію об'єктами та прогнозування фізичних сцен. Команда Qwen називає цей проєкт «повним стеком для втіленого інтелекту».

Суть прориву в тому, що великі мовні моделі (LLM) уже чудово працюють із текстом, зображеннями та відео, але для взаємодії з реальним світом цього недостатньо. Роботам потрібно не просто розуміти команду природною мовою, а й перекладати її у фізичну дію: рухатися, хапати, враховувати гравітацію та властивості об'єктів. Qwen-Robot Suite покликаний закрити цей розрив між цифровим і фізичним.

Qwen-RobotNav: Універсальний навігатор

Перша модель зі стеку, Qwen-RobotNav, побудована на базі Qwen3-VL і є універсальним вирішувачем для п'яти типів навігаційних завдань: слідування інструкціям, рух до точки, пошук об'єктів, відстеження цілі та автономне водіння. Модель навчена на 15,6 мільйона зразків, пов'язаних із візуально-мовним міркуванням.

Результати вражають: 76,5% успішності на складному бенчмарку VLN-CE RxR і 90% на EVT-Bench. У реальних сценаріях це означає, що робот може не просто переміщатися, а, наприклад, знайти загублений предмет в офісі та надати візуальний доказ користувачеві. Qwen-RobotNav може працювати як виконавчий модуль для більших агентних систем, де модель верхнього рівня планує завдання, а ця модель відповідає за переміщення.

Qwen-RobotManip: Майстер маніпуляції

Друга модель, Qwen-RobotManip, вирішує одну з ключових проблем робототехніки — гетерогенність обладнання. Різні роботи (маніпулятори, дворучні платформи, мобільні системи) використовують різні системи координат і формати команд. Qwen-RobotManip намагається створити єдине представлення, дозволяючи переносити навички між різними типами роботів.

Для навчання було використано понад 38 100 годин даних, включаючи 11 320 годин відкритих робототехнічних даних, 1933 години відео дій людини та 24 808 годин синтетичних демонстрацій. Модель уже посіла перше місце в RoboChallenge Table30 v1 і демонструє стійкість до нових інструкцій і незнайомих об'єктів.

Qwen-RobotWorld: Передбачувач майбутнього

Третя модель, Qwen-RobotWorld, — це відеомодель світу, керована текстом. Вона отримує поточне спостереження та команду, а потім генерує ймовірний майбутній стан середовища. Це критично важливо для планування дій і створення синтетичних даних для навчання.

Корпус Embodied World Knowledge, на якому навчалася модель, включає 8,6 млн пар «відео-текст» і понад 200 млн кадрів, що охоплюють 20 типів роботів і 500 категорій дій. Qwen-RobotWorld уже посіла перші місця в бенчмарках EWMBench і DreamGen Bench, а також перевершила всі відкриті моделі в WorldModelBench і PBench, демонструючи високе розуміння фізики (рух, гравітація, рідини).

Мій аналіз: Qwen-Robot Suite — це стратегічно правильний крок. Alibaba не намагається створити іграшкового робота, а будує фундаментальну платформу для майбутнього. Однак до масового впровадження ще далеко. Реальні умови сповнені шуму, зносу та нестандартних ситуацій, які симулятори не враховують. Тим не менш, саме такі «стеки» — ключ до майбутнього, де ШІ не просто балакає, а діє.