Новини криптоміра

17.06.2026
09:55

Alibaba виводить Qwen у фізичний світ: представлено набір ШІ-моделей для керування роботами

Tool_AI

Китайський технологічний гігант Alibaba зробив важливий крок у напрямку так званого «втіленого штучного інтелекту» (Embodied AI), представивши Qwen-Robot Suite. Це не просто чергова мовна модель, а повноцінний програмний стек із трьох спеціалізованих фундаментальних моделей, призначених для того, щоб наділити роботів здатністю сприймати, планувати та діяти у фізичному світі. Йдеться про Qwen-RobotNav для навігації, Qwen-RobotManip для маніпуляції об'єктами та Qwen-RobotWorld — модель світу, що прогнозує наслідки дій.

Ключова відмінність цього підходу від традиційних LLM полягає в тому, що фізичним агентам недостатньо просто розуміти текст або зображення. Їм потрібно перетворювати команду природною мовою на точні рухи, враховувати тривимірний простір, фізику об'єктів та обмеження власних сенсорів. Alibaba Cloud уже запустила пілотні випробування цього набору у корпоративних клієнтів у сфері робототехніки.

Qwen-RobotNav: універсальний навігатор

Модель Qwen-RobotNav, побудована на базі Qwen3-VL, вирішує п'ять ключових завдань навігації в рамках однієї архітектури: слідування інструкціям, рух до цілі, пошук об'єктів, відстеження цілі та автономне водіння. Навчена на 15,6 мільйонах зразків, вона демонструє вражаючі результати: 76,5% успішності на бенчмарку VLN-CE RxR та 90% на EVT-Bench. По суті, це «мозок» для переміщення, який може бути інтегрований у більші агентні системи, де верхньорівнева модель ставить завдання, а Qwen-RobotNav відповідає за його фізичну реалізацію.

Qwen-RobotManip: майстерність взаємодії

Друга модель, Qwen-RobotManip, фокусується на фізичній взаємодії з об'єктами — захопленні, переміщенні та розміщенні. Головна інновація тут — спроба вирішити проблему несумісності даних від різних типів роботів (маніпулятори, дворучні платформи, мобільні системи). Модель навчається на величезному масиві даних, що перевищує 38 100 годин, включаючи відео дій людини від першої особи. Результат — перше місце в треку універсальних моделей RoboChallenge Table30 v1 і, що більш важливо, стійкість до нових інструкцій та перенесення навичок між різними роботизованими платформами.

Qwen-RobotWorld: передбачення майбутнього

Qwen-RobotWorld являє собою відеомодель світу, керовану текстом. Вона отримує поточне спостереження та команду, а потім генерує ймовірне відео того, як зміниться середовище. Це критично важливо для планування складних дій та створення синтетичних даних для навчання. Корпус Embodied World Knowledge, на якому навчалася модель, включає 8,6 млн пар «відео-текст» і охоплює понад 500 категорій дій. Модель уже посіла перші місця в бенчмарках EWMBench та DreamGen Bench, а також, за заявами розробників, демонструє високу узгодженість з базовими фізичними законами.

Аналітичний коментар: Безсумнівно, Qwen-Robot Suite — це потужна заявка на лідерство в сегменті Physical AI. Однак не варто тішити себе ілюзіями: від лабораторних бенчмарків до реальної роботи на складі або вдома — дистанція величезного розміру. Шум сенсорів, знос механіки та мільйони рідкісних сценаріїв залишаються серйозними перешкодами. Alibaba поки не розкрила ні вартість доступу, ні терміни публічного запуску, що свідчить про те, що до масового впровадження «розумних» роботів на базі Qwen ще далеко. Тим не менш, сам факт появи такого «стеку» від одного з найбільших хмарних провайдерів світу задає новий вектор розвитку всієї індустрії.