Новини криптоміра

17.06.2026
10:16

Alibaba виводить ШІ у фізичний світ: представлено стек моделей Qwen-Robot Suite для керування роботами

Tool_AI

Китайський технологічний гігант Alibaba здійснив стратегічний прорив, анонсувавши Qwen-Robot Suite — комплексний набір моделей штучного інтелекту, призначених для керування роботами та вирішення завдань у фізичному середовищі. Це не просто чергове оновлення мовної моделі, а повноцінний крок у бік «втіленого ШІ» (embodied AI), де алгоритми навчаються взаємодіяти з реальним світом, а не лише з текстом і зображеннями.

Пакет включає три спеціалізовані моделі. Qwen-RobotNav відповідає за навігацію, Qwen-RobotManip — за маніпуляції з об'єктами, а Qwen-RobotWorld є відеомоделлю світу, здатною прогнозувати розвиток сцени на основі текстових команд. В Alibaba прямо називають цей набір «повним стеком для втіленого інтелекту». Наразі пілотні випробування проходять у окремих корпоративних клієнтів Alibaba Cloud у сфері робототехніки.

Чому мовних моделей недостатньо для роботів

Ключова проблема, яку вирішує Qwen-Robot Suite, — розрив між цифровим сприйняттям і фізичною дією. Сучасні LLM чудово справляються з текстами, зображеннями та відео, але роботу потрібно не просто зрозуміти команду, а перевести її в точний рух, врахувати тертя, гравітацію, обмеження сенсорів та просторові властивості об'єктів. Alibaba називає цей напрямок physical AI, підкреслюючи, що модель має працювати з «цифрою» та «фізикою» одночасно.

Qwen-RobotNav: універсальний навігатор на базі Qwen3-VL

Модель об'єднує п'ять ключових завдань навігації в одному алгоритмі: слідування інструкціям, рух до заданої точки, пошук об'єктів, відстеження цілі та автономне водіння. Вона побудована на архітектурі Qwen3-VL і навчена на 15,6 мільйона зразків, пов'язаних із плануванням маршрутів та візуально-мовним міркуванням. Результати вражають: 76,5% успішності на бенчмарку VLN-CE RxR та 90% на EVT-Bench. У практичних сценаріях робот може знайти загублений предмет в офісі або перевірити, чи відчинені двері в будівлі, збираючи візуальні докази та повертаючи відповідь користувачеві.

Qwen-RobotManip: уніфікація фізичних дій

Одна з головних головних болів робототехніки — несумісність форматів команд між різними типами пристроїв. Маніпулятор, дворучна платформа та мобільний робот «говорять» різними мовами координат і суглобів. Qwen-RobotManip вирішує це завдання, приводячи дані до спільного представлення. Для навчання було використано понад 38 100 годин даних, включаючи 11 320 годин відкритих робототехнічних записів та 24 808 годин синтетичних демонстрацій. Модель уже посіла перше місце в RoboChallenge Table30 v1, продемонструвавши стійкість до незнайомих об'єктів та перенесення навичок між роботами.

Qwen-RobotWorld: передбачення фізики

Ця модель — справжній прорив у галузі симуляції. Qwen-RobotWorld генерує ймовірний майбутній стан середовища на основі поточного спостереження та текстової команди. Вона навчена на корпусі Embodied World Knowledge, який включає 8,6 млн пар «відео-текст» та понад 200 млн кадрів, що охоплюють 20 типів роботизованих платформ. Модель посіла перше місце в EWMBench та DreamGen Bench, а також перевершила всі відкриті аналоги в WorldModelBench. Важливо, що вона демонструє високу узгодженість із базовими фізичними законами — рухом, збереженням маси та гравітацією.

Експертна думка

Alibaba зробила потужний задел, але важливо розуміти: Qwen-Robot Suite — це поки що набір інструментів для розробників, а не готовий споживчий продукт. Реальні сценарії впровадження стикаються з шумом сенсорів, зносом приводів та незліченними рідкісними ситуаціями, які складно змоделювати. Тим не менш, уніфікація навігації, маніпуляції та прогнозування світу в одному стеку — це саме те, чого не вистачало індустрії для переходу від лабораторних демонстрацій до комерційних роботів. Якщо Alibaba зможе масштабувати цю технологію та знизити поріг входу для розробників, ми станемо свідками якісного стрибка в розвитку фізичного ШІ.