Лондонська компанія Humanoid представила KinetIQ Ascend — новаторський підхід до навчання гуманоїдних роботів, заснований на методі проб і помилок безпосередньо в реальних виробничих умовах. Розробник стверджує, що технологія здатна довести точність маніпуляцій до 99,9% на швидкості, порівнянній з людською або навіть вищій за неї.
Як працює KinetIQ Ascend
KinetIQ Ascend розширює можливості фреймворку KinetIQ, що лежить в основі роботів Humanoid. Ключова відмінність — використання навчання з підкріпленням (reinforcement learning, RL). На відміну від пасивного копіювання дій людини, система самостійно повторює завдання, отримує зворотний зв'язок про успіх або помилку і на основі цього покращує свої алгоритми поведінки.
Важливо, що Humanoid запускає RL не лише в симуляції, а в цілодобовому режимі на реальному обладнанні та у виробничих сценаріях. За моїми даними, це перша опублікована демонстрація наскрізного RL на основі зору для vision-language-action (VLA) моделей, навчених на реальній дворукій гуманоїдній платформі в умовах розгортання. Це принципово змінює підхід до відпрацювання навичок.
Чому ставка на RL виправдана
Раніше Humanoid, як і більшість конкурентів, навчала роботів через імітацію людських демонстрацій. Однак у цього методу є фундаментальне обмеження: модель, що копіює демонстрації, не здатна перевершити демонстратора ні за швидкістю, ні за якістю і не вчиться на помилках. На переконання компанії, останні відсотки надійності та перехід на надлюдську швидкість потребують іншого підходу. KinetIQ Ascend закриває цей розрив за рахунок безперервної практики на реальних завданнях, порівнюючи процес з масштабуванням великих мовних моделей — чим довше навчання, тим вища успішність.
Результати тестування
Humanoid провела тести на трьох виробничих завданнях. У першому — робот мав брати сталеві підшипникові кільця з контейнера та розміщувати їх на конвеєрі. Після RL-навчання пропускна здатність зросла на 42%, до 412 кілець на годину проти 291 у базової моделі. У другому завданні — передача предмета з контейнера людині — пропускна здатність збільшилася на 85%, середня тривалість епізоду знизилася на 35%, а успішність піднялася з 80% до 98%. У третьому — дворуке підняття контейнера зі столу в довільній орієнтації — після кількох днів навчання пропускна здатність зросла з 122 до 279 контейнерів на годину, середня тривалість епізоду скоротилася з 22,9 до 12,8 секунди, а успішність піднялася з 77,6% до 98,9%.
Компанія підкреслює, що вимірювання проводилися через паралельне A/B-порівняння з поточною базовою моделлю, а не проти старої бази. Це критично важливо для реальних виробничих середовищ, де результат може змінюватися через освітлення, положення об'єктів або знос обладнання.
Експертна думка
Прорив Humanoid — це не просто черговий крок у робототехніці, а зміна парадигми. Перехід від пасивного копіювання до активного навчання з підкріпленням на реальних завданнях може стати тим самим каталізатором, який виведе гуманоїдних роботів з лабораторій на масові заводи. Якщо компанія зможе масштабувати цей підхід, ми станемо свідками різкого прискорення автоматизації в промисловості.