Publikacja artykułów prasowych

RoboReward: nowy zbiór danych przełamie bariery w rozwoju robotów autonomicznych

robot, brain, thinking, learning, artificial, intelligence, ai, ml, machine, neural, network, computer, cpu, ai generated

Rozwój algorytmów sztucznej inteligencji otwiera przed inżynierami robotyki nowe możliwości, umożliwiając tworzenie robotów zdolnych do wykonywania coraz bardziej skomplikowanych i rutynowych zadań. Niestety, trenowanie i weryfikacja tych algorytmów to proces wymagający ogromnego nakładu pracy, gdyż wciąż niezbędne jest ręczne oznaczanie danych treningowych oraz ocena działania modeli zarówno w symulacjach, jak i w rzeczywistych warunkach. Naukowcy ze Stanford University i UC Berkeley przedstawili RoboReward – nowatorski zbiór danych przeznaczony do treningu i oceny algorytmów robotycznych, a w szczególności modeli wizyjno‑językowych opartych na systemie nagród (VLMs). Ich praca, opublikowana w formie preprintu na serwerze arXiv, zawiera również RoboReward 4B i 8B – dwa nowe VLMs, które zostały wytrenowane przy użyciu tego zbioru i wykazują wyniki przewyższające dotychczasowe rozwiązania.

W tradycyjnym procesie trenowania robotów duża część pracy to ręczna ocena, czy dany ruch robota zakończył się sukcesem, czy niepowodzeniem. Nowe podejście ma na celu automatyzację tej części procesu poprzez wykorzystanie modeli wizyjno‑językowych, które oceniają wydajność robota i generują sygnał nagrody. Dzięki temu możliwe jest trenowanie systemów sterowania robotów przy minimalnej interwencji człowieka.

RoboReward, stworzony przez zespół naukowców pod przewodnictwem Tony’ego Lee, to obszerny zbiór wideo nagrań przedstawiających roboty wykonujące różnorodne zadania w realnych warunkach. Każde wideo jest dołączone do jasnego, opisowego tekstu oraz skali ocen wskazującej postępy. Celem zbioru jest umożliwienie trenowania VLMs w celu oceny skuteczności wykonywania konkretnych zadań przez roboty.

"Stworzyliśmy ten zbiór danych, poszerzając istniejące zbiory demonstracji robotycznych o realistyczne przypadki niepowodzeń i bliskich niepowodzeń," wyjaśnia Lee. "Trenujemy na nich VLMs, tak aby mogły analizować nagranie robota wykonującego zadanie (zgodnie z opisem zadania) i generować wysokiej jakości sygnał nagrody podczas treningu." Autorzy zdecydowali się udostępnić zbiór danych, modele i tabele porównawcze w duchu otwartej nauki, co ma na celu przyspieszenie postępu w dziedzinie robotyki.

Wykorzystanie RoboReward pozwoliło na wytrenowanie dwóch nowych, uniwersalnych VLMs, które wykazały się znakomitymi rezultatami, umożliwiając robotom szybkie i niezawodne nabywanie nowych umiejętności bez konieczności ciągłego nadzoru człowieka.

Zespół naukowców wprowadził również RoboRewardBench, czyli zbiór ocen weryfikowanych przez ludzi, który ma na celu dokładną ocenę wydajności modeli. Wyniki pokazują, że nawet najbardziej zaawansowane obecnie modele nadal nie osiągają niezawodności w środowiskach i scenariuszach opartych na nagrodach. Wyzwania związane z rozumieniem fizyki przez te modele pozostają istotnym problemem.

Modele RoboReward 4B i 8B znacząco przewyższają wyniki znacznie większych istniejących modeli (np. Gemini Robotics‑ER 1.5) pod względem dokładności oceny nagród, co potwierdza ich wysoką efektywność. Zdolność tych modeli do dorównywania efektywności ludzkich ocen w realnych eksperymentach robotycznych stanowi przełom w tej dziedzinie.

RoboReward i opracowane na jego podstawie modele są dostępne dla szerokiego grona badaczy i inżynierów. Ich wykorzystanie może doprowadzić do rozwoju nowych modeli, które będą uczyć roboty wykonywania zadań w oparciu o system nagród, a także umożliwić niezawodne ocenianie algorytmów.

"Mamy nadzieję, że nasza praca przyczyni się do rozwoju uniwersalnych modeli nagród dla robotyki, które zautomatyzują część procesu treningu," dodaje Lee. "W przyszłości planujemy rozszerzyć modelowanie nagród na zadania o dłuższym horyzoncie czasowym i zwiększyć niezawodność oraz dokładność modeli nagród wykorzystywanych w realnych eksperymentach. Mamy również nadzieję, że RoboReward stanie się motorem napędowym w ogólnym rozwoju dużych modeli wizyjno‑językowych, poprawiając ich zdolność do rozumienia fizyki oraz analizowania szczegółowych informacji przestrzennych i czasowych." Rozwój w tym kierunku może zrewolucjonizować sposób, w jaki projektujemy i programujemy roboty, czyniąc je bardziej autonomicznymi, wydajnymi i zdolnymi do adaptacji do zmiennych warunków.

Czy ten artykuł był dla ciebie pomocny?
0
0