Czego roboty mogą nauczyć się od dzieci?

Dzieci szybko uczą się przewidywać, co się stanie, jeśli odwrócą kubek wypełniony sokiem do góry nogami. Z drugiej strony roboty nie mają pojęcia.





Naukowcy z Allen Instytut Sztucznej Inteligencji (Ai2 ) w Seattle opracowali program komputerowy, który pokazuje, w jaki sposób maszyny określają, jak najprawdopodobniej zachowają się obiekty uchwycone przez kamerę. Może to sprawić, że roboty i inne maszyny będą mniej podatne na błędy, a samojezdne samochody będą mogły bezpieczniej poruszać się w nieznanych miejscach.

System opracowany przez Roozbeh Mottaghi i współpracowników wyciąga wnioski na temat fizycznych właściwości sceny, wykorzystując połączenie uczenia maszynowego i modelowania 3D. Naukowcy przekonwertowali ponad 10 000 obrazów na sceny renderowane w uproszczonym formacie za pomocą silnika fizyki 3D. Rendery 3D zostały stworzone przez wolontariuszy za pośrednictwem platformy crowdsourcingowej Mechanical Turk firmy Amazon.

Naukowcy wprowadzili obrazy, a także ich trójwymiarowe reprezentacje do komputera z dużą siecią neuronową głębokiego uczenia, która stopniowo nauczyła się kojarzyć konkretną scenę z pewnymi prostymi siłami i ruchami. Kiedy system został następnie pokazany nieznanym obrazom, mógł sugerować różne siły, które mogą być w grze.

Nie działa bezbłędnie, ale najczęściej komputer wyciąga sensowne wnioski. Na przykład w przypadku obrazu zszywacza siedzącego na biurku program może powiedzieć, że zszywacz ślizga się po biurku, a następnie gwałtownie spada na podłogę. Aby zrobić zdjęcie stolika kawowego i sofy, wie, że stół można przesunąć po podłodze, aż dotrze do sofy.

Celem jest poznanie dynamiki silnika fizyki, mówi Mottaghi. Musisz wszystko wywnioskować na podstawie samego obrazu, który widzisz.

Praca może być szczególnie przydatna dla robotów, które muszą szybko zinterpretować scenę, a następnie w niej działać. Nawet robot wyposażony w skaner 3D często musiałby wywnioskować fizykę postrzeganej sceny. I byłoby niepraktyczne, gdyby robot uczył się wszystkiego metodą prób i błędów. Zbieranie danych na ten temat jest bardzo trudne, mówi Mottaghi. Jeśli zabiorę robota do sklepu, nie będzie on mógł pchać przedmiotów i zbierać danych; byłoby to bardzo kosztowne.

Ten program jest częścią większego wysiłku zwanego Projekt Platon , którego celem jest wyposażenie maszyn w inteligencję wizualną wykraczającą poza proste rozpoznawanie i kategoryzację obiektów. Powiązany projekt, również będący częścią Projektu Plato, umożliwia komputerowi rozpoznanie działającej już siły fizycznej: na przykład, w jaki sposób narciarz zjechałby z góry lub jak kopnięta piłka przeleciała w powietrzu.

W ostatnich latach komputery znacznie lepiej analizują obrazy dzięki postępom w uczeniu głębokim, wydajniejszemu sprzętowi i zestawom danych obrazów z dużymi etykietami. Po nakarmieniu wieloma przykładami komputery mogą teraz opisywać lub odpowiadać na pytania dotyczące sceny (zobacz oprogramowanie Google inspirowane mózgiem opisuje to, co widzi w złożonych obrazach, a aplikacja Facebook może odpowiadać na podstawowe pytania dotyczące tego, co jest na zdjęciach). Ale to zdradza bardzo powierzchowne zrozumienie tego, co dzieje się na obrazie. Aby uzyskać głębsze zrozumienie, komputer musi uchwycić, jak działa świat fizyczny.

Jezioro Brenden , pracownik naukowy na New York University, który specjalizuje się w modelowaniu ludzkich zdolności poznawczych, mówi, że prace nad Ai2 to ważny krok w tym kierunku.

„Prawdziwe zrozumienie sceny wymaga znacznie więcej niż tylko rozpoznawania obiektów”, mówi Lake. Kiedy ludzie widzą migawkę sceny, opowiadają historię: czym są przedmioty, dlaczego tam są i co będzie dalej. Zrozumienie fizyki jest kluczową częścią opowiadania tej historii.

Jednak według Lake'a w ludzką percepcję zaangażowanych jest znacznie więcej rozumowania, co może jeszcze na jakiś czas powstrzymać postęp w robotyce i widzeniu maszynowym. Chociaż jest to ekscytujący postęp, nie rywalizuje jeszcze z naszą ludzką zdolnością do zrozumienia fizyki, mówi. Ludzie mogą zrozumieć znacznie szerszy zakres wydarzeń fizycznych i dokładnie przewidzieć wydarzenia fizyczne w zupełnie nowych typach scen.

ukryć