Uber złamał dwie klasyczne gry wideo z lat 80., nadając algorytmowi sztucznej inteligencji nowy rodzaj pamięci

Squakenet





Nowy rodzaj algorytmu uczenia maszynowego właśnie opanował kilka starych gier wideo, które okazały się dużym problemem dla sztucznej inteligencji.

Ci, którzy podążają dalej, będą wiedzieć, że algorytmy sztucznej inteligencji pokonały najlepszych graczy na świecie w starożytnej, eleganckiej grze strategicznej Go, jednej z najtrudniejszych gier, jakie można sobie wyobrazić. Jednak dwa pikselowe klasyki z ery 8-bitowych gier komputerowych — Montezuma’s Revenge i Pitfall! — przeszkodziły badaczom sztucznej inteligencji.

Istnieje powód tej pozornej sprzeczności. Choć zwodniczo proste, zarówno Zemsta Montezumy, jak i Pułapka! byli odporni na opanowanie poprzez uczenie się przez wzmacnianie, technikę, która w przeciwnym razie jest biegła w nauce podbijania gier wideo. DeepMind, spółka zależna Alphabet zajmująca się sztuczną inteligencją, wykorzystała ją do opracowania algorytmów, które potrafią nauczyć się grać w kilka klasycznych gier wideo na poziomie eksperckim. Algorytmy uczenia się przez wzmacnianie dobrze pasują do większości gier, ponieważ dostosowują swoje zachowanie w odpowiedzi na pozytywną informację zwrotną — wynik rośnie. Sukces tego podejścia dał nadzieję, że algorytmy sztucznej inteligencji mogą nauczyć się robić wszelkiego rodzaju przydatne rzeczy, które są obecnie niemożliwe dla maszyn.



Problem zarówno z Zemstą Montezumy, jak i Pułapką! jest to, że istnieje kilka wiarygodnych sygnałów nagrody. Oba tytuły zawierają typowe scenariusze: protagoniści eksplorują blokowe światy wypełnione śmiercionośnymi stworami i pułapkami. Ale w każdym przypadku wiele zachowań, które są niezbędne do awansu w grze, nie pomaga w zwiększeniu wyniku znacznie później. Zwykłe algorytmy uczenia się przez wzmacnianie zwykle nie potrafią wydostać się z pierwszego pokoju w Zemście Montezumy i w Pułapce! zdobywają dokładnie zero.

Nowe algorytmy pochodzą od zespołu badawczego Ubera zajmującego się sztuczną inteligencją w San Francisco, kierowanego przez Jeff Clune , który jest również profesorem nadzwyczajnym na Uniwersytecie Wyoming. Zespół zademonstrował fundamentalnie odmienne podejście do uczenia maszynowego w środowisku, które oferuje niewiele wskazówek, aby pokazać algorytmowi, jak sobie radzi.

Podejście to prowadzi do kilku interesujących praktycznych zastosowań, Clune i jego zespół napisali w opublikowanym dzisiaj poście na blogu – na przykład w nauce robotów. Dzieje się tak, ponieważ przyszłe roboty będą musiały dowiedzieć się, co robić w środowiskach, które są złożone i oferują tylko kilka nielicznych nagród.



Uber uruchomił laboratorium sztucznej inteligencji w grudniu 2016 r., aby dokonać fundamentalnych przełomów, które mogą okazać się przydatne dla jego działalności. Lepsze algorytmy uczenia się przez wzmacnianie mogą ostatecznie okazać się przydatne w przypadku autonomicznej jazdy i optymalizacji tras pojazdów.

Badacze sztucznej inteligencji zazwyczaj próbowali obejść problemy związane z Zemstą i pułapką Montezumy! instruując algorytmy uczenia się przez wzmacnianie, aby od czasu do czasu eksplorowały losowo, jednocześnie dodając nagrody za eksplorację – tak zwaną motywację wewnętrzną.

Jednak naukowcy z Uber uważają, że nie oddaje to ważnego aspektu ludzkiej ciekawości. Stawiamy hipotezę, że główną słabością obecnych wewnętrznych algorytmów motywacyjnych jest dystans, piszą. Przy czym algorytmy zapominają o obiecujących obszarach, które odwiedziły, co oznacza, że ​​nie wracają do nich, aby sprawdzić, czy prowadzą do nowych stanów.



Nowa rodzina algorytmów uczenia się przez wzmacnianie, nazwana Go-Explore, pamięta, gdzie byli wcześniej, i powróci do określonego obszaru lub zadania później, aby sprawdzić, czy może to pomóc w uzyskaniu lepszych wyników ogólnych. Naukowcy odkryli również, że dodanie odrobiny wiedzy o domenie poprzez podkreślenie przez graczy interesujących lub ważnych obszarów, znacznie przyspieszyło uczenie się algorytmów i postęp. Jest to ważne, ponieważ może być wiele rzeczywistych sytuacji, w których algorytm i osoba mogą współpracować, aby rozwiązać trudne zadanie.

Ich kod zdobywa średnio 400 000 punktów w Zemście Montezumy — o rząd wielkości wyższy niż średnia dla ludzkich ekspertów. W pułapce! zbiera średnio 21 000, znacznie lepiej niż większość ludzkich graczy.

Te wyniki są bardzo imponujące, mówi Emma Brunskill, adiunkt na Uniwersytecie Stanforda, która specjalizuje się w uczeniu się przez wzmacnianie. Mówi, że to zaskakujące i ekscytujące, że techniki przyniosły tak duże korzyści.



Inni badacze AI odcinają się od tych notorycznie trudnych gier wideo. W październiku zespół OpenAI, organizacji non-profit z San Francisco, zademonstrował algorytm zdolny do: robienie znaczących postępów w Zemście Montezumy.

Ostatnio grupa Brunskill w Stanford poczynił skromniejsze postępy w pułapce! stosując podejście podobne do zespołu Ubera.

Teraz, gdy algorytmy AI mogą rozwiązywać te gry wideo, wyzwaniem jest wyjście z arkad i rozwiązywanie rzeczywistych problemów.

Brunskill zgadza się, że tego rodzaju praca może mieć duży wpływ na robotykę. Ale mówi, że inne sytuacje w świecie rzeczywistym, zwłaszcza te, które wiążą się z modelowaniem ludzkich zachowań, są znacznie trudniejsze. „Bardzo ciekawie będzie zobaczyć, jak dobrze to podejście działa w przypadku bardziej skomplikowanych ustawień”, mówi.

Jednak nie wszyscy są zachwyceni badaniami Ubera.

Alex Irpan, inżynier oprogramowania pracujący w Google nad uczeniem maszynowym i robotyką, napisał wpis na blogu w którym pyta, dlaczego zespół Uber AI nie dostarczył dokumentu technicznego wraz z komunikatem prasowym, aby podać więcej szczegółów na temat swojej pracy.

Irpan zwraca również uwagę, że zmieniając stan gry, aby ułatwić im podejście, badacze Uber AI mogli w znaczący sposób zmienić pole gry. Biorąc pod uwagę ten fakt, zastanawia się, jak praktyczne może być to podejście.

W poście na blogu stwierdzono, że takie podejście można wykorzystać do symulowanych zadań robotyki, a następnie połączyć z transferem z symulacji do rzeczywistości w celu uzyskania rzeczywistych zasad. Pod tym względem jestem dość pesymistyczny, pisze.

Zaktualizowano 11.28 z komentarzem Alexa Irpana.

ukryć