Sztuczna inteligencja DeepMind może teraz grać we wszystkie 57 gier na Atari — ale wciąż nie jest wystarczająco wszechstronna

Kategoria: Sztuczna inteligencja Opublikowany kwi 01 Wkłady do gier Atari Wkłady do gier Atari





Wiadomości: Sztuczna inteligencja zwana Agent57 nauczył się grać we wszystkie 57 gier na Atari w środowisku Arcade Learning, zbiór klasycznych gier, których naukowcy używają do testowania ograniczeń swoich modeli uczenia głębokiego. Opracowany przez DeepMind Agent57 wykorzystuje ten sam algorytm uczenia głębokiego wzmacniania, aby osiągnąć nadludzki poziom rozgrywki nawet w grach, z którymi borykały się poprzednie AI. Możliwość nauczenia się 57 różnych zadań sprawia, że ​​Agent57 jest bardziej wszechstronny niż poprzednie sztuczki z grami.

Co jest w grze? Gry to świetny sposób na testowanie AI. Zapewniają różnorodne wyzwania, które zmuszają sztuczną inteligencję do wymyślenia szeregu strategii, a mimo to mają wyraźną miarę sukcesu – punktację – do trenowania. Ale w szczególności cztery gry na Atari okazały się trudne do pokonania. W Montezumy’s Revenge and Pitfall sztuczna inteligencja musi wypróbować wiele różnych strategii, zanim trafi na zwycięską. A w Solarisie i na nartach może być dużo czasu oczekiwania między akcją a nagrodą, co utrudnia sztucznej inteligencji dowiedzenie się, które ruchy przyniosą najlepszą wypłatę.

Meta-umysł: Aby sprostać tym wyzwaniom, Agent57 łączy wiele ulepszeń, które DeepMind wprowadził do swojej sieci Deep-Q, sztucznej inteligencji, która jako pierwsza pokonała kilka gier na Atari w 2012 roku, w tym formę pamięci, która pozwala podejmować decyzje na podstawie tego, co miała wcześniej. widoczne w grze i systemach nagród, które zachęcają sztuczną inteligencję do pełniejszego zbadania swoich opcji przed przyjęciem strategii. Te różne techniki są następnie zarządzane przez meta-kontroler, który równoważy kompromisy między kontynuacją określonej strategii a większą eksploracją.



Dlaczego jest to ważne: Mimo całego ich sukcesu, najlepsze modele uczenia głębokiego, jakie mamy dzisiaj, nie są zbyt wszechstronne . Większość z nich jest dobra w jednej i tylko jednej rzeczy. Wyszkolenie sztucznej inteligencji w celu osiągnięcia doskonałości w więcej niż jednym zadaniu jest jednym z największych otwartych wyzwań w uczeniu głębokim. Zdolność do nauczenia się 57 różnych zadań sprawia, że ​​Agent57 jest bardziej wszechstronny niż poprzednie sztuczne sztuczki do grania w gry, ale – co często jest pomijane – nadal nie może nauczyć się grać w więcej niż jedną grę na raz. Agent57 może nauczyć się grać w 57 gier, ale nie może nauczyć się grać w 57 gier naraz. Musi przekwalifikować się do każdej nowej gry, nawet jeśli może to zrobić za pomocą tego samego algorytmu. W ten sposób Agent57 jest podobny do AlphaZero, algorytmu głębokiego wzmacniania DeepMind, który może nauczyć się grać w szachy, Go i shogi – ale znowu, nie wszystkie na raz. Prawdziwa wszechstronność, która tak łatwo przychodzi ludzkiemu niemowlęciu, jest nadal daleko poza zasięgiem sztucznej inteligencji.