Sztuczna inteligencja nauczyła się korzystać z narzędzi po prawie 500 milionach gier w chowanego

OpenAi





We wczesnych dniach życia na Ziemi organizmy biologiczne były niezwykle proste. Były to mikroskopijne jednokomórkowe stworzenia, które miały niewielką lub żadną zdolność koordynacji. Jednak miliardy lat ewolucji poprzez rywalizację i dobór naturalny doprowadziły do ​​powstania złożonych form życia, jakie mamy dzisiaj, a także złożonej inteligencji ludzkiej.

Naukowcy z OpenAI, komercyjnego laboratorium badawczego AI z siedzibą w San Francisco, testują teraz hipotezę: gdyby można było naśladować tego rodzaju konkurencję w wirtualnym świecie, czy dałoby to również początek znacznie bardziej wyrafinowanej sztucznej inteligencji?

Eksperyment opiera się na dwóch istniejących pomysłach w tej dziedzinie: uczenie wieloagentowe, pomysł polegający na współzawodnictwie lub koordynacji wielu algorytmów w celu wywołania pojawiających się zachowań, oraz uczenie ze wzmocnieniem, specyficzna technika uczenia maszynowego, która uczy się osiągać cel poprzez próbę i błąd. (DeepMind spopularyzował to drugie dzięki przełomowemu programowi AlphaGo, który pokonał najlepszego gracza w starożytnej chińskiej grze planszowej Go.)



W nowy papier wydany dzisiaj OpenAI ujawnił teraz swoje wstępne wyniki. Grając w prostą grę w chowanego setki milionów razy, dwa przeciwstawne zespoły agentów AI opracowały złożone strategie ukrywania i wyszukiwania, które obejmowały korzystanie z narzędzi i współpracę. Badanie oferuje również wgląd w dominującą strategię badawczą OpenAI: radykalne skalowanie istniejących technik sztucznej inteligencji, aby zobaczyć, jakie właściwości się pojawią.

Chowający się uczą budować forty.

Po około 25 milionach rund w chowanego, ukrywający się nauczyli budować forty, aby wygrać grę. OpenAI

Sześć faz strategii

Aby stworzyć grę, naukowcy zaprojektowali wirtualne środowisko składające się z zamkniętej przestrzeni z różnymi obiektami, takimi jak bloki, rampy oraz ruchome i nieruchome barykady. Sami agenci byli kontrolowani przez algorytmy uczenia się przez wzmacnianie. W każdej grze agenci zostali podzieleni na dwie drużyny: ukrywający się byli nagradzani lub karani odpowiednio za unikanie lub nieunikanie poszukujących; poszukiwacze byli również nagradzani lub karani za odnalezienie lub nieodnalezienie ukrywających się. Podobnie jak w klasycznej grze w chowanego, ukrywającym się również dano kilka sekund do przodu. Badacze nie wydali agentom żadnych innych instrukcji.



W ciągu setek milionów rund gry agenci opracowali kilka strategii i kontr-strategii. Podczas pierwszej fazy ukrywający się i poszukujący opracowali bardzo prymitywne strategie unikania i ścigania, poruszając się po przestrzeni bez manipulowania żadnym z obiektów.

W fazie trzeciej poszukiwacze nauczyli się wspinać na fort

W fazie trzeciej poszukiwacze nauczyli się wspinać po murach fortu za pomocą rampy. OpenAI

Ale około 25 milionów gier gra stała się bardziej wyrafinowana. Chowający się nauczyli się poruszać i blokować skrzynki i barykady w otoczeniu, aby budować wokół siebie forty, aby poszukiwacze nigdy ich nie zobaczyli. Nie tylko to, ale także opracowali strategie koordynacji, takie jak przekazywanie sobie nawzajem obiektów, aby przyspieszyć proces budowy fortu.



Jednak po kolejnych 75 milionach rund poszukiwacze odkryli kontr-strategię, przesuwając proces do fazy trzeciej. Nauczyli się przesuwać rampę obok fortu ukrywających się i używać jej do wspinania się po murach. W fazie czwartej, 10 milionów pocisków później, ukrywający się nauczyli blokować rampy na miejscu przed zbudowaniem fortu. (Żadna z drużyn nie mogła odblokować obiektu, który został zablokowany przez drużynę przeciwną).

Początkowo badacze z OpenAI wierzyli, że jest to ostatnia faza rozgrywki, ale w końcu, przy 380 milionach gier, pojawiły się dwie kolejne strategie. Poszukiwacze po raz kolejny opracowali strategię włamania się do fortu ukrywających się za pomocą zamkniętej rampy, aby wspiąć się na odblokowane pudełko, a następnie surfować po jego szczycie do fortu i po jego ścianach. W końcowej fazie ukrywający po raz kolejny nauczyli się blokować wszystkie rampy i skrzynki przed zbudowaniem fortu.

Wreszcie, po 380 milionach rund szkolenia, poszukiwacze nauczyli się:

W końcu, po 380 milionach rund treningu, poszukiwacze nauczyli się „surfować po bokach”, aby wspinać się po murach fortu. OpenAI



Wyłaniająca się inteligencja

Naukowcy są przekonani, że te wstępne wyniki wskazują na obiecującą nową metodę ewolucji bardziej złożonej sztucznej inteligencji. Nie mówiliśmy ukrywającym się ani poszukującym, aby podbiegali do skrzynki lub wchodzili z nią w interakcję – mówi Bowen Baker, jeden z autorów artykułu. Ale dzięki rywalizacji wieloagentowej stworzyli sobie nawzajem nowe zadania, do których druga drużyna musiała się dostosować.

Niniejsze badanie odzwierciedla charakterystyczne podejście OpenAI do badań nad sztuczną inteligencją. Chociaż laboratorium zainwestowało również w opracowywanie nowatorskich technik w porównaniu z innymi laboratoriami, przede wszystkim wyrobiło sobie markę dzięki radykalnemu skalowaniu istniejących. GPT-2, niesławny model językowy laboratorium, na przykład mocno zapożyczony algorytmiczny projekt z wcześniejszych modeli językowych, w tym BERT firmy Google ; Główną innowacją OpenAI było osiągnięcie inżynieryjne i ekspansywne zasoby obliczeniowe.

W pewnym sensie badanie to potwierdza wartość testowania ograniczeń istniejących technologii na dużą skalę. Zespół planuje również kontynuować tę strategię. Naukowcy twierdzą, że pierwsza runda eksperymentów nie zbliżyła się do osiągnięcia granic zasobów obliczeniowych, które mogli rzucić na ten problem.

Chcemy, aby ludzie wyobrażali sobie, co by się stało, gdybyś wywołał tego rodzaju konkurencję w znacznie bardziej złożonym środowisku, mówi Baker. Zachowania, których się uczą, mogą w rzeczywistości być w stanie ostatecznie rozwiązać niektóre problemy, których być może nie wiemy już, jak je rozwiązać.

Korekta: W oryginalnym nagłówku błędnie podano liczbę meczów, w które grali agenci.

ukryć