Ciągle zmieniający się plac zabaw uczy sztuczną inteligencję wielozadaniowości

DeepMind





DeepMind opracował ogromny wirtualny plac zabaw w kolorze cukierków który uczy ogólnych umiejętności AI poprzez niekończącą się zmianę zadań, które im wyznacza. Zamiast rozwijać tylko umiejętności potrzebne do rozwiązania konkretnego zadania, SI uczą się eksperymentować i eksplorować, zbierając umiejętności, których następnie używają, aby odnieść sukces w zadaniach, których nigdy wcześniej nie widziały. To mały krok w kierunku inteligencji ogólnej.

Co to jest? XLand to świat 3D przypominający gry wideo, który gracze AI wyczuwają w kolorze. Plac zabaw jest zarządzany przez centralną sztuczną inteligencję, która wyznacza graczom miliardy różnych zadań, zmieniając środowisko, zasady gry i liczbę graczy. Zarówno zawodnicy, jak i kierownik placu zabaw wykorzystują uczenie ze wzmacnianiem, aby doskonalić się metodą prób i błędów.

Sztuczna inteligencja ogólna: czy jesteśmy blisko i czy warto próbować?

Maszyna, która może myśleć jak człowiek, była wiodącą wizją badań nad sztuczną inteligencją od najwcześniejszych dni — i pozostaje jej najbardziej dzielącą ideą.



Podczas treningu gracze w pierwszej kolejności mierzą się z prostymi grami jednoosobowymi, takimi jak znalezienie fioletowej kostki czy umieszczenie żółtej piłki na czerwonej podłodze. Przechodzą do bardziej złożonych gier wieloosobowych, takich jak zabawa w chowanego lub przechwycenie flagi, w których drużyny rywalizują o to, by jako pierwsze znaleźć i złapać flagę przeciwnika. Zarządca placu zabaw nie ma określonego celu, ale dąży do poprawy ogólnych możliwości graczy z biegiem czasu.

Dlaczego to jest fajne? Sztuczna inteligencja, taka jak AlphaZero firmy DeepMind, pokonała najlepszych graczy na świecie w szachach i go. Ale mogą uczyć się tylko jednej gry na raz. Jak ujął to współzałożyciel DeepMind, Shane Legg, kiedy rozmawiałem z nim w zeszłym roku, to jest jak konieczność wymiany mózgu szachowego na mózg go za każdym razem, gdy chcesz zmienić gry.

Naukowcy próbują teraz tworzyć sztuczną inteligencję, która może uczyć się wielu zadań jednocześnie, co oznacza uczenie ich ogólnych umiejętności, które ułatwiają adaptację.



film przedstawiający agentów AI eksperymentujących w środowisku wirtualnym

Boty, które nauczyły się eksperymentować, zaimprowizowały rampę

GŁĘBOKI UMYSŁ

Jednym z ekscytujących trendów w tym kierunku jest nauczanie otwarte, w ramach którego AI są szkolone w wielu różnych zadaniach bez określonego celu. Pod wieloma względami wydaje się, że ludzie i inne zwierzęta tak się uczą poprzez bezcelową zabawę. Ale to wymaga ogromnej ilości danych. XLand generuje te dane automatycznie, w postaci niekończącego się strumienia wyzwań. To jest podobne do POETA , dojo szkoleniowe AI, w którym dwunożne boty uczą się pokonywania przeszkód w krajobrazie 2D. Świat XLanda jest jednak znacznie bardziej złożony i szczegółowy.

XLand jest również przykładem AI uczy się tworzyć siebie , czyli co Jeff Clune, który pomagał rozwijać POET i kieruje zespołem pracuje nad tym tematem w OpenAI wywołuje algorytmy generujące sztuczną inteligencję (AI-GA). Ta praca przesuwa granice AI-GA, mówi Clune. To bardzo ekscytujące.



AI uczy się tworzyć siebie

Ludzie walczyli o stworzenie naprawdę inteligentnych maszyn. Może musimy pozwolić im samemu się tym zająć.

Czego się nauczyli? Niektóre ze sztucznej inteligencji XLand DeepMind grały w 700 000 różnych gier w 4000 różnych światów, wykonując łącznie 3,4 miliona unikalnych zadań. Zamiast uczyć się najlepszych rzeczy do zrobienia w każdej sytuacji, co robi większość istniejących sztucznej inteligencji uczącej się przez wzmacnianie, gracze nauczyli się eksperymentować — przesuwać obiekty, aby zobaczyć, co się stało, lub używać jednego obiektu jako narzędzia do dotarcia do innego obiektu lub ukrycia się z tyłu — dopóki nie pokonają konkretnego zadania.

Na filmach można zobaczyć SI rzucające przedmiotami, dopóki nie natkną się na coś użytecznego: na przykład duża płytka staje się rampą prowadzącą do platformy. Naukowcy twierdzą, że trudno jest z całą pewnością stwierdzić, czy wszystkie takie wyniki są zamierzonymi czy szczęśliwymi przypadkami. Ale zdarzają się konsekwentnie.



Sztuczna inteligencja, która nauczyła się eksperymentować, miała przewagę w większości zadań, nawet tych, których wcześniej nie widziały. Naukowcy odkryli, że po zaledwie 30 minutach treningu nad nowym, złożonym zadaniem, SI XLand szybko się do niego przystosowały. Ale AI, które nie spędziły czasu w XLi, nie mogły w ogóle nauczyć się tych zadań.

ukryć