211service.com
Goofy Sumo-Wrestling Boty OpenAI są mądrzejsze niż się wydaje
Kategoria: Bez kategorii Opublikowany 12 październikaTo może być wirtualny krwawy sport w jakiejś absurdalnej przyszłości techno.
OpenAI, instytut badawczy wspierany przez Elona Muska i kilka innych wielkich postaci z Doliny Krzemowej, ujawnił swoje najnowsze badania nad rozwojem potężniejszych form uczenia maszynowego. I demonstruje technologię za pomocą wirtualnych zapasów sumo.
Wirtualni zapaśnicy mogą wyglądać nieco śmiesznie, ale stosują bardzo sprytne podejście do nauki w szybko zmieniającym się środowisku podczas radzenia sobie z przeciwnikiem.
Agenci wykorzystują formę uczenia się przez wzmacnianie, technikę inspirowaną sposobem, w jaki zwierzęta uczą się poprzez informacje zwrotne. Okazała się przydatna w szkoleniu komputerów do grania w gry i kontrolowania robotów (patrz 10 Przełomowe technologie 2017: Uczenie się przez wzmacnianie ).
Jednym dużym wyzwaniem związanym z używaniem uczenia się przez wzmacnianie jest to, że nie działa ono tak dobrze w bardziej realistycznych sytuacjach, w których rzeczy ciągle się zmieniają. OpenAI opracował już własny algorytm wzmacniający o nazwie optymalizacja polityki proksymalnej (PPO) , który jest szczególnie dobrze przystosowany do zmieniających się środowisk.
Najnowsza praca, wykonana we współpracy z naukowcami z Carnegie Mellon University i UC Berkeley, demonstruje sposób, w jaki agenci AI mogą zastosować to, co naukowcy nazywają platformą meta-uczenia się. Oznacza to, że agenci mogą wykorzystać to, czego się już nauczyli, i zastosować to w nowej sytuacji.
W środowisku RoboSumo (zobacz wideo powyżej) agenci zaczęli zachowywać się losowo. Dzięki tysiącom iteracji prób i błędów stopniowo rozwinęli umiejętność poruszania się i, w końcu, walki. W kolejnych iteracjach zapaśnicy rozwinęli umiejętność unikania się nawzajem, a nawet kwestionowania własnych działań. Ta nauka odbywała się w locie, a agenci dostosowywali się, nawet jeśli walczyli ze sobą.
Elastyczne uczenie się jest bardzo ważną częścią ludzkiej inteligencji i będzie miało kluczowe znaczenie, jeśli maszyny będą zdolne do wykonywania czegokolwiek innego niż bardzo wąskie zadania w prawdziwym świecie. Ten rodzaj uczenia się jest bardzo trudny do zaimplementowania w maszynach, a najnowsza praca to mały, ale znaczący krok w tym kierunku.
Naukowcy odkryli, że dzięki meta-uczeniu się ich sumo-boty mogą szybciej uczyć się skutecznych strategii. Więc nawet jeśli wyglądają na trochę nieszczęśliwych, nie lekceważ ich.