Roboty otrzymują przycisk „Cofnij”, który może pomóc im szybciej się uczyć

Kategoria: Bez kategorii Opublikowany 27 listopada

Uczenie się przez głębokie wzmocnienie działa podobnie do dziecka, które uczy się umiejętności: praktyka czyni mistrza. Jednak w przypadku autonomicznego agenta, takiego jak robot, jego środowisko musi zostać zresetowane do pierwotnego stanu między próbami — na przykład zadanie, które może zająć wiele godzin, gdy ludzie biegają wokół wymiany przedmiotów.





Nowy papier arXiv badacze z Google Brain, University of Cambridge, Max Planck Institute for Intelligent Systems i UC Berkeley opisali metodę, która może nauczyć agenta resetowania środowiska do następnej próby, a także powstrzymać go od wykonywania działań, które byłyby nieodwracalny.

Ich postęp polegał na zapewnieniu agentom polityki postępu i resetowania, które współpracują ze sobą. Podczas gdy zasada postępu polega na nauce umiejętności, naciśnięcie resetu zmusza agenta do nauczenia się, jak nie pozostawiać śladu, skutecznie cofając akcję. Działania, które zdaniem robota byłyby nieodwracalne, są przerywane tak szybko, jak to możliwe.

Naukowcy piszą, że starali się dać swoim agentom intuicję, aby sklasyfikować wszystko, co jest odwracalne, jako bezpieczne, ponieważ można wrócić do pierwotnego stanu. Dzięki próbom i błędom agent odkrywa, że ​​coraz więcej działań jest odwracalnych, co pozwala mu bezpiecznie eksplorować.



Uczenie się przez głębokie wzmocnienie często odbywa się w symulacji, a zwłaszcza w rzeczywistych środowiskach mniej wybaczających błędy, jak na przykład autonomiczny samochód jadący po klifie. Nawet w bezpieczniejszych sytuacjach oczekiwanie na resetowanie ręczne może stać się wąskim gardłem w gromadzeniu danych. Z tego powodu praca zespołu została ograniczona do środowisk wirtualnych. W końcu jednak trzeba przeprowadzić testy w warunkach rzeczywistych, a te badania mogą sprawić, że będzie to szybsze i bezpieczniejsze.

Jak wskazuje Jack Clark w swoim Importuj AI biuletyn Informacyjny , ten artykuł jest echem pracy opisanej w inny papier (PDF) z Facebook AI Research w zeszłym miesiącu, w którym jeden agent ma dwa oddzielne tryby, o pseudonimach Alice i Bob, z których jeden próbuje odwrócić zadanie, które próbował wykonać drugi. Ten rodzaj pracy, aby sztuczna inteligencja mogła planować z wyprzedzeniem, może uratować ją (i nas) przed katastrofalnymi błędami w przyszłości.