Technika, która nauczyła sztuczną inteligencję grać w Go, nadal nie może nauczyć jazdy samochodem

Kategoria: Sztuczna inteligencja Opublikowany 15 stycznia

Wzmacnianie uczenia (RL), kategoria uczenia maszynowego, która opiera się na karach i nagrodach, może być potężną techniką uczenia maszyn dostosowywania się do nowych środowisk.





AlphaGo firmy Deepmind użyło go do pokonania najlepszego gracza na świecie w Go, mimo że nigdy wcześniej z nim nie grał. Obiecuje również tworzenie robotów, które mogą działać w zmieniających się warunkach.

Ale technika ma swoje ograniczenia. Wymaga maszyny, która może się pomylić, ponieważ z czasem powoli udoskonala swoje działania. To dobrze w laboratorium lub podczas grania w grę planszową. Nie jest idealny do zastosowań, takich jak samochody autonomiczne, w których pomyłka może być śmiertelna.

W odpowiedzi naukowcy opracowali różne sposoby obejścia potrzeby szkolenia w świecie rzeczywistym. Samochód może wykorzystywać dane o ruchu drogowym, aby nauczyć się jeździć w bezpiecznej cyfrowej replice świata fizycznego, na przykład, aby przejść przez swój błądzący etap, nie narażając nikogo na niebezpieczeństwo.



Ale to nie jest idealne rozwiązanie. Maszyna może nadal popełniać kosztowne błędy, gdy napotka sytuacje wykraczające poza zakres jej danych szkoleniowych. W jednym przypadku naukowcy z New York University odkryli, że samochód nauczył się skręcać pod kątem 90 stopni w ruch z przeciwka (na szczęście w ramach symulacji), ponieważ jego zestaw danych treningowych nie obejmował tego rodzaju scenariuszy. Nie trzeba dodawać, że nie jest to opłacalne w przypadku bezpiecznego szkolenia autonomicznego samochodu lub, powiedzmy, chirurga-robota.

Ten sam zespół z NYU i dyrektor ds. badań nad sztuczną inteligencją na Facebooku, Yann Lecun, są teraz zaproponowanie nowej metody które mogłyby rozwiązać ten problem. Oprócz karania i nagradzania samochodu za zachowanie podczas jazdy, karano go również za błądzenie w scenariuszach, w których nie ma wystarczającej ilości danych treningowych.

W gruncie rzeczy zmusza to samochód do bardziej ostrożnego poruszania się, wyjaśnia Mikael Henaff, jeden z autorów badania, zamiast wykonywać dzikie skręty i inne manewry, które umieszczają go na nieznanym terytorium.



Kiedy przetestowali swoje nowe podejście, odkryli, że jest ono lepsze niż poprzednie metody w zakresie bezpiecznego poruszania się samochodem w gęstym ruchu. Jednak nadal nie był tak dobry, jak wydajność człowieka, więc wciąż trzeba wykonać więcej pracy.

Ta historia pierwotnie pojawiła się w naszym biuletynie AI The Algorithm. Aby najpierw przeczytać takie historie, pobierz Algorytm dostarczony bezpośrednio do Twojej skrzynki odbiorczej. Zapisz się tutaj za darmo .