Sztuczna inteligencja ucząca się przez wzmacnianie jest podatna na nowy rodzaj ataku

PRZEGLĄD TECHNOLOGII MIT / ADAM GLEAVE





Robot piłkarski ustawia się w kolejce, by oddać strzał na bramkę. Ale zamiast przygotować się do jej zablokowania, bramkarz pada na ziemię i macha nogami. Zdezorientowany napastnik wykonuje dziwny, mały taniec na boki, tupiąc nogami i machając jedną ręką, a następnie przewraca się. 1-0 dla bramkarza.

Nie jest to taktyka stosowana przez profesjonalistów, ale pokazuje, że sztuczna inteligencja wyszkolona poprzez głębokie uczenie się ze wzmocnieniem — technika stojąca za najnowocześniejszymi sztucznymi inteligencjami, takimi jak AlphaZero i OpenAI Five — jest bardziej podatna na ataki niż wcześniej myśl. A to może mieć poważne konsekwencje.

Adam Gleave



W ciągu ostatnich kilku lat naukowcy odkryli wiele sposobów na złamanie sztucznej inteligencji wytrenowanej przy użyciu oznaczonych danych, znanych jako uczenie nadzorowane. Drobne poprawki wprowadzane przez sztuczną inteligencję — takie jak zmiana kilku pikseli na obrazie — mogą go całkowicie zdezorientować, na przykład identyfikując obraz leniwca jako samochód wyścigowy. Te tak zwane ataki kontrataku nie mają pewnego rozwiązania.

W porównaniu z uczeniem nadzorowanym, uczenie się przez wzmacnianie jest stosunkowo nową techniką i było mniej badane. Okazuje się jednak, że jest również podatny na zmanipulowane dane. Uczenie się ze wzmacnianiem uczy sztuczną inteligencję, jak zachowywać się w różnych sytuacjach, dając jej nagrody za właściwe postępowanie. W końcu sztuczna inteligencja uczy się planu działania, znanego jako polityka. Zasady pozwalają AI grać w gry, prowadzić samochody lub uruchamiać zautomatyzowane systemy transakcyjne.

W 2017 roku Sandy Huang, która obecnie pracuje w DeepMind, i jej koledzy przyjrzeli się sztucznej inteligencji wyszkolonej poprzez uczenie się przez wzmacnianie, aby grać w klasyczną grę wideo Pong. Pokazali, że dodanie jednego nieuczciwego piksela do klatek wejścia wideo niezawodnie spowodowałoby jego utratę . Teraz Adam Gleave z Uniwersytetu Kalifornijskiego w Berkeley przeniósł ataki przeciwnika na inny poziom.



Gleave nie przejmuje się zbytnio większością przykładów, które widzieliśmy do tej pory. „Jestem trochę sceptyczny, jeśli chodzi o zagrożenie”, mówi. Pomysł, że atakujący zepsuje nasz system uczenia maszynowego, dodając niewielką ilość szumu, nie wydaje się realistyczny. Ale zamiast oszukiwać sztuczną inteligencję, aby zobaczyła coś, czego tak naprawdę nie ma, możesz zmienić sposób działania rzeczy wokół niej. Innymi słowy, sztuczna inteligencja wyszkolona za pomocą uczenia się przez wzmacnianie może zostać oszukana przez dziwne zachowanie. Gleave i jego koledzy nazywają to polityką kontradyktoryjną. To wcześniej nierozpoznany model zagrożenia, mówi Gleave.

Tracić kontrolę

Pod pewnymi względami wrogie zasady są bardziej niepokojące niż ataki na nadzorowane modele uczenia się, ponieważ zasady uczenia się wzmacniającego regulują ogólne zachowanie sztucznej inteligencji. Jeśli samochód bez kierowcy błędnie zaklasyfikuje dane z kamery, może na przykład użyć innych czujników. Ale sabotuj system sterowania samochodu – zarządzany przez algorytm uczenia się wzmacniającego – i może to doprowadzić do katastrofy. Jeśli polityki miałyby zostać wdrożone bez rozwiązania tych problemów, mogłoby to być bardzo poważne, mówi Gleave. Samochody bez kierowców mogą zwariować, jeśli staną w obliczu machającego rękoma pieszego.

Gleave i jego koledzy wykorzystali uczenie ze wzmacnianiem, aby trenować patyczkowate boty do rozgrywania kilku gier dla dwóch graczy, w tym kopania piłki do bramki, ścigania się przez linię i zapasów sumo. Boty były świadome pozycji i ruchu swoich kończyn oraz kończyn przeciwników.



Adam Gleave

Następnie wyszkolili drugi zestaw botów, aby znaleźć sposoby na wykorzystanie pierwszego, a ta druga grupa szybko odkryła wrogie zasady. Zespół odkrył, że przeciwnicy nauczyli się rzetelnie bić swoje ofiary po treningu przez mniej niż 3% czasu, w jakim ofiary uczyły się grać w gry.

Przeciwnicy nauczyli się wygrywać nie stając się lepszymi graczami, ale wykonując działania, które łamały politykę przeciwników. W grze w piłkę nożną i bieganiu przeciwnik czasami nawet nie wstaje. To sprawia, że ​​ofiara zapada się w poskręcany stos lub kręci się w kółko. Co więcej, ofiary faktycznie radziły sobie znacznie lepiej, gdy były zamaskowane i w ogóle nie były w stanie zobaczyć swojego przeciwnika.



Badania, które mają zostać zaprezentowane w kwietniu na Międzynarodowej Konferencji na temat Reprezentacji Nauczania w Addis Abebie w Etiopii, pokazują, że polityki, które wydają się solidne, mogą ukrywać poważne wady. W uczeniu się przez głębokie wzmocnienie tak naprawdę nie oceniamy zasad w wystarczająco kompleksowy sposób, mówi Gleave. Nadzorowany model uczenia się, nauczony, powiedzmy, klasyfikować obrazy, jest testowany na innym zestawie danych niż ten, na którym został przeszkolony, aby upewnić się, że nie zapamiętał po prostu określonej grupy obrazów. Jednak w przypadku uczenia się przez wzmacnianie modele są zazwyczaj trenowane i testowane w tym samym środowisku. Oznacza to, że nigdy nie masz pewności, jak dobrze model poradzi sobie w nowych sytuacjach.

Dobrą wiadomością jest to, że przeciwne polityki mogą być łatwiejsze do obrony niż przed innymi atakami kontradyktoryjnymi. Kiedy Gleave dostroił ofiary tak, aby uwzględniły dziwne zachowanie ich przeciwników, przeciwnicy zostali zmuszeni do wypróbowania bardziej znanych sztuczek, takich jak potknięcie przeciwników. To wciąż brudna gra, ale nie wykorzystuje usterki w systemie. W końcu ludzie robią to cały czas.

ukryć