Nowy zestaw obrazów, które oszukują sztuczną inteligencję, mogą pomóc w zwiększeniu odporności na hakerów

fotografia przedstawiająca grzyba, ważkę i wiewiórkę, wszystkie błędnie oznaczone jako precel, pokrywa włazu i lew morski

fotografia przedstawiająca grzyba, ważkę i wiewiórkę, wszystkie błędnie oznaczone jako precel, pokrywa włazu i lew morski Unsplash: Florian Van Duyn / Krzysztof Niewolny / Pranay Pareek





Sztuczna inteligencja świetnie sprawdza się w identyfikowaniu obiektów na obrazach, ale nadal łatwo jest ją zepsuć. Dodaj kilka wybranych pociągnięć lub warstwy w jakimś statycznym szumie niewidocznym dla ludzkiego oka, a możesz odrzucić system rozpoznawania obrazu, czasami ze śmiertelnym efektem. Na przykład dodanie naklejek do znaku stopu może sprawić, że samochód autonomiczny będzie myślał, że znak wskazuje ograniczenie prędkości do 45 mil na godzinę , podczas gdy umieszczenie ich na drodze może sprawić, że Tesla zboczy z nadjeżdżającego pasa ruchu . (Z drugiej strony te same techniki mogą również uchronić Cię przed stanem nadzoru. Trochę wygrywasz, trochę tracisz.)

Wszystkie one są znane jako przykłady kontradyktoryjności — a naukowcy starają się teraz opracować sposoby ochrony przed nimi systemów sztucznej inteligencji. Ale w papier W zeszłym roku grupa badaczy z Google Brain i Princeton, w tym jeden z pierwszych badaczy tego tematu, Ian Goodfellow, argumentowała, że ​​pojawiające się stypendia są zbyt teoretyczne i chybią sedno sprawy.

Podczas gdy większość badań skupiała się na ochronie systemów przed specjalnie zaprojektowanymi perturbacjami, haker, jak powiedzieli, prawdopodobnie wybrałby bardziej tępe narzędzie: zupełnie inne zdjęcie, a nie wzór szumów do nałożenia na już istniejące. To również może spowodować nieprawidłowe działanie systemu.



Krytyka skłoniła Dana Hendrycksa, doktoranta z Uniwersytetu Kalifornijskiego w Berkeley, do opracowania nowy zestaw danych obrazu . Nazywa obrazy, które zawierają naturalne, wrogie przykłady — bez żadnych specjalnych poprawek i tak oszukują system.

Obejmują one takie rzeczy jak wiewiórka, którą popularne systemy błędnie określają jako lew morski lub ważkę, którą błędnie identyfikują jako pokrywę włazu. – Te przykłady wydają się znacznie trudniejsze do obrony – mówi. Syntetyczne przykłady przeciwników muszą znać wszystkie mechanizmy obronne systemu AI, aby były najbardziej skuteczne. W przeciwieństwie do tego, naturalne przykłady mogą działać całkiem nieźle, nawet gdy te mechanizmy obronne się zmienią, mówi.

Hendrycks opublikował wczesną wersję zbioru danych, zawierającą około 6000 obrazów, w zeszłym tygodniu na Międzynarodowej Konferencji na temat Uczenia Maszynowego. Planuje wydać ostateczną wersję z blisko 8000 w ciągu kilku tygodni. Zamierza on, aby społeczność naukowa wykorzystała zbiór danych jako punkt odniesienia.



Innymi słowy, zamiast trenować systemy rozpoznawania obrazów bezpośrednio na obrazach, powinni zarezerwować je tylko do testowania. Jeśli ludzie mieliby po prostu trenować na tym zestawie danych, to tylko zapamiętywanie tych przykładów, mówi. Byłoby to rozwiązanie zestawu danych, ale nie zadanie odporności na nowe przykłady.

Złamanie logiki stojącej za czasami zaskakującymi błędami, które powodują przykłady, może prowadzić do bardziej odpornych systemów. Jak to myli ważkę z guacamole? Żarty Hendrycksa. Nie jest jasne, dlaczego w ogóle popełniany jest błąd.

ukryć