Sztuczna inteligencja uczy się widzieć świat — ale nie tak, jak robią to ludzie

Wizja komputerowa miała chwilę. Już nigdy algorytm rozpoznawania obrazów nie popełnia głupich błędów podczas patrzenia na świat: w dzisiejszych czasach może dokładnie stwierdzić, że obraz zawiera kota . Ale sposób, w jaki wykonuje sztuczkę imprezową, może nie być tak znajomy dla ludzi, jak myśleliśmy.





Większość komputerowych systemów wizyjnych identyfikuje cechy na obrazach za pomocą sieci neuronowych, które są inspirowane naszą własną biologią i są bardzo podobne w swojej architekturze — tylko tutaj sensory biologiczne i neurony są zamienione na funkcje matematyczne. Teraz badanie przeprowadzone przez naukowców z Facebooka i Virginia Tech mówi, że pomimo tych podobieństw, powinniśmy być ostrożni przy założeniu, że oba działają w ten sam sposób .

Aby dokładnie zobaczyć, co się dzieje, gdy zarówno ludzie, jak i sztuczna inteligencja analizują obraz, naukowcy zbadali, na czym ta dwójka skupiała swoją uwagę. Oboje otrzymali zamazane obrazy i zadawali pytania dotyczące tego, co dzieje się na zdjęciu — Gdzie jest kot? na przykład. Części obrazu można było wyostrzać selektywnie, pojedynczo, a zarówno człowiek, jak i sztuczna inteligencja robili to, dopóki nie mogli odpowiedzieć na pytanie. Zespół powtórzył testy przy użyciu kilku różnych algorytmów.

Oczywiście obaj mogli udzielić odpowiedzi, ale interesującym rezultatem jest to, jak to zrobili. W skali od 1 do -1, gdzie 1 oznacza całkowitą zgodę, a -1 całkowity brak zgody, dwoje ludzi uzyskało średnio 0,63 punktów, jeśli chodzi o miejsce, w którym skupili swoją uwagę na obrazie. Z człowiekiem i sztuczną inteligencją średnia spadła do 0,26.



Innymi słowy: sztuczna inteligencja i człowiek patrzyli na ten sam obraz, obaj zadawali to samo pytanie, obydwaj odpowiedzieli prawidłowo – ale używali różnych funkcji wizualnych, aby dojść do tych samych wniosków.

Jest to jednoznaczny wynik dotyczący zjawiska, o którym naukowcy już sugerowali. W 2014 roku zespół z Cornell University i University of Wyoming pokazał, że możliwe jest tworzenie obrazów, które nakłaniają sztuczną inteligencję do zobaczenia czegoś, po prostu tworząc obraz złożony z silnych cech wizualnych, które oprogramowanie zaczęło kojarzyć z obiektem. . Ludzie mają dużą pulę zdroworozsądkowej wiedzy, z której mogą czerpać, co oznacza, że ​​nie dają się złapać na takie sztuczki. To jest coś, co naukowcy próbują włączyć do nowego rodzaju inteligentnego oprogramowania, które rozumie semantyczny świat wizualny.

Ale tylko dlatego, że komputery nie stosują tego samego podejścia, niekoniecznie oznacza, że ​​są gorsze. W rzeczywistości mogą lepiej całkowicie zignorować ludzkie podejście.



Rodzaje sieci neuronowych używane w wizji komputerowej zwykle wykorzystują technikę znaną jako uczenie nadzorowane, aby sprawdzić, co dzieje się na obrazie. Ostatecznie ich zdolność do kojarzenia złożonej kombinacji wzorów, tekstur i kształtów z nazwą obiektu jest możliwa dzięki zapewnieniu sztucznej inteligencji zestawu treningowego obrazów, których zawartość została już oznaczona przez człowieka.

Jednak zespoły z Facebooka i Google DeepMind eksperymentują z nienadzorowanymi systemami uczenia się, które pobierają treści z filmów i obrazów, aby dowiedzieć się, jak wyglądają ludzkie twarze i przedmioty codziennego użytku, bez żadnej interwencji człowieka. Magic Pony, niedawno kupiony przez Twittera, również unika nadzorowanego uczenia się, zamiast tego uczy się rozpoznawać statystyczne wzorce na obrazach, aby nauczyć się, jak powinny wyglądać krawędzie, tekstury i inne funkcje.

W takich przypadkach jest być może jeszcze mniej prawdopodobne, że wiedza o sztucznej inteligencji zostanie wygenerowana w procesie mającym na celu upodobanie człowieka. Kiedyś sztuczna inteligencja zainspirowana ludzkimi mózgami może nas pokonać, po prostu będąc sobą.



(Czytaj więcej: Nowy naukowiec , brakujące ogniwo sztucznej inteligencji , „Inteligentne” oprogramowanie można oszukać, aby zobaczyć, czego tam nie ma )

ukryć