211service.com
Maszyna AI próbuje zrozumieć komiksy… i kończy się niepowodzeniem
Lista czynności, w których maszyny sztucznej inteligencji pokonały ludzi, rośnie w zastraszającym tempie. Rozpoznawanie twarzy, rozpoznawanie obiektów, szachy, Go, różne gry wideo i wiele innych zadań padło w tej bitwie.
Dlatego naturalne jest pytanie o rodzaje zadań, z którymi maszyny nadal mają trudności. Gdzie ludzie nadal rządzą grzędą?
Dzisiaj otrzymujemy swego rodzaju odpowiedź dzięki pracy Mohita Iyyera z University of Maryland w College Park i kilku kumplom. Ci faceci pytają, jak dobrze sztuczna inteligencja może zrozumieć komiksy i nie może się oprzeć waleniu w powietrze, ujawniając, że maszyny zajmują żałosne drugie miejsce w porównaniu z ludźmi.
Komiksy opowiadają historie za pomocą sekwencji paneli składających się z ręcznie rysowanych i często bardzo stylizowanych obrazów, które bardzo różnią się charakterem od fotografii. Panele te są również opatrzone adnotacjami tekstowymi w postaci dymków myśli, dymków i ramek narracyjnych.
Tekst i obrazy ściśle ze sobą współpracują; często tak blisko, że nie można śledzić historii za pomocą samych obrazów lub tekstu. Nawet wtedy czytelnik musi dokonać znaczących wniosków i ekstrapolacji, przeskakując z panelu do panelu. Wiele szczegółów musi zostać uzupełnionych przez czytelnika.
To, co twórca ukrywa na swoich stronach, sprawia, że komiksy są naprawdę interesujące, niewypowiedziane rozmowy i niewidziane działania, które czają się w przestrzeniach (lub rynnach) między sąsiednimi panelami, powiedzmy Iyyer i spółka. To właśnie w odszyfrowaniu tych szczegółów historia wykuwa się w wyobraźni czytelników.
Ten złożony proces przeglądania pojedynczego panelu i zrozumienia, w jaki sposób łączy się z poprzednimi, nazywa się zamknięciem. I w tej chwili jest to wyjątkowo ludzka umiejętność.
Dlatego Iyyer i współpracownicy opracowali eksperyment, aby sprawdzić, jak dobrze potrafią to wykonać również maszyny.
Ci faceci zaczynają od stworzenia dużej bazy komiksowych historii, które mogą wykorzystać do trenowania maszyn do głębokiego uczenia się. Tworzą to za pomocą komiksów opublikowanych w latach 30. i 50. XX wieku. Był to tzw. złoty wiek komiksu, który zakończył się pod koniec lat 50., kiedy w USA wprowadzono surowe regulacje cenzury. Prawa autorskie do tych publikacji wygasły i są one publicznie dostępne na stronie internetowej Digital Comics Museum w forma jpegów przesłanych przez użytkownika.
Iyyer i współpracownicy wykorzystali 4000 najwyżej ocenianych komiksów na stronie, tworząc bazę danych zawierającą ponad 1,2 miliona paneli. Używają optycznego rozpoznawania znaków do digitalizacji tekstu na każdym panelu.
Aby przetestować zamknięcie, Iyyer i współ opracowują zestaw eksperymentów, w których maszynie pokazuje się sekwencję paneli, a następnie musi przewidzieć, co będzie dalej z zestawu możliwych odpowiedzi. Zadaniem może być przewidzenie następnego obrazka lub kolejnego fragmentu tekstu lub dopasowanie tekstu do konkretnego znaku.
Najpierw maszyna musi się nauczyć, jak działają komiksy. Dlatego zespół przekazał część paneli i tekstów różnym algorytmom uczenia maszynowego, aby mogli dowiedzieć się, jak panele następują po sobie. Maszyny te są wstępnie przeszkolone do rozpoznawania obiektów, ale na naturalnych obrazach, a nie na kreskówkach.
Po przeszkoleniu maszyn zespół testuje je na zestawie paneli, których nie widziały, i prosi o przewidzenie następnego obrazu lub fragmentu tekstu w serii.
Rezultaty są podnoszące brwi. Podczas gdy ludzie potrafią prawidłowo przewidzieć następny fragment tekstu lub następny obraz w ponad 80 procentach przypadków, maszyny nigdy nie zbliżają się do tego poziomu dokładności. Żadna z architektur nie przewyższa ludzkich podstaw, co mówi o trudnościach w zrozumieniu komiksów, mówią Iyyer i spółka. Cechy obrazu uzyskane z modeli wyszkolonych na obrazach naturalnych nie są w stanie uchwycić ogromnej różnorodności stylów artystycznych, a modele tekstowe zmagają się z bogactwem i niejednoznacznością dialogu potocznego silnie uzależnionego od kontekstów wizualnych.
Nie jest to zaskakujące, biorąc pod uwagę zdrowy rozsądek potrzebny do śledzenia tych historii i wiedzę kulturową wymaganą do zrozumienia logiki opowiadania historii w komiksach.
Więc ludzie nadal są mistrzami tego zadania, przynajmniej na razie.
Ale maszyny z pewnością staną się lepsze, gdy nauczą się umiejętności społecznych i wnioskowania, które naszym zdaniem czynią nas ludźmi.
A to rodzi interesującą możliwość. Maszyny AI pokonały ludzi w szachach, Niebezpieczeństwo! , Go i wiele innych zadań. Być może następnym wyzwaniem powinno być lepsze zrozumienie komiksów niż ludzie, a może nawet tworzenie w ten sposób narracji. To postawiłoby Google DeepMind lub któregokolwiek z jego konkurentów przeciwko postaciom z Marvela lub DC Comics. Idealna bitwa i na pewno będzie fajna.
Nr ref.: arxiv.org/abs/1611.05118 : The Amazing Mysteries of the Gutter: Rysowanie wniosków między panelami w narracjach komiksowych