Teraz maszyny AI uczą się rozumieć historie

Techniki sztucznej inteligencji szturmem podbijają świat. W zeszłym roku ujawniono zespół badawczy DeepMind firmy Google maszyna, która nauczyła się grać w zręcznościowe gry wideo . Na początku tego roku zademonstrował zespół chińskich badaczy system rozpoznawania twarzy, który przewyższa ludzi , a w zeszłym tygodniu chiński gigant internetowy Baidu ujawnił pojedynczy system rozpoznawania mowy zdolny do transkrypcji zarówno angielskiego, jak i chińskiego mandaryńskiego .





Umożliwiły to dwa czynniki. Pierwszym z nich jest lepsze zrozumienie wielowarstwowych sieci neuronowych i sposobu ich dostrajania do określonych zadań. Drugim jest stworzenie ogromnych baz danych niezbędnych do szkolenia tych sieci.

Te bazy danych są niezwykle ważne. Na przykład do rozpoznawania twarzy sieć neuronowa musi widzieć wiele tysięcy rzeczywistych obrazów, na których twarze ze wszystkich kątów, czasami zasłonięte, są wyraźnie oznaczone. Wymaga to wielu godzin ludzkich adnotacji, ale jest to teraz możliwe dzięki technikom crowdsourcingu i usługom internetowym, takim jak Amazon Mechanical Turk.

Szybki postęp w tej dziedzinie oznacza, że ​​większość nisko wiszących owoców jest szybko usuwana — rozpoznawanie twarzy, rozpoznawanie obiektów, rozpoznawanie mowy i tak dalej. Jednak znacznie trudniej jest tworzyć bazy danych do bardziej złożonych zadań rozumowania, takich jak rozumienie historii.



Dziś zaczyna się to zmieniać dzięki pracy Makaranda Tapaswi z Instytutu Technologii w Karlsruhe w Niemczech i kilku kumpli, którzy stworzyli bazę danych o filmach, która powinna służyć jako arena testowa dla maszyn głębokiego uczenia się i ich zdolności rozumowania o historiach.

Kluczowym spostrzeżeniem stojącym za ich projektem jest to, że umiejętność odpowiedzi na pytania dotyczące historii lub filmu jest ważnym wskaźnikiem tego, czy zostały zrozumiane. Celem badań jest więc stworzenie quizów wielokrotnego wyboru na temat filmów, które składają się z zestawu pytań wraz z kilkoma możliwymi odpowiedziami, z których tylko jedna jest poprawna.

Ich podejście jest proste. Tapaswi i spółka zaczynają od zebrania streszczenia fabuły z Wikipedii dla około 300 filmów. Różnią się one szczegółowo od jednego akapitu do ponad 20 akapitów.



Łączą to z samym filmem, który jest pokaźnym zbiorem danych. Mówią, że przeciętny film trwa około dwóch godzin, ma ponad 198 tys. klatek i prawie 2000 ujęć.

Filmy wyraźnie pokazują informacje, które mogą odpowiadać na pytania typu Kto co komu zrobił? Ale nie zawsze zawierają informacje pozwalające odpowiedzieć na pytania, dlaczego coś się dzieje, do czego czasami potrzebna jest dodatkowa wiedza o świecie.

Tak więc Tapaswi i spółka zbierają również informacje z dodatkowych baz danych. Na przykład, wydobyli opisany tekst wideo dla osób niewidomych, który ma zawierać wystarczającą ilość informacji, aby zrozumieć, co się dzieje, nie widząc tego; a także wydobywają oryginalne scenariusze filmów, które często są przydatne, chociaż reżyserzy nie zawsze ich dokładnie przestrzegają.



Następnie zespół poprosił ludzkich adnotatorów, aby wybrali przeczytanie streszczenia każdego filmu. Następnie musieli sformułować szereg pytań dotyczących każdego przeczytanego akapitu wraz z odpowiedzią. W każdym akapicie adnotatorzy pisali średnio pięć pytań. Musieli także podkreślić fragment tekstu, który zawierał odpowiedź na każde pytanie.

Na koniec Tapaswi i spółka poprosili komentatorów, aby przeczytali każde pytanie i odpowiedź oraz podali cztery błędne odpowiedzi, aby stworzyć quiz wielokrotnego wyboru. Powstała baza danych zawiera ponad 7000 pytań dotyczących 300 filmów.

Pytania można podzielić na kilka kategorii. Oto kilka przykładów (zgadnij filmy, jeśli możesz):



Imię osoby (kto)
Kogo pociąga Epps?
Jak nazywa się Jeff Lebowski?

Rozumowanie (dlaczego)
Dlaczego Arwena chce zostać w Śródziemiu?
Dlaczego Bruce boi się nietoperzy?

Streszczenie (co)
Jaką moc zawiera zielona esencja?
Jak wyjaśniono na rozprawie, jaka była główna przyczyna wypadku?

Powód: działanie (jak)
Jak Kale spędza czas, kiedy po raz pierwszy rozpoczyna karę aresztu domowego?
Jak Hal pokonuje Parallax?

Lokalizacja (gdzie)
Jak nazywa się siłownia, w której pozostawiono płytę?
Gdzie Aragorn przewodzi Drużynie?

Akcja (co)
Co robi WALL-E, kiedy pomyśli, że EVE została zamknięta?
Co robią Jane i Kevin rok po spotkaniu?

Przedmiot/rzecz (co)
Co grupa znajduje w jaskini trolli?
Co ludzie, którzy napadli na Kolesia, niszczą w jego domu?

Typ osoby (co)
Kim jest Daniel Cleaver?
Jaki jest zawód Rachel Dawes?

Tak/Nie (jest, robi)
Czy Madeleine przyjmuje pieniądze za swoją pracę dla Arthura Case'a?
Czy najstarszy syn Faramira Denethora?

Przyczynowość (co się dzieje)
Co robi Mark, gdy Bridget odwiedza go i prosi o przebaczenie?
Co się dzieje podczas randki Miley z Travisem?

Są one stosunkowo proste dla ludzi, którzy obejrzeli film. Ale ci faceci testują bazę danych na kilku prostych, maszynowych strategiach odpowiadania na pytania, aby zobaczyć, jak dobrze sobie radzą. Żadna z nich nie radzi sobie szczególnie dobrze, ale chodzi oczywiście o pomoc w szkoleniu przyszłych generacji tych maszyn, które prawdopodobnie będą lepsze.

To wielka prośba. Interesującą kwestią jest to, że głębokie sieci neuronowe potrzebują dużych baz danych, aby pomóc im się uczyć. A im bardziej złożone zadanie, tym większa musi być baza danych.

Tak więc ważnym pytaniem jest, jak duża musi być baza danych, aby wytrenować algorytm głębokiego uczenia się, aby odpowiedzieć na pytania dotyczące filmów. Trudno na to odpowiedzieć, nawet z dokładnością do rzędu wielkości.

Tak więc ważnym celem będzie ustalenie, czy ta baza danych jest wystarczająco duża, aby pomóc ograniczyć nowoczesne maszyny AI, gdy uczą się wykonywać to zadanie. To jest coś, o czym Tapaswi i spółka wkrótce się dowiedzą.

W międzyczasie udostępniają bazę online w nowym roku pod adresem: http://movieqa.cs.toronto.edu/home/ . Jeśli badania AI nie wyjdą, powinny przynajmniej być przydatne w quizach pubowych.

Nr ref.: http://arxiv.org/abs/1512.02902 : MovieQA: Zrozumienie historii w filmach poprzez odpowiadanie na pytania

ukryć