Jak IBM planuje wygrać zagrożenie!

Przez dziesięciolecia ludzie walczyli o stworzenie maszyn, które potrafią wydobyć znaczenie z ludzkiego języka, z całym jego bałaganem, subtelnym kontekstem, humorem i ironią. Tradycyjne podejścia wymagają dużej ilości pracy ręcznej z góry, aby materiał był zrozumiały dla algorytmów komputerowych. Ostatecznym celem jest uczynienie tego kroku niepotrzebnym.





Co to jest Watson? : IBM przygotowuje system komputerowy w języku naturalnym, który będzie konkurował z ludźmi w telewizji Jeopardy!, której gospodarzem jest Alex Trebek.

IBM ma nadzieję, że uda się osiągnąć ten cel dzięki Watson, systemowi komputerowemu, który będzie grał Niebezpieczeństwo! , popularny telewizyjny teleturniej ciekawostki, przeciwko ludzkim uczestnikom. W tym roku spodziewane są demonstracje systemu, a ostatni pojedynek transmitowany w telewizji – wraz z prowadzeniem przez Alexa Trebeka – w przyszłym roku. Pytania będą wypowiadane na głos przez Trebeka, ale podczas pokazu zostaną wprowadzone do maszyny w formacie tekstowym.

Firma nie opublikowała jeszcze żadnych prac badawczych opisujących, jak poradzi sobie z jej systemem Niebezpieczeństwo! pytania w stylu. Ale David Ferrucci, informatyk IBM kierujący pracami, wyjaśnia, że ​​system rozbija pytanie na kawałki, przeszukuje własne bazy danych w poszukiwaniu powiązanej wiedzy, a następnie nawiązuje połączenia, aby zebrać wyniki. Watson nie jest przeznaczony do przeszukiwania sieci WWW, a ostatecznym celem IBM jest stworzenie systemu, który może sprzedawać klientom korporacyjnym, którzy potrzebują większej dostępności informacji.



Ferrucci opisuje, w jaki sposób technologia poradzi sobie z następującymi kwestiami Niebezpieczeństwo! -pytanie w stylu: to opera wspomniana w tekście hitu Smokeya Robinsona i cudów z 1970 roku.

Silnik Watsona wykorzystuje techniki przetwarzania języka naturalnego, aby podzielić pytanie na elementy konstrukcyjne. W tym przypadku utwory obejmują: 1) operę; 2) opera jest wymieniona w pieśni; 3) piosenka była przebojem w 1970 roku; i 4) hitem był Smokey Robinson and the Miracles.

Przeszukując swoje bazy danych w poszukiwaniu informacji, które mogą być istotne dla tych segmentów, system może znaleźć setki fragmentów. Mogą to być następujące trzy:



Pagliacci, opera o klaunie, który stara się ukryć swoje uczucia;

Motown Smokeya Robinsona przebojem ' lata 60. Łzy klauna;

Tears of a Clown by the Miracles to hit nr 1 w Wielkiej Brytanii w 1970 roku.



Analizując te fragmenty, Watson może zidentyfikować Pagliacciego jako operę, chociaż samo to nie byłoby zbyt pomocne, ponieważ wiele innych fragmentów również identyfikuje nazwy oper. Drugi wynik wskazuje na przebojową płytę The Tears of a Clown Smokeya Robinsona, która według systemu jest prawdopodobnie tym samym, co Smokey Robinson and the Miracles. Jednak wiele innych tytułów piosenek zostałoby wygenerowanych w podobny sposób. Prawdopodobieństwo, że wynik jest trafny, również zostałoby ocenione jako niskie, ponieważ utwór kojarzy się z latami 60., a nie z 1970 r. Trzeci fragment potwierdza jednak ideę, że Łzy klauna były hitem w 1970 r., pod warunkiem, że system stwierdza, że ​​The Miracles odnosi się do tego samego, co Smokey Robinson i Miracles.

Od pierwszego z tych trzech fragmentów silnik Watsona wiedziałby, że klauni to opera o klaunie, który ukrywa swoje uczucia. Aby nawiązać kontakt z Smokey Robinsonem, system musi rozpoznać, że łzy są silnie związane z uczuciami, a ponieważ wie o tym klauni opowiada o klaunie, który stara się ukryć swoje uczucia, zgaduje – słusznie – że klauni jest odpowiedzią. Oczywiście system może nadal dokonać złego wyboru w zależności od tego, jak błędne odpowiedzi mogą być poparte dostępnymi dowodami, mówi Ferrucci.

Ferrucci mówi, że łatwo jest stwierdzić, że mniej wyrafinowane systemy języka naturalnego są odpowiedzią, że Łzy klauna są odpowiedzią, pomijając fakt, że prośba dotyczyła opery, do której odnosi się ta piosenka. Taki wniosek może zostać wywołany przez fragmenty, które zawierają wiele słów kluczowych pasujących do pytania.



Marti Hearst , informatyk z Uniwersytetu Kalifornijskiego w Berkeley, mówi, że w ciągu ostatniej dekady naukowcy zajmujący się przetwarzaniem języka naturalnego poczynili ogromne postępy w tym zadaniu. Dodaje, że zmierzenie systemu odpowiedzi na pytania IBM Watson z najlepszymi ludźmi w grze Niebezpieczeństwo! to fajny sposób na nagłośnienie i zaprezentowanie tego postępu, ale zwraca również uwagę na brak opublikowanych badań dostępnych do zbadania.

Tymczasem Agencja Obronnych Zaawansowanych Projektów Badawczych (DARPA) wkrótce ogłosi uczestników wybranych do wzięcia udziału w pięcioletni wysiłek badawczy mające na celu poprawę stanu przetwarzania języka naturalnego. Spodziewam się, że cały ten obszar znacznie się nagrzeje w ciągu najbliższych kilku lat, mówi Dan Weld, informatyk z University of Washington, który kieruje grupą, która złożyła wniosek o udział w przedsięwzięciu DARPA.

Niezależnie od tego, czy Watson IBM pokonuje ludzi, czy nie Niebezpieczeństwo! Weld mówi, że w przyszłym roku projekt DARPA z pewnością popchnie tę dziedzinę do przodu. Jak zauważyła DARPA w swoim zapytaniu o propozycje badań, dzisiejsze najinteligentniejsze systemy przetwarzania języka są wąsko skoncentrowane, podczas gdy szerzej skoncentrowane systemy są bardziej nieprecyzyjne. Weld mówi, że zaangażowanie DARPA skoncentruje się na badaniach wielu osób z najlepszych uniwersytetów i laboratoriów badawczych, aby rozwijać zintegrowane systemy, które faktycznie mogą czytać szeroką gamę dokumentów. Większość obecnych systemów zajmuje się małymi elementami układanki.

ukryć