Wydobywanie znaczenia z milionów stron

Silnik oprogramowania, który łączy fakty, przeczesując ponad 500 milionów stron internetowych, został opracowany przez naukowców z Uniwersytetu Waszyngtońskiego. Narzędzie wydobywa informacje z miliardów wierszy tekstu, analizując podstawowe relacje między słowami.





Wyszukiwania słowa : TextRunner automatycznie przeczesuje 500 milionów stron internetowych, aby wydobyć znaczenie z relacji słownych.

Niektórzy eksperci twierdzą, że ten rodzaj zautomatyzowanego wyodrębniania informacji prawdopodobnie stworzy podstawę dla znacznie bardziej inteligentnego wyszukiwania w sieci Web nowej generacji, w którym bryłki informacji są najpierw zbierane, a następnie inteligentnie łączone.

Projekt Uniwersytetu Waszyngtońskiego stanowi rozwinięcie istniejącej technologii o nazwie TextRunner zarówno pod względem liczby stron, jak i zakresu tematów, które może analizować.



Znaczenie TextRunnera polega na tym, że jest on skalowalny, ponieważ nie jest nadzorowany, mówi Peter Norvig, dyrektor ds. badań w firmie Google, która przekazała bazę danych stron internetowych analizowanych przez TextRunner. Może odkrywać i uczyć się milionów relacji, a nie tylko jednej na raz. Dzięki TextRunnerowi w pętli nie ma człowieka: po prostu sam znajduje relacje.

Norvig wyjaśnia, że ​​poprzednie technologie wymagały od programisty więcej wskazówek. Na przykład, aby znaleźć nazwiska osób, które są prezesami w milionach dokumentów, musisz najpierw przeszkolić oprogramowanie na innych przykładach, na przykład Steve Jobs jest dyrektorem generalnym Apple, Sheryl Sandberg jest dyrektorem generalnym Facebooka. Norvig dodaje, że Google robi podobna praca i korzysta już z takiej technologii w ograniczonym kontekście.

TextRunner pozbywa się tej ręcznej pracy. Użytkownik może wprowadzić, na przykład, zabija bakterie, a silnik wyświetli strony, które oferują wgląd w to, że chlor zabija bakterie, światło ultrafioletowe zabija bakterie lub ciepło zabija bakterie – wyniki zwane trójkami – oraz zapewniają sposoby podglądu tekstu i następnie odwiedź stronę internetową, z której pochodzi.



Prototyp nadal ma dość prosty interfejs i nie jest przeznaczony do publicznego wyszukiwania, ale ma zademonstrować automatyczne pobieranie informacji z 500 milionów stron internetowych, mówi Oren Etzioni , informatyk z Uniwersytetu Waszyngtońskiego kierujący projektem. To, co pokazujemy, to zdolność oprogramowania do osiągnięcia elementarnego zrozumienia tekstu na niespotykaną dotąd skalę i zakres, mówi.

Etizioni mówi, że zdolność TextRunnera do szybkiego wydobywania znaczenia na ogromną skalę wynika z odkrycia przez jego grupę ogólnego modelu wyrażania relacji w języku angielskim, który jest prawdziwy niezależnie od tematu. Na przykład prosty wzór „podmiot1, czasownik, podmiot2” obejmuje relacje „Edison wynalazł żarówkę”, a także „Microsoft nabył Farecast” i wiele innych, mówi. TextRunner wykorzystuje ten model, który jest automatycznie uczony na podstawie tekstu, w celu analizowania zdań i wyodrębniania trójek z dużą dokładnością.

TextRunner służy również jako punkt wyjścia do budowania wniosków z zapytań w języku naturalnym, nad czym obecnie pracuje grupa. Prosty przykład: jeśli TextRunner znajdzie stronę internetową, na której znajdują się informacje, że ssaki są ciepłokrwiste, oraz inną, na której psy są ssakami, silnik wnioskowania wygeneruje informację, że psy są prawdopodobnie ciepłokrwiste.



Jest to analogiczne do technologii opracowanej przez Powerset, która została przejęta przez Microsoft w zeszłym roku. Krótko przed tym przejęciem firma Powerset zaprezentowała narzędzie, które ograniczało się do wydobywania faktów z zaledwie około dwóch milionów Wikipedia stron. Technologia TextRunner obsługuje strony Wikipedii oraz dowolny tekst na dowolnej stronie, w tym posty na blogach, katalogi produktów, artykuły prasowe i inne.

Ta linia pracy poczyniła istotne postępy w skali, na jaką można podejść do tych zadań, mówi Jon Kleinberg, informatyk z Cornell University, który śledzi badania naukowe Uniwersytetu Waszyngtońskiego. Dodał, że praca ta odzwierciedla rosnący trend w kierunku projektowania narzędzi wyszukiwania, które aktywnie łączą fragmenty informacji znalezione w sieci w większą syntezę.

ukryć