211service.com
Jak rewolucyjny system sztucznej inteligencji Reutersa gromadzi wiadomości z całego świata
Pojawienie się Internetu i późniejsza eksplozja informacji sprawiły, że dla dziennikarzy coraz trudniejsze staje się dokładne i szybkie tworzenie wiadomości. Tak więc rozpocznij zespół ds. badań i rozwoju w globalnej agencji prasowej Reuters w artykule na temat arXiv w tym tygodniu.
Dla agencji Reuters problem zaostrzył się w związku z pojawieniem się fałszywych wiadomości jako ważnego czynnika zniekształcającego postrzeganie wydarzeń.
Niemniej jednak agencje informacyjne, takie jak Associated Press, posunęły się naprzód dzięki zautomatyzowanym usługom redagowania wiadomości. Podają one standardowe ogłoszenia, takie jak wiadomości finansowe i niektóre wyniki sportowe, wklejając dane do wcześniej napisanych szablonów: X odnotował zysk w wysokości Y milionów w III kwartale, w wynikach, które przekroczyły prognozy Wall Street ...
W związku z tym istnieje znaczna presja na inne agencje informacyjne, aby zautomatyzowały produkcję wiadomości. A dzisiaj Reuters przedstawia, w jaki sposób prawie całkowicie zautomatyzował identyfikację najświeższych wiadomości. Xiaomo Liu i koledzy z Reuters Research and Development oraz Alibaba twierdzą, że nowy system działa dobrze. Rzeczywiście, może zrewolucjonizować branżę informacyjną. Ale budzi to również obawy, w jaki sposób taki system może zostać oszukany przez złośliwych aktorów.
Nowy system nazywa się Reuters Tracer. Wykorzystuje Twittera jako rodzaj globalnego czujnika, który rejestruje wydarzenia informacyjne na bieżąco. Następnie system wykorzystuje różne rodzaje eksploracji danych i uczenia maszynowego, aby wybrać najistotniejsze zdarzenia, określić ich temat, uszeregować priorytet oraz napisać nagłówek i podsumowanie. Wiadomości są następnie rozpowszechniane za pośrednictwem globalnego kanału informacyjnego firmy.
Pierwszym krokiem w tym procesie jest odprowadzenie strumienia danych z Twittera. Tracer sprawdza około 12 milionów tweetów dziennie, 2 procent całości. Połowa z nich jest pobierana losowo; druga połowa pochodzi z listy kont na Twitterze wyselekcjonowanej przez ludzkich dziennikarzy Reutersa. Obejmują one konta innych organizacji prasowych, znaczących firm, wpływowych osób i tak dalej.
Następnym etapem jest ustalenie, kiedy miało miejsce wydarzenie informacyjne. Tracer robi to, zakładając, że zdarzenie miało miejsce, jeśli kilka osób zacznie o nim mówić jednocześnie. Używa więc algorytmu grupowania, aby znaleźć te konwersacje.
Oczywiście klastry te obejmują spam, reklamy, zwykły czat i tak dalej. Tylko niektóre z nich odnoszą się do wydarzeń wartych opublikowania.
Tak więc następnym etapem jest klasyfikacja i priorytetyzacja wydarzeń. Tracer wykorzystuje w tym celu szereg algorytmów. Pierwsza określa temat rozmowy. Następnie porównuje to z bazą danych tematów, którą zespół Reuters zebrał z tweetów stworzonych przez 31 oficjalnych kont informacyjnych, takich jak @CNN, @BBCBreaking i @nytimes, a także agregatorów wiadomości, takich jak @BreakingNews.
Na tym etapie algorytm określa również lokalizację zdarzenia, korzystając z bazy miast i słów kluczowych związanych z lokalizacją.
Gdy rozmowa lub plotka zostanie potencjalnie zidentyfikowana jako wiadomość, ważną kwestią jest jej prawdziwość. Aby to ustalić, Tracer szuka źródła, identyfikując najwcześniejszy tweet w rozmowie, który wspomina temat i wszelkie witryny, na które wskazuje. Następnie sprawdza bazę danych zawierającą listę znanych producentów fałszywych wiadomości, taką jak National Report, lub serwisy z satyrycznymi wiadomościami, takie jak The Onion.
Na koniec system pisze nagłówek i podsumowanie oraz dystrybuuje wiadomości w całej organizacji Reuters.
Zespół Reuters twierdzi, że podczas prób system działał dobrze. Tracer jest w stanie osiągnąć konkurencyjną precyzję, przywołanie, terminowość i wiarygodność wykrywania i dostarczania wiadomości.
I mają statystyki, które to potwierdzają. System przetwarza 12 milionów tweetów dziennie, odrzucając prawie 80 procent z nich jako szum. Reszta dzieli się na około 6000 klastrów, które system klasyfikuje jako różne rodzaje wydarzeń informacyjnych. Wszystko to robi 13 serwerów z 10 różnymi algorytmami.
Dla porównania, Reuters zatrudnia około 2500 dziennikarzy na całym świecie, którzy razem generują codziennie około 3000 alertów informacyjnych, korzystając z różnych źródeł, w tym Twittera. Spośród nich około 250 zostało napisanych jako wiadomości.
Reuters porównał historie, które Tracer utożsamia z tymi, które pojawiają się w kanałach informacyjnych organizacji takich jak BBC i CNN. Wyniki wskazują, że Tracer może pokryć około 70 procent wiadomości z 2 procentami danych z Twittera, powiedzmy Lui i spółka.
A system na pewno działa szybko. Zespół przedstawia przykład strzelaniny w Las Vegas w październiku 2017 r., w której zginęło 58 osób. Świadek zgłosił incydent o 1:22 w nocy, co wywołało klaster Tracer. Jednak klaster nie spełniał kryteriów systemowych, aby zdarzenie zostało uwzględnione w wiadomościach do godziny 1:39. Reuters poinformował o incydencie o godzinie 1:49, mówi Lui i spółka.
To interesująca praca, która rodzi szereg pytań, zwłaszcza o łatwość manipulowania systemem. Nietrudno sobie wyobrazić złośliwych aktorów projektujących kanały na Twitterze z zamiarem oszukania Tracera.
Trudno jednak powiedzieć, czy ten system będzie łatwiejszy do gry niż obecny, w którym ludzie są regularnie oszukiwani.
Następnie jest rola ludzi w biznesie informacyjnym. Przyszłość wiadomości to niewątpliwie rosnąca automatyzacja. To, jak ludzie się dopasowują, nie zostało jeszcze ustalone.
Nr ref.: arxiv.org/abs/1711.04068 : Reuters Tracer: W kierunku zautomatyzowanej produkcji wiadomości z wykorzystaniem danych z mediów społecznościowych na dużą skalę