Algorytm zaskakująco dobrze podsumowuje długi tekst

Pan. technika





Kto ma czas na przeczytanie każdego artykułu, który widzi na Twitterze lub Facebooku, albo każdego dokumentu, który ma znaczenie dla jego pracy? Ponieważ przeciążenie informacjami staje się coraz większe, komputery mogą stać się naszą jedyną nadzieją na poradzenie sobie z rosnącym zalewem dokumentów. I może stać się rutyną poleganie na maszynie do analizowania i parafrazowania artykułów, artykułów naukowych i innych tekstów.

Algorytm opracowany przez badaczy z Salesforce pokazuje, w jaki sposób komputery mogą w końcu przejąć zadanie podsumowywania dokumentów. Wykorzystuje kilka sztuczek uczenia maszynowego, aby tworzyć zaskakująco spójne i dokładne fragmenty tekstu z dłuższych fragmentów. I chociaż nie jest jeszcze tak dobry jak osoba, wskazuje, jak kondensacja tekstu może w końcu zostać zautomatyzowana.

Algorytm stworzył m.in. następujące podsumowanie ostatnich: New York Times artykuł o Facebooku próbującym walczyć z fake newsami przed nadchodzącymi wyborami w Wielkiej Brytanii:



  • Sieć społecznościowa opublikowała w poniedziałek serię ogłoszeń w brytyjskich gazetach.
  • Usunęła dziesiątki tysięcy fałszywych kont w Wielkiej Brytanii.
  • Powiedział również, że zatrudni 3000 moderatorów więcej, prawie podwajając liczbę osób na całym świecie, które skanują w poszukiwaniu nieodpowiednich lub obraźliwych treści.

Algorytm Salesforce jest znacznie lepszy niż wszystko, co opracowano wcześniej, zgodnie z powszechnym narzędziem programowym do pomiaru dokładności podsumowań tekstowych.

Nie sądzę, żebym kiedykolwiek widział tak dużą poprawę w jakimkolwiek zadaniu [przetwarzania języka naturalnego], mówi Ryszard Socher , główny naukowiec w Salesforce. Socher jest znaną marką w dziedzinie uczenia maszynowego i przetwarzania języka naturalnego, a jego start-up, MetaUmysł , została przejęta przez Salesforce w 2016 roku.

Oprogramowanie jest wciąż dalekie od dopasowania ludzkiej zdolności do uchwycenia istoty tekstu dokumentu, a inne podsumowania, które tworzy, są niechlujne i mniej spójne. Rzeczywiście, doskonałe podsumowanie tekstu wymagałoby prawdziwej inteligencji, w tym wiedzy zdroworozsądkowej i biegłości językowej.



Język analizowania pozostaje jednym z największych wyzwań sztucznej inteligencji (patrz Problem językowy AI). Ale to wyzwanie o ogromnym potencjale komercyjnym. Nawet ograniczona inteligencja językowa — możliwość analizowania wypowiedzianych lub pisemnych zapytań oraz odpowiadania w bardziej wyrafinowany i spójny sposób — może zmienić oblicze komputerów osobistych. W wielu dziedzinach specjalistycznych — takich jak medycyna, badania naukowe i prawo — zagęszczanie informacji i wydobywanie spostrzeżeń może przynieść ogromne korzyści handlowe.

Caiming Xiong, naukowiec z Salesforce, który przyczynił się do prac, twierdzi, że algorytm jego zespołu, choć niedoskonały, może podsumowywać codzienne artykuły informacyjne lub dostarczać streszczenie e-maili klientów. Ta ostatnia może być szczególnie przydatna na własnej platformie Salesforce.

Algorytm zespołu wykorzystuje kombinację podejść, aby osiągnąć jego poprawę. System uczy się na przykładach dobrych podsumowań, podejście zwane uczeniem nadzorowanym, ale także wykorzystuje rodzaj sztucznej uwagi do tekstu, który jest przetwarzany i wysyłany. Pomaga to zapewnić, że nie tworzy zbyt wielu powtarzających się fragmentów tekstu, co jest częstym problemem w algorytmach podsumowujących.



System eksperymentuje w celu wygenerowania własnych podsumowań za pomocą procesu zwanego uczeniem wzmacniania. Zainspirowany sposobem, w jaki zwierzęta się uczą, obejmuje to dostarczanie pozytywnej informacji zwrotnej na temat działań, które prowadzą do określonego celu. Uczenie się ze wzmacnianiem było wykorzystywane do uczenia komputerów robienia imponujących nowych rzeczy, takich jak granie w złożone gry lub kontrolowanie robotów (patrz 10 Breakthrough Technologies 2017: Reinforcement Learning ). Osoby pracujące nad interfejsami konwersacyjnymi coraz częściej patrzą na uczenie się przez wzmacnianie jako sposób na ulepszenie swoich systemów.

Kristian Hammond , profesor na Northwestern University i założyciel Nauka narracyjna , firma, która generuje raporty narracyjne na podstawie nieprzetworzonych danych, twierdzi, że badanie Salesforce jest dużym postępem, ale pokazuje również granice polegania wyłącznie na statystycznym uczeniu maszynowym. W pewnym momencie musimy przyznać, że potrzebujemy odrobiny semantyki i odrobiny wiedzy składniowej w tych systemach, aby były płynne i płynne, mówi Hammond.

Hammond mówi, że użycie mechanizmu uwagi naśladuje, na bardzo prostym poziomie, sposób, w jaki osoba zwraca uwagę na to, co właśnie powiedziała. Kiedy coś mówisz, szczegóły tego, jak to mówisz, wynikają z kontekstu tego, co powiedziałeś wcześniej, mówi. Ta praca jest krokiem w tym kierunku.



Poprawa umiejętności językowych komputerów może również okazać się ważna w dążeniu do rozwoju sztucznej inteligencji. Startup o nazwie Maluuba , który został przejęty na początku tego roku przez Microsoft, niedawno wyprodukował system zdolny do generowania odpowiednich pytań z tekstu. Zespół Maluuba wykorzystał również połączenie uczenia nadzorowanego i uczenia się ze wzmocnieniem.

Adam Trischler, starszy naukowiec w Maluuba, mówi, że zadawanie odpowiednich pytań jest ważną częścią uczenia się, dlatego ważne jest również tworzenie dociekliwych maszyn. Ostatecznym celem jest używanie pytań i odpowiedzi w dialogu, mówi Trischler. Co by było, gdyby maszyna mogła wyjść i zebrać informacje, a następnie zadawać własne pytania?

ukryć