Ten algorytm przegląda Wikipedię w celu automatycznego generowania podręczników

Wikipedia





Uczenie maszynowe — kompletny przewodnik to ciężka księga. Ta książka, licząca ponad 6000 stron, jest obszernym wprowadzeniem do uczenia maszynowego, z aktualnymi rozdziałami na temat sztucznych sieci neuronowych, algorytmów genetycznych i widzenia maszynowego.

Ale to nie jest zwykła publikacja. Jest to Wikibook, podręcznik, do którego każdy może uzyskać dostęp lub który może edytować, składający się z artykułów na Wikipedii, ogromnej encyklopedii internetowej.

To jest siła. Informacje pochodzące z crowdsourcingu są stale aktualizowane o najnowsze osiągnięcia i konsekwentnie edytowane w celu poprawienia błędów i niejasności.



Ale to też słabość. Wikipedia jest ogromna. Podjęcie decyzji, co zawrzeć w takim podręczniku, jest trudnym zadaniem i być może dlatego książka jest tak ogromna. Z ponad 550 rozdziałami nie jest to lekka lektura.

To rodzi interesujące pytanie. Biorąc pod uwagę postęp w dziedzinie sztucznej inteligencji w ostatnich latach, czy istnieje sposób na automatyczną edycję treści Wikipedii, tak aby stworzyć spójną całość, która przyda się jako podręcznik?

Wchodzi Shahar Admati i jego współpracownicy z Uniwersytetu Ben-Guriona na Negewie w Izraelu. Ci goście opracowali sposób na automatyczne generowanie Wikibooków za pomocą uczenia maszynowego. Nazywają swoją maszynę robotem z Wikibooków. Nowość naszej techniki polega na tym, że ma ona na celu wygenerowanie całej Wikibooka bez udziału człowieka, jak mówią.



Podejście jest stosunkowo proste. Badacze rozpoczęli od zidentyfikowania zestawu istniejących Wikibooków, które mogą pełnić rolę zestawu danych treningowych. Zaczęli od 6700 Wikibooków zawartych w zbiorze danych udostępnionym przez Wikipedię do tego rodzaju badań naukowych.

Ponieważ te Wikibooki stanowią swego rodzaju złoty standard zarówno w zakresie szkolenia, jak i testowania, zespół potrzebował sposobu na zapewnienie ich jakości. Zdecydowaliśmy się skoncentrować na Wikibookach, które były oglądane co najmniej 1000 razy, wychodząc z założenia, że ​​popularne Wikibooki mają rozsądną jakość, jak mówią.

To pozostawiło 490 Wikibooków, które przefiltrowali dalej, w oparciu o takie czynniki, jak posiadanie więcej niż 10 rozdziałów. Pozostało 407 Wikibooków, których zespół używał do trenowania swoich maszyn.



Następnie zespół podzielił zadanie stworzenia Wikibooka na kilka części, z których każda wymaga innej umiejętności uczenia maszynowego. Zadanie rozpoczyna się od tytułu wygenerowanego przez człowieka, opisującego pewnego rodzaju koncepcję, taką jak Uczenie maszynowe — kompletny przewodnik .

Pierwszym zadaniem jest posortowanie całego zestawu artykułów Wikipedii, aby określić, które są na tyle istotne, aby je uwzględnić. To zadanie jest trudne ze względu na ogromną liczbę artykułów, które istnieją w Wikipedii i potrzebę wybrania najbardziej odpowiednich artykułów spośród milionów dostępnych artykułów, powiedzmy Admati i spółka.

Aby pomóc w tym zadaniu, zespół wykorzystał strukturę sieciową Wikipedii — artykuły często wskazują inne artykuły za pomocą hiperłączy. Rozsądnie jest założyć, że artykuł, do którego prowadzi link, może być odpowiedni.



Zaczęli więc od małego jądra artykułów, które wspominają o koncepcji nasion w tytule. Następnie zidentyfikowali wszystkie artykuły znajdujące się w sieci do trzech przeskoków od tych nasion.

Ale ile z tych artykułów, do których prowadzą linki, należy uwzględnić? Aby się tego dowiedzieć, zaczęli od tytułów 407 Wikibooków stworzonych przez ludzi i przeprowadzili analizę trzech przeskoków. Następnie ustalili, jaka część treści stworzonych przez ludzi książek została uwzględniona w zautomatyzowanym podejściu.

Okazuje się, że zautomatyzowane podejście często obejmowało znaczną część oryginalnej zawartości Wikibooka, ale znacznie więcej. Dlatego zespół potrzebował innego sposobu na dalsze przycinanie treści.

Znowu w grę wchodzi nauka o sieciach. Każda stworzona przez człowieka Wikibook ma własną strukturę sieciową, określaną przez liczbę linków prowadzących z innych artykułów, liczbę linków wskazujących, listę stron w rankingu dołączonych artykułów i tak dalej.

Zespół stworzył więc algorytm, który analizuje każdy automatycznie wybrany artykuł na dany temat, a następnie określa, czy włączenie go do Wikibooka upodobniłoby strukturę sieci do książek stworzonych przez człowieka, czy nie. Jeśli nie, artykuł zostanie pominięty.

Następnym krokiem jest uporządkowanie artykułów w rozdziały. Jest to zasadniczo zadanie grupowania; przyjrzeć się sieci utworzonej przez cały zestaw artykułów i opracować sposób podziału jej na spójne klastry. Do tego rodzaju zadań dostępne są różne algorytmy klastrowania.

Ostatnim krokiem jest ustalenie kolejności, w jakiej artykuły powinny pojawiać się w każdym rozdziale. W tym celu zespół organizuje artykuły w pary i wykorzystuje model sieciowy, aby określić, które powinny pojawić się jako pierwsze. Powtarzając to dla wszystkich kombinacji par artykułów, algorytm ustala preferowaną kolejność artykułów, a tym samym rozdziałów.

W ten sposób zespół był w stanie stworzyć zautomatyzowane wersje Wikibooków, które zostały już stworzone przez ludzi. Trudno ocenić, jak dobrze te zautomatyzowane książki porównują się z tymi stworzonymi przez ludzi. Z pewnością zawierają dużo tego samego materiału, często w podobnej kolejności, co jest dobrym początkiem.

Ale Adamti i spółka mają plan określenia użyteczności ich podejścia. Planują wyprodukować szereg Wikibooków na tematy, które nie zostały jeszcze omówione w książkach stworzonych przez ludzi. Następnie będą monitorować odsłony stron i zmiany w tych książkach, aby zobaczyć, jak popularne stają się i jak intensywnie są edytowane w porównaniu z książkami stworzonymi przez ludzi. Mówią, że będzie to prawdziwy test dla naszego podejścia.

To interesująca praca, która ma potencjał do tworzenia wartościowych podręczników o szerokim zakresie tematów, a nawet do tworzenia innych tekstów, takich jak materiały konferencyjne. Jak cenne będą one dla ludzkich czytelników, jeszcze nie wiadomo. Ale będziemy obserwowali, aby się dowiedzieć.

Nr ref.: arxiv.org/abs/1812.10937 : Wikibook-Bot — automatyczne generowanie książki w Wikipedii

ukryć