Lingwistyka Przełom zapowiada tłumaczenie maszynowe dla tysięcy rzadkich języków

Najlepsze jest przypuszczenie, że ludzie mówią obecnie w 6900 różnych językach. Ponad połowa światowej populacji komunikuje się za pomocą zaledwie kilku z nich — języka chińskiego, angielskiego, hindi, hiszpańskiego i rosyjskiego. Rzeczywiście, 95 procent ludzi komunikuje się za pomocą zaledwie 100 języków.





Inne argoty są znacznie mniej powszechne. Rzeczywiście, lingwiści szacują, że około jedną trzecią języków świata posługuje się mniej niż 1000 osób i grozi im wyginięcie w ciągu najbliższych 100 lat. Wraz z nimi odejdzie wyjątkowe dziedzictwo kulturowe, które ucieleśniają – historie, frazy, żarty, leki ziołowe, a nawet wyjątkowe emocje.

Łatwo pomyśleć, że uczenie maszynowe może pomóc. Problem polega na tym, że tłumaczenie maszynowe opiera się na ogromnych zestawach danych z adnotacjami, aby realizować swoje transakcje. Te zbiory danych składają się z ogromnych zbiorów książek, artykułów i stron internetowych, które zostały ręcznie przetłumaczone na inne języki. Działa to jak kamień z Rosetty dla algorytmów uczenia maszynowego, a im większy zestaw danych, tym lepiej się uczą.

Mapa pokazująca, w jaki sposób wskaźniki czasu przeszłego skupiają się dla 100 badanych języków.



Ale te ogromne zbiory danych po prostu nie istnieją dla większości języków. Dlatego tłumaczenie maszynowe działa tylko dla niewielkiej części najpopularniejszych żargonów. Na przykład Tłumacz Google mówi tylko o 90 językach.

Dlatego ważnym wyzwaniem dla lingwistów jest znalezienie sposobu na automatyczną analizę mniej popularnych języków, aby lepiej je zrozumieć.

Dziś Ehsaneddin Asgari i Hinrich Schutze z Uniwersytetu Ludwika Maksymiliana w Monachium w Niemczech twierdzą, że właśnie to zrobili. Ich nowe podejście ujawnia ważne elementy niemal każdego języka, które można następnie wykorzystać jako odskocznię do tłumaczenia maszynowego.



Nowa technika opiera się na jednym tekście, który został przetłumaczony na co najmniej 2000 różnych języków. To jest Biblia, a lingwiści od dawna uznają jej znaczenie w swojej dyscyplinie.

W konsekwencji stworzyli bazę danych o nazwie Parallel Bible Corpus, która składa się z przekładów Nowego Testamentu na 1169 języków. Ten zestaw danych nie jest wystarczająco duży, aby zastosować przemysłowy system uczenia maszynowego, który wykonuje Google i inne firmy. Tak więc Asgari i Schutze wymyślili inne podejście oparte na sposobie, w jaki czasy pojawiają się w różnych językach.

Większość języków używa określonych słów lub kombinacji liter do oznaczenia czasów. Tak więc nowa sztuczka polega na ręcznej identyfikacji tych sygnałów w kilku językach, a następnie wykorzystaniu technik eksploracji danych do przeszukiwania innych tłumaczeń w poszukiwaniu słów lub ciągów liter, które odgrywają tę samą rolę.



Na przykład w języku angielskim czas teraźniejszy oznacza słowo is, czas przyszły słowem will, a czas przeszły słowem was. Oczywiście są też inne znaczące.

Pomysł Asgari i Schutze polega na znalezieniu wszystkich tych słów w angielskim tłumaczeniu Biblii wraz z innymi przykładami z kilku przekładów na inne języki. Następnie poszukaj słów lub ciągów liter, które odgrywają tę samą rolę w innych językach. Na przykład ciąg liter -ed oznacza również czas przeszły w języku angielskim.

Ale jest pewien zwrot. Asgari i Schutze nie zaczynają od angielskiego, ponieważ jest to stosunkowo stary język z wieloma wyjątkami od reguły, co utrudnia naukę.



Zamiast tego zaczynają od zestawu języków kreolskich, które rozwinęły się z mieszanki innych języków. Ponieważ są młodsze, języki kreolskie miały mniej czasu na rozwinięcie tych językowych cech. A to oznacza, że ​​zazwyczaj zawierają lepsze wskaźniki cech językowych, takich jak czas. Naszym uzasadnieniem jest to, że języki kreolskie są bardziej regularne niż inne języki, ponieważ są młode i nie zgromadziły „bagażu historycznego”, który może utrudnić analizę obliczeniową.

Jednym z tych języków jest kreolski Seszeli, w którym słowo ti oznacza czas przeszły. Na przykład mon travay oznacza, że ​​pracuję w tym języku, podczas gdy mon ti travay oznacza, że ​​pracowałem, a mon ti pe travay oznacza, że ​​pracowałem. Więc ti jest dobrym wskaźnikiem czasu przeszłego.

Asgari i Schutze opracowują listę symboli oznaczających czas przeszły w 10 innych językach, a następnie wydobywają z Parallel Bible Corpus inne słowa i ciągi liter, które pełnią tę samą funkcję. Powtarzają to dla czasu teraźniejszego i przyszłego.

Wyniki stanowią ciekawą lekturę. Technika ta ujawnia konstrukcje lingwistyczne związane z czasem w popularnych językach, takich jak -ed w języku angielskim i -te w języku niemieckim, a także słowa i wyrażenia, które pełnią te same funkcje w znacznie mniej popularnych językach, takich jak signifier czasu przeszłego den w Gourmanchema język z Burkino Faso, yi z Jałunki, używany w Mali i tak dalej.

Praca ta pozwala naukowcom tworzyć mapy pokazujące, w jaki sposób języki używające podobnych konstrukcji czasu są powiązane (patrz diagram).

To interesująca praca. Asgari i Schutze opracowali metodę obliczeniową do analizy sposobu, w jaki ludzie używają czasu przeszłego, teraźniejszego i przyszłego w ponad tysiącu języków. Jest to największe wielojęzyczne badanie obliczeniowe, jakie kiedykolwiek podjęto. Rzeczywiście, liczba zaangażowanych języków jest o rząd wielkości większa niż w innych badaniach.

Praca ma duże zastosowanie. Mapy czasów językowych umożliwiają naukowcom szybkie ustalenie relacji między językami i sposobu, w jaki są one ze sobą powiązane. Można to wykorzystać do lepszego zrozumienia ewolucji języka.

To samo podejście można by również zastosować w przypadku innych cech językowych. Wymagamy jedynie, aby cecha językowa była wyraźnie oznaczona w kilku z tysięcy języków, w przeciwieństwie do wymagania, aby była oznaczona we wszystkich badanych językach, mówią Asgari i Schutze.

Implikacje idą dalej. Językoznawstwo komputerowe wywarło ogromny wpływ na nasze rozumienie języka, sposób, w jaki różni się on na świecie i jak maszyny mogą go zrozumieć. Ta rozwijająca się dyscyplina umożliwiła automatyczne tłumaczenie wielu języków bezpośrednio na inne w formie pisemnej i ustnej. Rzeczywiście, obiecuje się, że natychmiastowe tłumaczenie maszynowe wkrótce dorówna, a następnie przewyższy możliwości ludzkich tłumaczy.

Ale użyteczność tłumaczenia maszynowego dla niektórych języków sprawia, że ​​są one bardziej popularne kosztem języków, które nie są obsługiwane. Dlatego tłumaczenie maszynowe może przyspieszyć upadek zagrożonych języków.

Rzeczywiście, językoznawcy zaobserwowali podobne zjawisko w przypadku innych form komunikacji masowej, takich jak usługi telewizji satelitarnej. Na ogół są one nadawane w jednym języku, który następnie staje się bardziej pożądany i popularny niż języki, które nie są nadawane.

Praca Asgariego i Schutzego może pomóc w odwróceniu tego schematu upadku. Oczywiście to duży krok od tej pracy do dokładnego tłumaczenia maszynowego, ale jest to krok we właściwym kierunku.

Nr ref.: arxiv.org/abs/1704.08914 : Przeszłość, teraźniejszość, przyszłość: obliczeniowe badanie typologii czasu w 1000 języków

ukryć