211service.com
Powtórz po angielsku, proszę
Chociaż jakość tłumaczeń generowanych komputerowo znacznie się poprawiła w ciągu ostatnich 20 lat, niektóre wyniki są nadal tak samo głupkowate gramatycznie, jak instrukcje na opakowaniu pałeczek. Weźmy na przykład stronę internetową dla Japońska farma jabłek który został przekonwertowany na angielski za pomocą Google usługa automatycznego tłumaczenia :
Ogród jabłkowy Someya minie bardzo! Posadzona w 1954 roku, a ponadto nawet teraz, szczęśliwie przekracza wiek drzewa 50 lat, jest duża - przyjście na drzewo nienormalne jabłoni aligatora owocuje. Smakowite jabłko, w którym różnica temperatur dnia i nocy zaostrzyła się do ekstremalnych prefektury Gunma. Powstaje miasto Numata, którego cztery pory roku są jasne, duże, twarde. *
Tak, ogólny obraz się ujawnia, ale algorytm tłumaczenia Google z języka japońskiego na angielski wiele traci. Google od wielu lat oferuje funkcję tłumaczenia, podobnie jak kanadyjska firma internetowa Ryba Babel . Jednak ostatnio, komercyjni twórcy oprogramowania zaczęli badać tłumaczenie poza statyczną stroną internetową lub dokumentem elektronicznym i stosują tę technologię do rozmów internetowych w czasie rzeczywistym. Na początku tego miesiąca firma AvMedia wydała komunikator internetowy tłumacz ma na celu ułatwienie rozmów z przyjaciółmi mówiącymi po niemiecku, hiszpańsku, francusku, włosku i portugalsku osobom anglojęzycznym i odwrotnie (francuski można również przetłumaczyć na niemiecki, a niemiecki na francuski).
Jednak całemu temu oprogramowaniu wciąż brakuje wystarczającej dokładności, aby było przydatne w wymagających sytuacjach, takich jak negocjacje biznesowe lub planowanie wojskowe. Dzieje się tak prawdopodobnie dlatego, że większość komercyjnego oprogramowania stosuje tradycyjne podejście do tłumaczenia maszynowego, mówi Kevin Knight, informatyk z Uniwersytetu Południowej Kalifornii. Instytut Nauk Informacyjnych (ISI) i współzałożyciel firmy z siedzibą w Kalifornii Język tkacz .
Tradycyjnie oprogramowanie do tłumaczenia maszynowego opierało się na algorytmach, które sortują tysiące reguł gramatycznych w celu przetłumaczenia dwóch języków, mówi Knight. Problem, jak wyjaśnia, polega na tym, że tak wiele reguł trzeba pisać ręcznie, podobnie jak wyjątki od tych reguł, a nieścisłość wkrada się, gdy złożone zestawy reguł są ze sobą sprzeczne. Jeśli napiszesz zasadę 5000, czasami coś łamiesz, mówi Knight.
Dzięki Language Weaver i jego badaniom w USC Knight, podobnie jak garstka innych badaczy na całym świecie, podchodzi do problemu inaczej. Zamiast przestrzegać sztywnych reguł gramatycznych, Language Weaver dopasowuje poprawne słowa i frazy w różnych językach na podstawie prawdopodobieństwa, że takie słowa i frazy są poprawne w danym kontekście.
To statystyczne podejście opiera się na dużej liczbie przykładów z już przetłumaczonych dokumentów, mówi Michael Collins, inżynier komputerowy w MIT, który używa tej samej metody w przypadku tworzonej przez siebie aplikacji do wykonywania tłumaczeń z języka niemieckiego na angielski. IBM był pionierem tego podejścia w latach 90., jak mówi, po części dzięki wykorzystaniu ogromnej bazy danych kanadyjskich prac parlamentarnych, opublikowanej zarówno w wersji francuskiej, jak i angielskiej.
Statystyczna różnorodność tłumaczenia maszynowego nie tylko daje lepsze wyniki niż tradycyjna metoda, mówi Knight, ale także oprogramowanie jest zaprojektowane tak, aby samo dalej się doskonalić. Im więcej przetłumaczonych dokumentów napotka oprogramowanie, tym większe prawdopodobieństwo prawidłowego dopasowania fraz. Kilka lat temu, w przypadku naszych języków chińskiego i arabskiego, wszystko, co mogliśmy uzyskać, to podstawowy temat tego, o czym był artykuł, mówi Knight. Teraz rozwiązanie jest na poziomie zdania. [Kontynuacja na następnej stronie ]
-
* Korekta, 18 stycznia 2006, 10:00 czasu EST: W oryginalnej wersji tej historii zacytowaliśmy następujące tłumaczenie strony internetowej Someya Apple Farm: Sad jabłkowy z dużymi drzewami w wieku ponad 50 lat. Naturalne środowisko otaczające Numatę, z ogromną różnicą temperatur między dniem a nocą, tworzy wyjątkowo pyszne jabłko. W rzeczywistości był to fragment tłumaczenia Google własnej angielskiej wersji strony internetowej farmy jabłek, a nie tłumaczenia oryginalnej japońskiej strony Google. Dlatego nie był to dobry przykład słabej jakości niektórych algorytmów tłumaczenia maszynowego. W tej historii zastąpiliśmy tłumaczenie oryginalnej japońskiej witryny przez Google. Dziękujemy naszym czytelnikom za wskazanie błędu. - Wyd.
Amerykańska Agencja Zaawansowanych Projektów Badawczych Obrony (DARPA) jest jednym z głównych sponsorów statystycznego tłumaczenia maszynowego. W sierpniu ubiegłego roku DARPA sponsorowała testy tłumaczenia maszynowego dokumentów chińskich i arabskich; grupa badawcza z Google uzyskała najwyższy wynik, pokonując Instytut Nauk Informacyjnych USC i ramię tłumaczenia maszynowego IBM. Firma Google, która również stosuje podejście statystyczne, mogła mieć przewagę, zauważa Knight, ponieważ mogła korzystać z ogromnej liczby komputerów do chrupania słów i czerpać z całego Internetu bazy danych wstępnie przetłumaczonych dokumentów.
W 2005 r. DARPA ogłosiła również program Global Autonomous Language Exploitation (GALE), mający na celu przyspieszenie komputerowego przetwarzania ogromnej liczby przetłumaczonych dokumentów pozyskanych przez jej macierzysty program, z siedzibą w Filadelfii. Konsorcjum Danych Językowych .** GALE jest obecnie w pierwszym roku i będzie transkrybować mowę z nadawanych źródeł wiadomości i talk-show w języku arabskim, chińskim i angielskim, a także katalogować wiadomości tekstowe, grupy dyskusyjne wiadomości internetowych i blogi w tych językach. Na razie projekt koncentruje się głównie na zbieraniu danych z tych gatunków, a większość prac wykonują naukowcy z wydziału informatyki i inżynierii na Uniwersytecie Pensylwanii.
Ale nawet przy dużej kolekcji przetłumaczonych materiałów nadal będą problemy językowe do rozwiązania. Kolejnym krokiem w badaniach nad tłumaczeniem maszynowym, poza dopasowywaniem słów i fraz, jak mówi Knight, jest wygładzenie niespójności gramatycznych, które powstają, gdy słowa i frazy są ze sobą połączone. To wygładzenie można osiągnąć poprzez zindeksowanie milionów zdań, których struktury zostały naszkicowane na University of Pennsylvania w latach 90. (dane pochodzą z 50 000 zdań w dziennik 'Wall Street ). Podobnie do sposobu, w jaki baza danych pełna słów i fraz pozwala oprogramowaniu do tłumaczenia wybrać najbardziej statystycznie prawdopodobną kombinację słów, te konkretne przykłady gramatyki ze zdań diagramów pomagają oprogramowaniu przypisać prawdopodobieństwo kolejności słów, mówi Collins z MIT.
To postęp w stosunku do tradycyjnej metody, w której reguły gramatyczne były ustalane w algorytmie, mówi. Zamiast przestrzegać zakodowanych konwencji gramatycznych w algorytmie, tak jak w przypadku tradycyjnego tłumaczenia maszynowego, diagramowa baza danych zdań pozwala oprogramowaniu przypisać prawdopodobieństwa i wagę do tych reguł, mówi Collins. [Oprogramowanie] z większym prawdopodobieństwem pozna kontekst, mówi.
Jednak pod pewnymi względami podejście statystyczne będzie tak dobre, jak zwykły tłumacz komunikatorów internetowych. Na przykład właściwe nazwy wciąż potykają się nawet o najlepiej czytanych tłumaczach maszynowych i często są tłumaczone wraz z resztą tekstu. Według jego systemu, Knight przyznaje, że hiszpańska wersja jego nazwiska to nadal Kevin Caballero.
** Korekta, 20 stycznia 2006: Oryginalna wersja tego artykułu, opublikowana 18 stycznia, stwierdzała, że Konsorcjum Danych Językowych zostało uruchomione w 2005 roku. W rzeczywistości konsorcjum zostało uruchomione w 1992 roku, a jego projekt Global Autonomous Language Exploitation został uruchomiony w 2005 r. – wyd.