Nowa poliglota AI Facebooka może tłumaczyć między 100 językami

Słownik angielsko-baskijski

Edurne Chopeitia / Unsplash





Wiadomości: Facebook jest open-sourcing nowy model języka AI o nazwie M2M-100, który może tłumaczyć między dowolną parą spośród 100 języków. Spośród 4450 możliwych kombinacji językowych tłumaczy bezpośrednio 1100 z nich. Jest to w przeciwieństwie do poprzednich modeli wielojęzycznych, które w dużym stopniu opierają się na języku angielskim jako języku pośrednim. Na przykład tłumaczenie z chińskiego na francuski zazwyczaj przechodzi z chińskiego na angielski, a następnie z angielskiego na francuski, co zwiększa prawdopodobieństwo wprowadzenia błędów.

Kuracja danych: Model został przeszkolony na 7,5 miliardach par zdań. Aby skompilować tak duży zestaw danych, naukowcy w dużym stopniu polegali na automatycznej selekcji. Użyli robotów indeksujących do zeskrobywania miliardów zdań z sieci i mieli inny model językowy o nazwie FastText, który identyfikował język. (Nie wykorzystali żadnych danych z Facebooka.) Następnie użyli programu o nazwie LASER 2.0, opracowanego wcześniej przez laboratorium badawcze AI Facebooka, który wykorzystuje uczenie bez nadzoru — uczenie maszynowe, które nie wymaga ręcznie oznaczanych danych — w celu dopasowania zdań w różnych językach przez ich znaczenie.

LASER 2.0 tworzy tak zwane osadzania z dużych, nieustrukturyzowanych zestawów danych zdań. Uczy się na dostępnych przykładach zdań w każdym języku i odwzorowuje ich wzajemne relacje w oparciu o to, jak często i jak blisko siebie są używane. Te osadzania pomagają modelowi uczenia maszynowego przybliżać znaczenie każdego zdania, co z kolei umożliwia LASERowi 2.0 automatyczne łączenie zdań, które mają to samo znaczenie w różnych językach.



Parowanie języków: Naukowcy skupili się na kombinacjach językowych, o które ich zdaniem najczęściej prosili. Pogrupowali języki według podobieństw językowych, geograficznych i kulturowych, wychodząc z założenia, że ​​ludzie mieszkający w tym samym regionie będą się częściej komunikować. Na przykład jedna grupa językowa obejmowała najpopularniejsze języki używane w Indiach, w tym bengalski, hindi, tamilski i urdu. LASER 2.0 następnie ukierunkował wyszukiwanie par zdań na wszystkie możliwe pary językowe w każdej grupie.

Bieżące wyzwania: Języki używane w miejscach takich jak Afryka i Azja Południowo-Wschodnia nadal borykają się z problemami z jakością tłumaczenia, ponieważ dostępnych jest zbyt mało danych językowych, aby można je było wyskrobać z Internetu, mówi Angela Fan, główny badacz projektu. Biorąc pod uwagę poleganie na danych internetowych, naukowcy muszą również opracować techniki identyfikowania i eliminowania wszelkiego ukrytego seksizmu, rasizmu i innych dyskryminujących uprzedzeń. W tej chwili naukowcy zastosowali filtr wulgaryzmów, aby oczyścić niektóre szczególnie rażące języki, ale w większości ograniczają się one do angielskiego.

Tylko badania: Facebook nie ma obecnie planów wykorzystania tego modelu w swoich produktach. M2M-100 jest przeznaczony wyłącznie do celów badawczych, mówi Fan. Ostatecznie jednak celem modelu jest ulepszenie i rozszerzenie istniejących możliwości tłumaczeniowych Facebooka. Aplikacje mogą obejmować komunikację z użytkownikiem (na przykład funkcję, która pozwala ludziom tłumaczyć posty na ich język ojczysty) i być może moderację treści.



ukryć