Książki kucharskie, Wikipedia i automatycznie generowany spanglish: Dziwaczne sposoby gromadzenia danych przez badaczy AI

Joe Raedle/Getty Images





Dane są paliwem napędzającym rozwój sztucznej inteligencji i dają nam wiele postępów, które uważamy za oczywiste: napisy na YouTube, rekomendacje muzyczne Spotify, te przerażające reklamy, które śledzą Cię w Internecie.

Ale jeśli chodzi o zbieranie przydatnych danych, eksperci AI często muszą wykazać się kreatywnością. Weźmy na przykład przetwarzanie języka naturalnego (NLP), poddziedzinę sztucznej inteligencji, która koncentruje się na uczeniu komputerów, jak analizować ludzki język. Na dorocznej Konferencji Metod Empirycznych w NLP eksperci przedstawili szeroki zakres badań, które opierały się na informacjach zebranych na kilka pomysłowych sposobów. Poniżej podsumowaliśmy cztery z naszych ulubionych projektów.

HISZPAŃSKI



Wśród artykułów dotyczących wielojęzycznego NLP w tym roku Microsoft przedstawiony jeden który skupiał się na przetwarzaniu języka o mieszanym kodzie — tekstu lub mowy, które płynnie przełączają się między dwoma językami. Biorąc pod uwagę, że ponad połowa światowej populacji jest wielojęzyczna, ten niedostatecznie zbadany obszar jest ważny.

Badacze zaczęli od Spanglish (hiszpańskiego i angielskiego), ale brakowało im tekstu w języku Spanglish, aby wyszkolić maszynę. Tak powszechne, jak mieszanie kodów w rozmowach wielojęzycznych, rzadko można je znaleźć w tekście. Aby sprostać temu wyzwaniu, naukowcy napisali program, który wstawiał angielski do translatora Microsoft Bing i wplatał kilka fraz z hiszpańskiego tłumaczenia z powrotem do oryginalnego tekstu. Program upewniał się, że zamieniane słowa i frazy mają to samo znaczenie. Po prostu byli w stanie stworzyć tyle Spanglish, ile potrzebowali.

Powstały model NLP przewyższał poprzednie modele, które były trenowane osobno tylko w języku hiszpańskim i angielskim. Naukowcy mają nadzieję, że ich praca ostatecznie pomoże w opracowaniu wielojęzycznych chatbotów, które będą w stanie mówić w naturalny sposób w języku o mieszanym kodzie.



KSIĄŻKI KUCHARSKIE

Przepisy świetnie nadają się do przyrządzania żywności, ale mogą również stanowić pożywienie dla maszyn. Wszystkie stosują podobny schemat krok po kroku i często zawierają obrazy odpowiadające tekstowi — doskonałe źródło uporządkowanych danych do uczenia maszyn rozumienia tekstu i obrazów w tym samym czasie. Dlatego naukowcy z Uniwersytetu Hacettepe w Turcji skompilował gigantyczny zestaw danych z około 20 000 ilustrowanych przepisów kulinarnych. Mają nadzieję, że będzie to nowe źródło analizy porównawczej wydajności wspólnego rozumienia obrazu i tekstu.

To, co nazywają RecipeQA, będzie opierać się na wcześniejszych badaniach, które koncentrowały się oddzielnie na czytaniu maszynowym i rozumieniu wizualnym. W pierwszym przypadku maszyna musi zrozumieć pytanie i powiązany fragment, aby znaleźć odpowiedź; w drugim, zamiast tego szuka odpowiedzi na powiązanym zdjęciu. Umieszczenie tekstu i zdjęć obok siebie zwiększa złożoność zadania, ponieważ zdjęcia i tekst mogą udostępniać uzupełniające się lub zbędne informacje.



KRÓTSZE ZDANIA

Google chce, aby sztuczna inteligencja urozmaiciła twoją prozę. W tym celu badacze stworzyli tam największy w historii zbiór danych do dzielenia długich zdań na mniejsze o równoważnym znaczeniu. Gdzie można znaleźć ogromne ilości danych do edycji? Oczywiście Wikipedia.

Z bogatej historii edycji Wikipedii zespół badawczy wyodrębnił przypadki, w których ludzie dzielą długie zdania. Rezultat: 60 razy więcej wyraźnych przykładów z podziałem zdań i 90 razy więcej słów niż w poprzednim zestawie danych porównawczych dla tego zadania. Zestaw danych obejmuje również wiele języków.



Kiedy wytrenowali model uczenia maszynowego na swoich nowych danych, osiągnęli 91% dokładności. (Tutaj procent odzwierciedla proporcję zdań, które zachowały znaczenie i poprawność gramatyczną po przepisaniu.) Dla porównania, model wytrenowany na wcześniejszych danych osiągnął tylko 32% dokładność. Kiedy połączyli oba zestawy danych i wytrenowali inny model, osiągnął 95% dokładność. Naukowcy doszli do wniosku, że przyszłe ulepszenia można wprowadzić, znajdując jeszcze więcej źródeł danych.

NASTAWIENIE SPOŁECZNOŚCIOWE

Badania wykazały, że język, który generujemy, może być świetnym predyktorem naszej rasy, płci i wieku, nawet jeśli ta informacja nigdy nie jest wyraźnie podana. Mając to na uwadze, naukowcy z Uniwersytetu Bar-Ilan w Izraelu i Instytutu Sztucznej Inteligencji im. Allena próbowali wykorzystać sztuczną inteligencję do odchylenia tekstu usunięcie tych wbudowanych wskaźników .

Aby zdobyć wystarczającą ilość danych, które mogłyby reprezentować wzorce językowe w różnych grupach demograficznych, zwrócili się do Twittera. Zebrali kilka tweetów od użytkowników, które były równomiernie rozłożone między nie-Latynosi białych i czarnych nie-Latynosi; między mężczyznami i kobietami; oraz między osobami w wieku 18-34 i powyżej 35 lat.

Następnie zastosowali podejście kontradyktoryjne – zestawili ze sobą dwie sieci neuronowe – aby sprawdzić, czy mogą automatycznie usunąć nieodłączne wskaźniki demograficzne zawarte w tweetach. Jedna sieć neuronowa próbowała przewidzieć dane demograficzne, podczas gdy druga próbowała dostosować tekst, aby był całkowicie neutralny, w celu zmniejszenia dokładności przewidywania pierwszego modelu do 50% (lub szansy). Podejście to ostatecznie złagodziło znacznie, ale nie całkowicie, wskaźniki rasy, płci i wieku.

ukryć