AI nadal nie ma zdrowego rozsądku, aby zrozumieć ludzki język

Niewyraźne pisanie na ścianie

Niewyraźne pisanie na ścianie Pexels / Jimmy Chan





Do niedawna komputery nie potrafiły tworzyć zdań, które rzeczywiście miały sens. Ale dziedzina przetwarzania języka naturalnego (NLP) poczyniła ogromne postępy i maszyny mogą teraz generować przekonujące fragmenty za naciśnięciem jednego przycisku .

Te postępy były napędzane przez techniki głębokiego uczenia się, które wychwytują statystyczne wzorce w użyciu słów i strukturze argumentów z ogromnych skarbnic tekstu. Ale… nowy papier z Allen Institute of Artificial Intelligence zwraca uwagę na coś, czego wciąż brakuje: maszyny tak naprawdę nie rozumieją, co piszą (lub czytają).

Jest to fundamentalne wyzwanie w wielkim dążeniu do uogólnienia sztucznej inteligencji — ale poza środowiskiem akademickim jest to również istotne dla konsumentów. Chatboty i asystenci głosowi zbudowani na przykład na najnowocześniejszych modelach języka naturalnego stały się interfejsem dla wielu instytucje finansowe , służby zdrowia , oraz agencje rządowe . Bez prawdziwego zrozumienia języka systemy te są bardziej podatne na awarie, spowalniając dostęp do ważnych usług.



Naukowcy zbudowali pracę Wyzwanie schematu Winograd , test stworzony w 2011 roku w celu oceny zdroworozsądkowego rozumowania systemów NLP. Wyzwanie wykorzystuje zestaw 273 pytań obejmujących pary zdań, które są identyczne z wyjątkiem jednego słowa. To słowo, znane jako wyzwalacz, odwraca znaczenie zaimka każdego zdania, jak widać w poniższym przykładzie:

  • Trofeum nie mieści się w brązowej walizce, ponieważ jego zbyt wielki .
  • Trofeum nie mieści się w brązowej walizce, ponieważ jego zbyt mały .

Aby odnieść sukces, system NLP musi ustalić, do której z dwóch opcji odnosi się zaimek. W takim przypadku należałoby wybrać trofeum dla pierwszego i walizkę dla drugiego, aby poprawnie rozwiązać problem.

Test został pierwotnie zaprojektowany z myślą, że takie problemy nie mogą być rozwiązane bez głębszego zrozumienia semantyki. Najnowocześniejsze modele głębokiego uczenia się mogą teraz osiągać dokładność około 90%, więc wydaje się, że NLP zbliżyło się do swojego celu. Ale w swoim artykule, który otrzyma nagrodę Outstanding Paper Award na konferencji AAAI w przyszłym miesiącu, naukowcy kwestionują skuteczność benchmarku, a tym samym poziom postępu, jaki faktycznie poczyniono w tej dziedzinie.



Stworzyli znacznie większy zbiór danych, nazwany WinoGrande, zawierający 44 000 problemów tego samego typu. W tym celu opracowali schemat crowdsourcingowy, aby szybko tworzyć i sprawdzać nowe pary zdań. (Jednym z powodów, dla których zestaw danych Winograd jest tak mały, jest to, że został on stworzony ręcznie przez ekspertów.) Pracownicy Amazon Mechanical Turk stworzyli nowe zdania z wymaganymi słowami wybranymi w drodze procedury randomizacji. Każda para zdań była następnie przekazywana trzem dodatkowym robotnikom i zatrzymywana tylko wtedy, gdy spełniała trzy kryteria: co najmniej dwóch robotników wybrało prawidłowe odpowiedzi, wszystkie trzy uznały opcje za jednoznaczne, a odwołań do zaimków nie można było wydedukować za pomocą prostych skojarzeń wyrazowych.

W ostatnim kroku naukowcy przeprowadzili również zestaw danych za pomocą algorytmu, aby usunąć jak najwięcej artefaktów — niezamierzonych wzorców danych lub korelacji, które mogą pomóc modelowi językowemu w uzyskaniu właściwych odpowiedzi z niewłaściwych powodów. Zmniejszyło to szansę, że model może nauczyć się grać na zbiorze danych.

Kiedy przetestowali najnowocześniejsze modele pod kątem tych nowych problemów, wydajność spadła do od 59,4% do 79,1%. Dla kontrastu, ludzie nadal osiągali 94% dokładności. Oznacza to, że wysoki wynik w oryginalnym teście Winograd jest prawdopodobnie zawyżony. To tylko osiągnięcie specyficzne dla zestawu danych, a nie osiągnięcie ogólnego zadania, mówi Yejin Choi, profesor nadzwyczajny na Uniwersytecie Waszyngtońskim i starszy kierownik ds. badań w AI2, który kierował badaniami.



Choi ma nadzieję, że zestaw danych posłuży jako nowy punkt odniesienia. Ma jednak również nadzieję, że zainspiruje to więcej badaczy do wyjścia poza uczenie głębokie. Wyniki podkreśliły jej, że prawdziwe, zdroworozsądkowe systemy NLP muszą zawierać inne techniki, takie jak ustrukturyzowane modele wiedzy. Jej Poprzednia praca wykazał znaczącą obietnicę w tym kierunku. Musimy jakoś znaleźć inny plan gry, mówi.

Gazeta spotkała się z pewną krytyką. Ernest Davis, jeden z badaczy, którzy pracowali nad oryginalnym wyzwaniem Winograd, mówi, że wiele z przykładowych par zdań wymienionych w artykule ma poważne błędy i mylącą gramatykę. Nie odpowiadają sposobowi, w jaki ludzie mówiący po angielsku używają zaimków, napisał w e-mailu.

Ale Choi zauważa, że ​​naprawdę solidne modele nie powinny wymagać doskonałej gramatyki, aby zrozumieć zdanie. Ludzie, którzy mówią po angielsku jako drugim języku, czasami mieszają gramatykę, ale nadal przekazują jej znaczenie.



Ludzie mogą łatwo zrozumieć, o co chodzi w naszych pytaniach i wybrać poprawną odpowiedź, mówi, odnosząc się do 94% dokładności wyników. Jeśli ludzie powinni być w stanie to zrobić, moje stanowisko jest takie, że maszyny również powinny to robić.

Aby więcej takich artykułów trafiało bezpośrednio do Twojej skrzynki odbiorczej, zapisz się do naszego nominowanego przez Webby biuletynu AI Algorithm . Jest wolne.

ukryć