211service.com
Pomieszane zdania pokazują, że AI nadal tak naprawdę nie rozumie języka
Pani Tech | Unsplash / Brett Jordan
Wiele Sztuczna inteligencja, która wydaje się rozumieć język i osiąga lepsze wyniki niż ludzie we wspólnym zestawie zadań ze zrozumieniem, nie zauważają, kiedy słowa w zdaniu są pomieszane, co pokazuje, że w ogóle nie rozumiem języka . Problem tkwi w sposobie uczenia systemów przetwarzania języka naturalnego (NLP); wskazuje również na sposób na ich ulepszenie.
Powiązana historia
Sposób, w jaki trenujemy sztuczną inteligencję, jest zasadniczo wadliwy Proces używany do budowy większości modeli uczenia maszynowego, których używamy dzisiaj, nie pozwala stwierdzić, czy będą działać w prawdziwym świecie, czy nie – i to jest problem.Naukowcy z Auburn University w Alabamie i Adobe Research odkrył wadę kiedy próbowali skłonić system NLP do generowania wyjaśnień dotyczących jego zachowania, na przykład dlaczego twierdził, że różne zdania oznaczają to samo. Kiedy przetestowali swoje podejście, zdali sobie sprawę, że przetasowanie słów w zdaniu nie ma żadnego wpływu na wyjaśnienia. Jest to ogólny problem wszystkich modeli NLP, mówi Anh Nguyen z Auburn University, który kierował pracami.
Zespół przyjrzał się kilku najnowocześniejszym systemom NLP opartym na BERT (model językowy opracowany przez Google, który stanowi podstawę wielu najnowszych systemów, w tym GPT-3). Wszystkie te systemy osiągają lepsze wyniki niż ludzie KLEJ (Ogólna ocena zrozumienia języka), standardowy zestaw zadań zaprojektowanych do testowania rozumienia języka, takich jak dostrzeganie parafraz, ocenianie, czy zdanie wyraża pozytywne lub negatywne nastroje oraz werbalne rozumowanie.
Człowiek gryzie psa: Odkryli, że te systemy nie były w stanie stwierdzić, kiedy słowa w zdaniu zostały pomieszane, nawet jeśli nowy porządek zmienił znaczenie. Na przykład systemy poprawnie wykryły, że zdania Czy marihuana powoduje raka? i W jaki sposób palenie marihuany może powodować raka płuc? były parafrazami. Ale byli jeszcze bardziej pewni, że palisz raka, jak marihuana może dać płuca? i płuca mogą dać palenie marihuany, jak masz raka? oznaczało to samo. Systemy zdecydowały również, że zdania o przeciwnych znaczeniach — na przykład Czy marihuana powoduje raka? i Czy rak powoduje marihuanę? — zadawali to samo pytanie.
Jedyne zadanie, w którym liczyła się kolejność wyrazów, to takie, w którym modele musiały sprawdzić strukturę gramatyczną zdania. W przeciwnym razie od 75% do 90% odpowiedzi testowanych systemów nie zmieniło się po przetasowaniu słów.
Co się dzieje? Modele wydają się wyłapywać kilka kluczowych słów w zdaniu, niezależnie od kolejności ich występowania. Nie rozumieją języka tak jak my, a GLUE — bardzo popularny wzorzec — nie mierzy prawdziwego użycia języka. W wielu przypadkach zadanie, na którym szkolony jest model, nie zmusza go do dbania o szyk wyrazów lub ogólnie składnię. Innymi słowy, GLUE uczy modele NLP przeskakiwać przez obręcze.
Wielu badaczy zaczęło używać trudniejszego zestawu testów o nazwie SuperGLUE, ale Nguyen podejrzewa, że będzie on miał podobne problemy.
Ten problem został również zidentyfikowany przez Yoshua Bengio i współpracowników, którzy stwierdzili, że zmiana kolejności słów w rozmowie czasami nie zmieniało odpowiedzi udzielanych przez chatboty. I znalazł zespół z Facebook AI Research przykłady tego dzieje się z chińskim . Zespół Nguyena pokazuje, że problem jest powszechny.
Czy to ma znaczenie? To zależy od aplikacji. Z jednej strony przydałaby się sztuczna inteligencja, która nadal rozumie, kiedy robisz literówkę lub mówisz coś zniekształconego, tak jak mógłby to zrobić inny człowiek. Ale ogólnie rzecz biorąc, kolejność słów jest kluczowa podczas ustalania znaczenia zdania.
naprawić Jak to zrobić? Dobra wiadomość jest taka, że naprawa może nie być zbyt trudna. Naukowcy odkryli, że zmuszenie modelu do skupienia się na kolejności wyrazów poprzez nauczenie go wykonywania zadania, w którym kolejność wyrazów ma znaczenie (takiego jak wykrywanie błędów gramatycznych), poprawiło również wydajność modelu w innych zadaniach. Sugeruje to, że poprawianie zadań, do wykonywania których są trenowane modele, sprawi, że będą one ogólnie lepsze.
Wyniki Nguyena to kolejny przykład tego, jak modele często nie spełniają oczekiwań tego, do czego ludzie wierzą, że są zdolni. Uważa, że to podkreśla, jak trudno jest zrobić AI, które rozumieją i rozumują jak ludzie . Nikt nie ma pojęcia, mówi.