211service.com
AI wciąż jest do niczego z moderowaniem mowy nienawiści
Pani Tech | Getty, Unsplash
Mimo wszystkich ostatnich postępów w technologii sztucznej inteligencji językowej nadal ma problemy z jedną z najbardziej podstawowych aplikacji. w nowe badanie , naukowcy przetestowali cztery najlepsze systemy sztucznej inteligencji do wykrywania mowy nienawiści i odkryli, że każdy z nich na różne sposoby zmagał się z rozróżnieniem toksycznych i nieszkodliwych zdań.
Wyniki nie są zaskakujące — tworzenie sztucznej inteligencji, która rozumie niuanse języka naturalnego, jest trudne. Ważny jest jednak sposób, w jaki badacze zdiagnozowali problem. Opracowali 29 różnych testów ukierunkowanych na różne aspekty mowy nienawiści, aby dokładniej wskazać, gdzie zawodzi każdy system. Ułatwia to zrozumienie, jak przezwyciężyć słabości systemu i już pomaga jednej komercyjnej usłudze ulepszyć jej sztuczną inteligencję.
Autorzy badania, kierowani przez naukowców z Uniwersytetu Oksfordzkiego i Instytutu Alana Turinga, przeprowadzili wywiady z pracownikami 16 organizacji non-profit, którzy pracują nad nienawiścią w Internecie. Zespół wykorzystał te wywiady do stworzenia taksonomii 18 różnych rodzajów mowy nienawiści, koncentrując się wyłącznie na języku angielskim i mowie nienawiści opartej na tekście, w tym mowie uwłaczającej, obraźliwych i groźnym języku. Zidentyfikowali również 11 scenariuszy nienadających się do nienawiści, które często potykają moderatorów AI, w tym użycie wulgaryzmów w nieszkodliwych wypowiedziach, oszczerstwa, które zostały odzyskane przez społeczność, do której skierowano przemówienie).
Dla każdej z 29 różnych kategorii stworzyli ręcznie dziesiątki przykładów i użyli szablonowych zdań, takich jak Nienawidzę [TOŻSAMOŚĆ] lub Jesteś dla mnie tylko [SLUR], aby wygenerować te same zestawy przykładów dla siedmiu chronionych grup — tożsamości, które są prawnie chronione przed dyskryminacją na mocy prawa USA. Oni open-source ostateczny zestaw danych o nazwie HateCheck, który zawiera łącznie prawie 4000 przykładów.
Następnie badacze przetestowali dwie popularne usługi komercyjne: Google Jigsaw’s Perspektywiczny interfejs API i Dwie Kapelusze SiftNinja . Oba pozwalają klientom oznaczać treści naruszające zasady w postach lub komentarzach. Perspektywa jest w szczególności wykorzystywana przez platformy takie jak Reddit i organizacje informacyjne, takie jak The New York Times i Wall Street Journal. Oznacza i nadaje priorytet postom i komentarzom do oceny przez człowieka na podstawie pomiaru toksyczności.
Podczas gdy SiftNinja był zbyt pobłażliwy w kwestii mowy nienawiści, nie wykrywając prawie wszystkich jej odmian, Perspektywa była zbyt trudna. Znakomicie sprawdzał się w wykrywaniu większości z 18 kategorii nienawistnych, ale także oznaczał większość nienawistnych, takich jak odzyskane oszczerstwa i kontrargumenty. Naukowcy odkryli ten sam wzorzec, testując dwa modele akademickie Google, które reprezentują jedne z najlepszych dostępnych technologii sztucznej inteligencji językowej i prawdopodobnie służą jako podstawa dla innych komercyjnych systemów moderacji treści. Modele akademickie wykazały również nierówne wyniki w chronionych grupach — błędną klasyfikację nienawiści skierowanej do niektórych grup częściej niż do innych.
Powiązana historia
Jak Facebook uzależnił się od rozpowszechniania dezinformacji Algorytmy sztucznej inteligencji firmy dały jej nienasycony nawyk kłamstw i mowy nienawiści. Teraz człowiek, który je zbudował, nie może rozwiązać problemu.
Wyniki wskazują na jeden z najtrudniejszych aspektów wykrywania mowy nienawiści w oparciu o sztuczną inteligencję: Umiarkowane za mało i nie rozwiążesz problemu; moderować zbyt mocno i można by cenzurować język, którego używają marginalizowane grupy, aby wzmocnić swoją pozycję i się bronić: Nagle karałbyś te społeczności, które najczęściej są celem nienawiści, mówi dr Paul Röttger. kandydat w Oxford Internet Institute i współautor artykułu.
Lucy Vasserman, główny inżynier oprogramowania Jigsaw, mówi, że Perspective pokonuje te ograniczenia, polegając na ludzkich moderatorach przy podejmowaniu ostatecznej decyzji. Ale ten proces nie jest skalowalny dla większych platform. Jigsaw pracuje teraz nad funkcją, która zmieniałaby priorytety postów i komentarzy w oparciu o niepewność Perspektywy — automatycznie usuwając treści, które z pewnością są nienawistne, i oznaczając treści graniczne dla ludzi.
Co jest ekscytujące w nowym badaniu, mówi, to to, że zapewnia precyzyjny sposób oceny stanu wiedzy. Wiele rzeczy, które zostały podkreślone w tym artykule, takich jak odzyskane słowa, które są wyzwaniem dla tych modeli – to coś, co jest znane w branży, ale naprawdę trudno jest oszacować, mówi. Jigsaw używa teraz HateCheck, aby lepiej zrozumieć różnice między swoimi modelami i obszary, w których należy je ulepszyć.
Naukowcy również są podekscytowani badaniami. Ten artykuł daje nam ładne, czyste źródło do oceny systemów branżowych, mówi Maarten Sap, badacz języka AI na Uniwersytecie Waszyngtońskim, który pozwala firmom i użytkownikom prosić o ulepszenia.
Zgadza się z tym Thomas Davidson, adiunkt socjologii na Uniwersytecie Rutgers. Ograniczenia modeli językowych i bałagan językowy oznaczają, że zawsze będą kompromisy między niedostateczną i nadmierną identyfikacją mowy nienawiści, mówi. Dodaje, że zestaw danych HateCheck pomaga uwidocznić te kompromisy.