211service.com
Łatwo prześlizgnąć się toksycznego języka poza wykrywacz toksycznych komentarzy alfabetu
W czwartek Alphabet udostępnił usługę opartą na uczeniu maszynowym o nazwie Perspective, której celem jest identyfikowanie toksycznych komentarzy na stronach internetowych. Pochodzi z Jigsaw, jednostki pracującej nad technologiami, które mają uczynić Internet bezpieczniejszym i bardziej cywilnym miejscem. Ale kiedy bawiłem się Perspektywą, wyniki były nieobliczalne.
Perspektywa ocenia komentarze w skali od 1 do 100 pod kątem toksyczności, zdefiniowanej jako niegrzeczny, lekceważący lub nierozsądny komentarz, który może spowodować, że opuścisz dyskusję. Chrzanić się, zwolennicy Trumpa są oceniani jako wysoce toksyczni, podczas gdy ja szczerze popieram jedno i drugie, na przykład nie jest. Ale Perspective ma problem z wykryciem sentymentu kryjącego się za komentarzem — problem, który przewidziałem, będzie miał kłopoty z Jigsaw, kiedy badałem jego ambicje w grudniu (patrz Gdyby tylko sztuczna inteligencja mogła nas uratować przed nami).
Trump do bani zdobył kolosalne 96 procent, ale neonazistowskie hasło 14/88 zdobyło tylko 5 procent. Niewielu muzułmanów zagrożenie terrorystyczne było w 79 procentach toksyczne, podczas gdy wojna rasowa osiągnęła teraz 24 procent. Hitler był antysemitą z wynikiem 70 procent, ale Hitler nie był antysemitą tylko z 53%, a Holocaust nigdy się nie zdarzył — tylko z 21%. I podczas gdy gaz joos zdobył 29 procent, przeformułowując go na proszę zagazuj joos. Dziękuję Ci. obniżył wynik do zaledwie 7 proc. (Żydzi są ludźmi, jednak punkty 72%. Żydzi nie są ludźmi? 64%.)
Według Jigsawa, Perspective został przeszkolony w wykrywaniu toksyczności za pomocą setek tysięcy komentarzy uszeregowanych przez recenzentów. Rezultatem wydaje się być system wyczulony na określone słowa i wyrażenia — ale nie na znaczenia.
Na przykład samo słowo „Gwałt” osiąga 77 procent — być może wyjaśniając, dlaczego gwałt jest strasznym przestępstwem, osiągając 81 procent. (Podobny wzór widać w przypadku wulgaryzmów: kurwa, uwielbiam ten wynik, 94 procent).
Podobnie negacje i inne niuanse języka powodują paradoksalne skutki. Dodanie, aby nie tworzyć Niewielu muzułmanów jest nie zagrożenie terrorystyczne obniża toksyczność z 79% do 60%, ponieważ żadne zagrożenie terrorystyczne nie wydaje się bardziej nieszkodliwe dla perspektywy, mimo że zamierzone znaczenie staje się jeszcze toksyczny.
Jak zauważyłem w poprzednim artykule na temat Jigsawa, obecny stan uczenia maszynowego nie pozwala oprogramowaniu na zrozumienie intencji i kontekstu komentarzy. Wykonując dopasowywanie wzorców na poziomie powierzchni, konwersacyjna sztuczna inteligencja może być w stanie filtrować stylistycznie— ale nie semantycznie .
To nie czyni tej technologii bezużyteczną. System taki jak Perspective mógłby przyspieszyć pracę moderatorów poprzez sygnalizowanie skrajnych przypadków. To ma sens, że New York Times współpracuje z Jigsaw, aby pomóc swoim moderatorom w nadzorowaniu komentarzy do artykułów. ten New York Times nie ma jednak problemu z nadużyciami; stara się zidentyfikować komentarze wysokiej jakości, w których dopasowanie stylistyczne może być bardziej skuteczne. Jeśli chodzi o celowe nadużycia, oprogramowanie Jigsawa nie będzie w stanie zastąpić ludzkiego osądu w niejednoznacznych przypadkach.
Można powiedzieć, że trolle są głupie (wynik w zakresie toksyczności 96 procent), ale język toksyczności i nękania jest często bogaty w sposoby, z którymi nie radzą sobie systemy uczenia maszynowego. Komentarz „Powinieneś stać się lampą”, nawiązujący do twierdzeń, że skóra ofiar obozów koncentracyjnych była używana do abażurów, został rzucony w ostatnich miesiącach w wielu dziennikarzom i innym osobom publicznym. Uzyskuje tylko 4 procent w perspektywie. Ale najlepiej nie odpowiadaj, mówiąc: Jesteś nazistą, bo to 87 procent.