211service.com
Kolekcja 13 500 nastygramów może przyspieszyć wojnę z trollami

Wizualizacja postów na stronach dyskusyjnych Wikipedii w styczniu pokazuje częstotliwość ataków osobistych, zaznaczoną na czerwono.
Mizoginia, rasizm, wulgaryzmy — zbiór ponad 13 500 osobistych ataków online ma to wszystko.
Nastygramy pochodziły ze stron dyskusyjnych Wikipedii. Kolekcja, wraz z ponad 100 000 innych łagodnych postów, został wydany przez badaczy z Alphabet i Wikimedia Foundation, organizacji non-profit stojącej za Wikipedią. Twierdzą, że dane zwiększą wysiłki na rzecz szkolenia oprogramowania w zakresie rozumienia i nadzorowania nękania w Internecie.
Naszym celem jest sprawdzenie, w jaki sposób możemy pomóc ludziom dyskutować na najbardziej kontrowersyjne i ważne tematy w całym Internecie w produktywny sposób, mówi Lucas Dixon, główny naukowiec w firmie badawczej. Puzzle , grupa wewnątrz Alphabet, która buduje technologię w służbie sprawom takim jak wolność słowa i walka z korupcją (patrz „Gdyby tylko sztuczna inteligencja mogła nas uratować przed nami”).
Badacze Jigsaw i Wikimedia skorzystali z usługi crowdsourcingowej, aby przeszukać ponad 115 000 wiadomości opublikowanych na stronach dyskusyjnych Wikipedii, sprawdzając, czy nie były to osobiste ataki, ponieważ określone przez zasady wspólnoty . Współpracownicy wykorzystali już te dane do trenowania algorytmów uczenia maszynowego, które rywalizują z pracownikami crowdsourcingowymi w wykrywaniu ataków osobistych. Kiedy przejrzeli pełny zbiór 63 milionów postów dyskusyjnych opublikowanych przez redaktorów Wikipedii, odkryli, że tylko około jeden na 10 ataków spowodował podjęcie działań przez moderatorów.
Fundacja Wikimedia wykonana ograniczenie nękania wśród redaktorów Wikipedii priorytet w zeszłym roku. Polityka ta uzupełnia istniejące wysiłki na rzecz złagodzenia kłującej i biurokratycznej atmosfery społeczności Wikipedii, która, jak stwierdzono, zniechęca nowych współtwórców do uczestnictwa. Oba problemy mogą pomóc wyjaśnić, dlaczego liczba redaktorów spadła i walczyła o rozszerzenie uczestnictwa poza podstawową demograficzną męską, zachodnią grupę demograficzną (zob. The Decline of Wikipedia ).
Jigsaw i Wikimedia Foundation nie są pierwszymi, które badają nadużycia w Internecie, ani nie są pierwszymi, których celem jest zaprojektowanie oprogramowania, które może je wykrywać i zwalczać. Jednak zbiory komentarzy oznaczonych jako oznaczające posty nękające i nie nękające — które są potrzebne do trenowania oprogramowania do uczenia maszynowego — były rzadkie, mówi Ellery Wulczyn , badacz danych z Wikimedia Foundation.
Szacuje, że zbiór osobistych ataków i komentarzy z Wikipedii jest od 10 do 100 razy większy niż te dostępne wcześniej. Algorytmy uczenia maszynowego potrzebują dużej liczby oznakowanych przykładów, aby nauczyć się, jak dokładnie filtrować dane.
Nadal nie jest jednak jasne, czy algorytmy wyszkolone do wykrywania nadużyć mogą zostać wykorzystane jako skuteczne moderatory. Oprogramowanie jest dalekie od zrozumienia wszystkich niuansów języka. Niektórzy ludzie mogą być zmotywowani do dostrojenia obraźliwego języka, aby uniknąć wykrycia, mówi Wulczyn z Wikimedia. Gdybyśmy mieli budować interwencje, z którymi ludzie mają wrogi związek, nie wiemy, co by się stało, mówi.