211service.com
Jak nasze dane kodują systematyczny rasizm
Pani Tech
Często mi mówiono, że dane nie kłamią. Jednak nigdy nie było to moim doświadczeniem. Dla mnie dane prawie zawsze kłamią. Wyniki wyszukiwania grafiki Google dla zdrowej skóry pokazują tylko kobiety o jasnej karnacji, a zapytanie o Czarne dziewczyny wciąż zwracają pornografię . ten Celebryci Zestaw danych o twarzy zawiera etykiety z dużym nosem i dużymi ustami, które są nieproporcjonalnie przypisane do ciemniej karnowanych kobiecych twarzy, takich jak moja. Etykieta modeli przeszkolonych przez ImageNet mnie złą osobą, narkomanem lub porażką. Brakuje zestawów danych do wykrywania raka skóry próbki ciemniejsze rodzaje skóry.
Biała supremacja często pojawia się gwałtownie — w strzały w zatłoczonym Walmart lub usługi kościelne , w ostrej uwadze podsycanego nienawiścią oskarżenia lub brutalnego pchnięcia na ulicę – ale czasami przybiera bardziej subtelną formę, jak te kłamstwa. Kiedy ci z nas, którzy budują systemy sztucznej inteligencji, nadal pozwalają, aby rażące kłamstwo białej supremacji było osadzone we wszystkim, od tego, jak zbieramy dane, po to, jak definiujemy zestawy danych i jak decydujemy się z nich korzystać, oznacza to niepokojącą tolerancję.
Osoby inne niż białe nie są odstające. Na całym świecie jesteśmy norma , a to nie wydaje się być zmiana w najbliższym czasie . Zbiory danych tak specjalnie wbudowane i dla białych przestrzeni reprezentują rzeczywistość zbudowaną, a nie naturalną. Dokładność obliczona pod nieobecność mojego przeżytego doświadczenia nie tylko mnie obraża, ale także naraża mnie na prawdziwe niebezpieczeństwo.
Uszkodzone dane
W pracy naukowej pt Brudne dane, złe prognozy , główna autorka, Rashida Richardson, opisuje alarmujący scenariusz: komisariaty policji podejrzane lub potwierdzone o udział w korupcyjnych, rasistowskich lub w inny sposób nielegalnych praktykach nadal dostarczają swoje dane do rozwoju nowych zautomatyzowanych systemów, które mają pomóc funkcjonariuszom w podejmowaniu decyzji policyjnych.
Celem predykcyjnych narzędzi policyjnych jest wysłanie funkcjonariuszy na miejsce przestępstwa, zanim się ono wydarzy. Zakłada się, że miejsca, w których osoby były wcześniej aresztowane, korelują z prawdopodobieństwem przyszłej nielegalnej działalności. Richardson wskazuje, że to założenie pozostaje niekwestionowane, nawet jeśli te początkowe aresztowania były motywowane rasą lub były nielegalne, czasami obejmowały systemową manipulację danymi, korupcję policji, fałszowanie raportów policyjnych i przemoc, w tym rabowanie mieszkańców, podrzucanie dowodów, wymuszenia, niezgodne z konstytucją przeszukania i inne praktyki korupcyjne. Nawet dane z najgorzej zachowujących się wydziałów policji są nadal używany do informowania o predykcyjnych narzędziach policyjnych .
Jako Raporty Tampa Bay Times podejście to może zapewnić algorytmiczne uzasadnienie dalszego nękania przez policję społeczności mniejszościowych i społeczności o niskich dochodach. Wykorzystywanie takich wadliwych danych do szkolenia nowych systemów osadza w algorytmie udokumentowane wykroczenie policji i utrwala praktyki, o których już wiadomo, że terroryzują osoby najbardziej narażone na takie nadużycia.
Może to wydawać się opisem kilku tragicznych sytuacji. Jest to jednak tak naprawdę norma w uczeniu maszynowym: jest to typowa jakość danych, które obecnie akceptujemy jako naszą niekwestionowaną podstawową prawdę.
Powiązana historia
Czego brakuje w oświadczeniach firm o niesprawiedliwości rasowej? Prawdziwa przyczyna rasizmu. Analiza 63 ostatnich oświadczeń pokazuje, że amerykańskie firmy technologiczne wielokrotnie nakładały odpowiedzialność za niesprawiedliwość rasową na Czarnych.Pewnego dnia GPT-2, wcześniejsza publicznie dostępna wersja zautomatyzowany model generowania języka opracowany przez organizację badawczą OpenAI, zaczął ze mną otwarcie rozmawiać białe prawa. Biorąc pod uwagę proste wskazówki, takie jak biały mężczyzna czy czarna kobieta, tekst wygenerowany przez model wywołałby dyskusję na temat białych aryjskich narodów oraz obcych i nie-białych najeźdźców.
Te diatryby nie tylko zawierały przerażające obelgi, takie jak suka, zdzira, czarnuch, szparka i slanteye”, ale wygenerowany tekst zawierał specyficzną amerykańską białą nacjonalistyczną retorykę, opisującą zagrożenia demograficzne i skręcającą w antysemickie strony przeciwko Żydom i komunistom.
GPT-2 nie myśli sam — generuje odpowiedzi, replikując wzorce językowe zaobserwowane w danych wykorzystanych do opracowania modelu. Ten zestaw danych, nazwany WebText, zawiera ponad 8 milionów dokumentów, co daje łącznie 40 GB tekstu pochodzącego z hiperłączy. Linki te zostały wybrane spośród postów najczęściej popieranych w serwisie społecznościowym Reddit, jako heurystyczny wskaźnik tego, czy inni użytkownicy uznali link za interesujący, edukacyjny, czy po prostu zabawny .
Jednak użytkownicy Reddit – w tym ci, którzy przesyłają i głosują – są wiadomo, że obejmują białych supremacjonistów . Przez lata platforma była obfituje w rasistowski język i dozwolone linki do treści wyrażające ideologię rasistowską. I chociaż są dostępne praktyczne opcje aby ograniczyć to zachowanie na platformie, pierwsze poważne próby podejmij działanie , przez ówczesną dyrektorkę generalną Ellen Pao w 2015 r., zostały źle przyjęte przez społeczność i doprowadziły do intensywnych nękanie i luz .
Niezależnie od tego, czy mają do czynienia z krnąbrnymi gliniarzami, czy krnąbrnymi użytkownikami, technolodzy decydują się pozwolić temu konkretnemu opresyjnemu światopoglądowi utrwalić się w zestawach danych i zdefiniować naturę modeli, które opracowujemy. Sam OpenAI przyznał się do ograniczeń związanych z pozyskiwaniem danych z Reddit, zauważając, że wiele złośliwych grup wykorzystuje te fora dyskusyjne do organizowania się . Jednak organizacja również nadal korzysta z zestawu danych pochodzącego z Reddit , nawet w kolejnych wersjach jego modelu językowego. Niebezpiecznie wadliwy charakter źródeł danych jest skutecznie odrzucany ze względu na wygodę, pomimo konsekwencji. Złośliwe zamiary nie są konieczne, aby tak się stało, chociaż pewna bezmyślna bierność i zaniedbanie są.
Małe białe kłamstwa
Biała supremacja to fałszywe przekonanie, że biali ludzie są lepsi od innych ras. Nie jest to zwykłe nieporozumienie, ale ideologia zakorzeniona w oszustwo . Rasa jest pierwszym mitem, wyższość następnym. Zwolennicy tej ideologii uparcie trzymają się wynalazku, który ich uprzywilejowuje.
Słyszałem, jak to kłamstwo zmiękcza język od Wojna z narkotykami do epidemia opioidów i winy zdrowie psychiczne lub gry wideo za działania białych napastników, nawet jeśli przypisuje lenistwo oraz przestępczość ofiarom innym niż biały. Zauważam, jak wymazuje tych, którzy wyglądają jak ja, i obserwuję, jak rozgrywa się w niekończącej się paradzie bladych twarzy, od których nie mogę uciec – w filmie, na okładkach magazynów i na rozdaniu nagród.
Zbiory danych tak specjalnie wbudowane i dla białych przestrzeni reprezentują rzeczywistość zbudowaną, a nie naturalną.
Ten cień podąża za każdym moim ruchem, nieprzyjemny chłód na karku. Kiedy słyszę morderstwo, nie widzę tylko policjanta z jego kolano na gardle albo zagubiony strażnik z pistoletem u jego boku – to gospodarka, która dusi nas, choroba, która słabnie my i rząd, który ucisza nas.
Powiedz mi – jaka jest różnica między nadmierną polityką w dzielnicach mniejszości a uprzedzeniami algorytm, który wysłał tam funkcjonariuszy ? Jaka jest różnica między segregowanym systemem szkolnym a dyskryminacją? algorytm oceniania ? Między lekarzem, który nie słucha, a… algorytm, który odmawia Ci łóżka szpitalnego ? Nie ma systematycznego rasizmu niezależnie od naszego wkładu algorytmicznego, od ukrytej sieci wdrożeń algorytmicznych, które regularnie załamują się na tych, którzy i tak są najbardziej bezbronni.
Opieranie się determinizmowi technologicznemu
Technologia nie jest od nas niezależna; jest przez nas tworzony i mamy nad nim pełną kontrolę. Dane są nie tylko arbitralne polityczny — istnieje specyficzna toksyczna i źle poinformowana polityka, której naukowcy zajmujący się danymi beztrosko pozwalają na infiltrację naszych zbiorów danych. Jedną z nich jest biała supremacja.
Włożyliśmy już siebie i nasze decyzje w wynik — nie ma neutralnego podejścia. Nie ma żadnej przyszłej wersji danych, która byłaby magicznie bezstronna. Dane zawsze będą subiektywną interpretacją czyjejś rzeczywistości, konkretną prezentacją celów i perspektyw, które w tym momencie wybieramy priorytetowo. To jest siła, którą posiadają ci z nas odpowiedzialni za pozyskiwanie, selekcję i projektowanie tych danych oraz opracowywanie modeli interpretujących informacje. Zasadniczo nie ma zamiany uczciwości na dokładność – to mityczna ofiara, wymówka, by nie przyznać się do naszej roli w definiowaniu wydajności z wyłączeniem innych.
Ci z nas, którzy budują te systemy, wybiorą, który… subreddity i źródła internetowe do indeksowania , który języki do użyj lub zignoruj, które zestawy danych do usuń lub zaakceptuj . Najważniejsze, my wybrać, do kogo zastosujemy te algorytmy , oraz które cele optymalizujemy dla. Wybieramy tworzone przez nas etykiety, dane, które pobieramy, stosowane przez nas metody. Wybieramy, kogo zapraszamy jako naukowców, inżynierów i badaczy danych — i kogo my nie . Było wiele możliwości zaprojektowania zbudowanej przez nas technologii i wybraliśmy tę. Jesteśmy odpowiedzialni.
Dlaczego więc nie możemy być bardziej ostrożni? Kiedy w końcu nabierzemy nawyku ujawniania? pochodzenie danych , usuwanie problematycznych zbiorów danych i wyraźnie określając ograniczenia zakresu każdego modelu ? W którym momencie możemy potępić tych, którzy działają z wyraźny program białej supremacji , i weź poważne działania do załączenia?
Niepewna droga naprzód
Rozproszony przez kondolencje firmowe , abstrakcyjne rozwiązania techniczne i artykułowane teorie społeczne, widziałem, jak rówieśnicy gratulują sobie niewidzialnego postępu. W końcu zazdroszczę im, bo mają wybór w tym samym świecie, w którym ja, jak każdy Murzyn, nie mogę zrezygnować z dbania o to.
Kiedy Czarni umierają teraz w kakofonii klęsk żywiołowych i nienaturalnych, wielu moich kolegów wciąż jest bardziej podekscytowanych najnowszym produktem lub kosmiczną premierą niż wstrząsający horror rzeczywistości, która zapiera mi dech w piersiach.
Faktem jest, że sztuczna inteligencja nie działa, dopóki nie zadziała dla nas wszystkich.
Od lat obserwuję, że ten problem jest wychwalany jako ważny, ale jasne jest, że radzenie sobie z nim jest nadal postrzegane jako niepriorytetowe, miło mieć działanie uzupełniające – zawsze drugorzędne w stosunku do jakiejś definicji funkcjonalności modelu, która mnie nie obejmuje.
Modele wyraźnie nadal walczą, aby sprostać tym wyzwaniom związanym z uprzedzeniami obchodzony jako przełom , a ludzie na tyle odważni, by mówić o ryzyku uciszyć się lub gorzej . Istnieje wyraźne kulturowe samozadowolenie z rzeczy jak zwykle i chociaż rozczarowujące, nie jest to szczególnie zaskakujące w dziedzinie, w której zdecydowana większość po prostu nie rozumie stawki.
Faktem jest, że sztuczna inteligencja nie działa, dopóki nie zadziała dla nas wszystkich. Jeśli mamy nadzieję kiedykolwiek zająć się niesprawiedliwością rasową, musimy przestać przedstawiać nasze zniekształcone dane jako podstawową prawdę. Nie ma racjonalnego i sprawiedliwego świata, w którym zatrudnianie narzędzi systematycznie wyklucza kobiety z ról technicznych, czy gdzie samochody autonomiczne częściej uderzają w pieszych o ciemniejszej karnacji . Prawda jakiejkolwiek rzeczywistości, którą rozpoznaję, nie znajduje się w tych modelach ani w zestawach danych, które je informują.
Społeczność uczenia maszynowego nadal akceptuje pewien poziom dysfunkcji, o ile dotyczy to tylko niektórych grup. To wymaga świadomej zmiany, a to wymaga tyle samo wysiłku, co każda inna walka z systematycznym uciskiem. W końcu kłamstwa zawarte w naszych danych nie różnią się zbytnio od wszelkich innych kłamstw, o których mówiła biała supremacja. W ten sposób będą wymagały tyle samo energii i inwestycji, aby przeciwdziałać.
Deborah Raji jest stypendystką Mozilli zainteresowaną audytowaniem i oceną algorytmiczną. Pracowała nad kilkoma nagradzanymi projektami, aby zwrócić uwagę na przypadki stronniczości w wizji komputerowej i poprawić praktyki dokumentacji w uczeniu maszynowym.