AI pokonuje Hivemind

Amazon's Mechancial Turk to szczytowe osiągnięcie w prawie anonimowym outsourcingu: każde zadanie, które można wykonać online, można wykonać dzięki połączeniu zautomatyzowanego rynku i ludzkiej pracy. Ci, którzy zarejestrują się, aby wykonywać zadania - Turcy - wypłacane są płace tak niskie, jak grosze za pracę, aby robić wszystko, od wprowadzania danych do Sztuka ludowa .





(DC) Jim Linwood

Mechanical Turk jest przeznaczony do wykonywania zadań łatwych dla ludzi i trudnych dla maszyn, takich jak kategoryzacja lub identyfikacja treści obrazów. Problem dla Amazona i wszystkich jego naśladowców polega jednak na tym, że maszyny stają się coraz lepsze w wielu zadaniach, podczas gdy ludzie na Mechanical Turk, z powodów, które omówię w jutrzejszym poście, stają się coraz gorsi.

Ostatnio, na przykład, badacze pracujący w witrynie internetowej Yelp z recenzjami opublikowali a papier (pdf) na temat ich doświadczenia w dopasowywaniu tysięcy mechanicznych Turkerów przeciwko nadzorowany algorytm uczenia .

Wyniki nie były ładne: aby znaleźć populację Turków, których praca była zadowalająca, naukowcy najpierw użyli Mechanical Turk do przeprowadzenia testu dla 4660 kandydatów. Był to test wielokrotnego wyboru w celu ustalenia, czy Turker może zidentyfikować właściwą kategorię dla firmy (Restauracja, Zakupy itp.) i zweryfikować, za pośrednictwem oficjalnej strony internetowej lub telefonicznie, prawidłowy numer telefonu i adres.

79 minęło. To było niezwykle podstawowe Test wielokrotnego wyboru. Można się zastanawiać, jak pozostałe 4581 osób było wystarczająco inteligentnych, aby obsługiwać przeglądarkę internetową.

Tych 79 wysokiej jakości pracowników zostało następnie rzuconych na problem weryfikacji informacji biznesowych po trzech na raz. To pozwoliło badaczom wziąć tylko te wyniki, co do których zwykła większość Turków zgodziła się, że są poprawne, lub w niektórych przypadkach wziąć wynik wybrany przez Turkera, który historycznie był najdokładniejszy.

Badacze rzucili na ten sam zestaw problemów klasyfikator Naive Bayes. Jest to rodzaj nadzorowanego algorytmu uczenia; który, według porównania tych systemów z 2006 roku , nie jest nawet najlepszym rodzajem.

Klasyfikator Bayesa wygrał z łatwością.

W prawie każdym przypadku algorytm, który został wytrenowany na puli 12 milionów recenzji przesłanych przez użytkowników na Yelp, poprawnie identyfikował kategorię firmy o jedną trzecią częściej niż ludzie. W kategorii motoryzacyjnej komputer miał dwukrotnie większe prawdopodobieństwo, niż zmontowane masy, aby poprawnie zidentyfikować firmę.

Wyniki te niekoniecznie sugerują, że kategoryzacja biznesowa jest problemem podobnym do szachów, gdzie ludzki komputer został ostatecznie przekroczony przez jego mechaniczny odpowiednik. Sugerują raczej, że coś w samym Mechanicznym Turku jest zepsute – albo system motywacyjny, albo jego mechanizmy kontroli jakości. Od dawna wiadomo, że płace na Mechanical Turk są dość niskie – pracownicy zarabiają średnio od dwóch do trzech dolarów na godzinę za swoją pracę i prawdopodobnie jest to częścią problemu. Ekonomiści dopiero zaczęli zajmować się tym pytaniem; więcej o tym jutro.

Śledź Mims na Twitterze lub skontaktuj się z nim przez e-mail .

ukryć