Radioaktywne dane Facebooka śledzą obrazy używane do trenowania AI

Kategoria: Sztuczna inteligencja Opublikowany lut 06 Obraz stosu fotografii Obraz stosu fotografii





Wiadomości: Zespół Facebook AI Research opracował sposób śledzić dokładnie, które obrazy w zbiorze danych zostały wykorzystane do trenowania modelu uczenia maszynowego. Wprowadzając niezauważalne poprawki do obrazów, tworząc rodzaj znaku wodnego, byli w stanie wprowadzić niewielkie odpowiednie zmiany w sposobie działania klasyfikatora obrazu wyszkolonego na tych obrazach, bez uszczerbku dla jego ogólnej dokładności. To pozwoliło im później dopasować modele do obrazów, które zostały użyte do ich szkolenia.

Dlaczego jest to ważne: Facebook nazywa tę technikę danymi radioaktywnymi, ponieważ jest analogiczna do stosowania w medycynie znaczników radioaktywnych, które pojawiają się w ciele pod wpływem promieni rentgenowskich. Podkreślenie, jakie dane zostały wykorzystane do trenowania sztucznej inteligencji, sprawia, że ​​modele są bardziej przejrzyste , oznaczanie potencjalnych źródeł uprzedzeń — takich jak model wytrenowany na niereprezentatywnym zestawie obrazów — lub ujawnianie, kiedy zestaw danych został użyty bez pozwolenia lub w niewłaściwych celach.

Niepopełnić błędu: Dużym wyzwaniem była zmiana zdjęć bez psucia powstałego modelu. Drobne poprawki do danych wejściowych AI mogą czasami prowadzić do popełniania głupich błędów, takich jak identyfikowanie żółwia jako pistoletu lub leniwca jako samochodu wyścigowego. Facebook zadbał o zaprojektowanie swoich znaków wodnych, aby tak się nie stało. Zespół przetestował swoją technikę w ImageNet, powszechnie używanym zestawie danych obejmującym ponad 14 milionów obrazów, i odkrył, że mogą z dużą pewnością wykrywać użycie danych radioaktywnych w konkretnym modelu, nawet jeśli tylko 1% obrazów zostało oznaczonych.