211service.com
Jak Facebook wykorzystuje uczenie maszynowe do wykrywania fałszywych kont
Fałszywe konto na Facebooku Pani Tech
W 2019 roku Facebook spadł średnio blisko 2 miliardów fałszywe konta na kwartał. Oszuści wykorzystują te fałszywe konta do rozprzestrzeniania spamu, linków phishingowych lub złośliwego oprogramowania. To lukratywny biznes, który może być druzgocący dla wszystkich niewinnych użytkowników, których usidla.
Facebook publikuje teraz szczegółowe informacje na temat systemu uczenia maszynowego, którego używa, aby sprostać temu wyzwaniu. Gigant technologiczny rozróżnia dwa rodzaje fałszywych kont. Najpierw są konta z błędną klasyfikacją użytkowników, profile osobiste firm lub zwierząt domowych, które mają być Stronami. Są one stosunkowo proste w obsłudze — po prostu zostają przekonwertowane na Pages. Z drugiej strony, naruszenia kont są poważniejsze. Są to profile osobiste, które angażują się w oszustwa i spamowanie lub w inny sposób naruszają warunki korzystania z platformy. Konta naruszające zasady muszą zostać usunięte tak szybko, jak to możliwe, bez zarzucania zbyt szerokiej sieci i niszczenia prawdziwych kont.
W tym celu Facebook wykorzystuje ręcznie zakodowane reguły i uczenie maszynowe do blokowania fałszywego konta przed jego utworzeniem lub zanim stanie się aktywne. Innymi słowy, zanim zaszkodzi prawdziwym użytkownikom. Ostatnim etapem jest uruchomienie fałszywego konta. To wtedy wykrywanie staje się dużo trudniejsze i pojawia się nowy system uczenia maszynowego, znany jako Deep Entity Classification (DEC).
Iść głębiej
DEC uczy się rozróżniać fałszywych i prawdziwych użytkowników na podstawie ich wzorców połączeń w sieci. Nazywa te głębokie cechy i obejmuje takie rzeczy, jak średni wiek lub rozkład płci znajomych użytkownika. Facebook wykorzystuje ponad 20 000 zaawansowanych funkcji, aby scharakteryzować każde konto, zapewniając migawkę tego, jak zachowuje się każdy profil, aby utrudnić atakującym oszukanie systemu poprzez zmianę taktyki.
System zaczyna się od użycia dużej liczby mało precyzyjnych etykiet generowanych maszynowo. Są one generowane za pomocą kombinacji reguł i innych modeli uczenia maszynowego, które szacują, czy użytkownicy są prawdziwi, czy fałszywi. Gdy dane zostaną wykorzystane do trenowania sieci neuronowej, model jest następnie dostrajany za pomocą niewielkiej partii wysoce precyzyjnych, ręcznie oznaczonych danych, generowanych przez ludzi z całego świata, którzy rozumieją lokalne normy kulturowe.
Ostateczny system klasyfikacji może zidentyfikować jeden z czterech rodzajów fałszywych profili: nielegalne konta, które nie są reprezentatywne dla danej osoby, zhakowane konta prawdziwych użytkowników, które zostały przejęte przez atakujących, spamerzy, którzy wielokrotnie wysyłają wiadomości generujące przychody, oraz oszuści, którzy manipulują użytkownikami ujawnianie danych osobowych. Facebook twierdzi, że od czasu wdrożenia DEC utrzymuje liczbę fałszywych kont na platformie na poziomie około 5% aktywnych użytkowników miesięcznie.
Szczegóły działań porządkowych Facebooka pojawiają się w kontekście obaw związanych z manipulacjami w nadchodzących wyborach prezydenckich w USA, zwłaszcza wokół deepfake. W grudniu New York Times zgłoszone skoordynowana kampania dezinformacyjna wykorzystująca deepfake do masowego zakładania fałszywych kont z przekonującymi zdjęciami profilowymi.
Ochrona wyborów
Zespół Facebooka powiedział, że czas jego wydania był tylko zbiegiem okoliczności. Chodzi o ogólne wykrywanie naruszeń; nie jest konkretnie ukierunkowany na żadne tematy związane z wyborami, mówi Daniel Bernhardt, kierownik inżynieryjny zespołu ds. Integralności społeczności Facebooka. Ale DEC byłby uzupełnieniem innych wysiłków platformy, mających na celu powstrzymanie manipulacji wyborami. Ponieważ system opiera się na zaawansowanych funkcjach, aby kategoryzować każdy profil, będzie odporny na przykład na oszukanie przez głębokie obrazy profilu.
Aviv Ovadya, który założył organizację non-profit Thoughtful Technology Project i bada projektowanie i zarządzanie platformą, mówi, że wysiłek Facebooka, aby być bardziej przejrzystym dzięki procedurom czyszczenia, jest godny pochwały. Uważne omówienie decyzji dotyczących architektury — i sposobów działania systemów bezpieczeństwa — które mogą być naśladowane przez inne firmy, może być naprawdę przydatne i skuteczne. Ponieważ firmy takie jak Facebook mają znacznie więcej zasobów do inwestowania niż mniejsze firmy, przydatne jest dzielenie się tą wiedzą.
Ale wysiłki porządkowe mają również długą drogę do przebycia. Z 2,5 miliardem aktywnych użytkowników miesięcznie, 5% to nadal 125 milionów fałszywych kont. Uczenie maszynowe również zajdzie tylko do tego stopnia: bez względu na to, na jakiej ilości danych jest szkolony model, nigdy nie wykryje każdego złego konta z idealną precyzją. Platforma prawdopodobnie będzie musiała skorzystać z innych kombinacji ludzi i maszyn, aby ulepszyć.
Aktualizacja: Wcześniejsza wersja tego artykułu odnosiła się do nieaktualnych danych dotyczących wpływu systemu DEC Facebooka. Zostały zaktualizowane, aby odzwierciedlały najnowsze informacje.