Ciekawa natura kaskad dzielenia się na Facebooku

Jedną z cech charakterystycznych treści społecznościowych jest sposób, w jaki zdjęcia, wideo i tekst są udostępniane wielu użytkownikom. Nieuchronnie niektóre treści stają się bardziej popularne niż inne, co prowadzi do kaskad, w których liczba udostępnień może być ogromna. Podczas gdy większość mediów ma tylko kilka udziałów, niektóre są udostępniane ponownie wiele milionów razy.





Dlatego istnieje duże zainteresowanie dowiedzeniem się, jak przewidzieć coś, co może być popularne w porównaniu z czymś, co nie jest. Na pierwszy rzut oka łatwo jest pomyśleć, że przewidzenie popularności treści jest prawie niemożliwe. Dzieje się tak, ponieważ zależy to od tak wielu czynników, które są trudne do zmierzenia, takich jak charakter treści i łączność osób, które je widzą.

Niemniej jednak różne zespoły twierdzą, że znalazły sposoby przewidywania ostatecznej popularności postu, analizując jego popularność wkrótce po jego opublikowaniu. Ale biorąc pod uwagę brak wiarygodnego sposobu na zrobienie tego w sieci, możesz sam ocenić, jak dobrze te mechanizmy muszą działać.

Dziś mamy inne podejście do tematu przewidywalności dzięki pracy Justina Chenga z Uniwersytetu Stanforda w Kalifornii oraz kilku kumpli z Facebooka i Cornell University. Ci faceci pokazują, dlaczego popularność jest tak trudna do przewidzenia przy użyciu konwencjonalnego podejścia do badania wczesnych etapów popularności.



Ale jednocześnie pokazują, że różne cechy kaskady można przewidzieć z niezwykłą dokładnością i że można to wykorzystać do pomyślnej oceny przyszłego zachowania kaskad po ich rozpoczęciu. Rezultatem jest znacznie głębszy wgląd w naturę kaskad, niż początkowo można by sądzić.

Cheng i spółka doszli do swoich wniosków, analizując sposób, w jaki zdjęcia były udostępniane na Facebooku w ciągu 28 dni po ich pierwszym przesłaniu w czerwcu 2013 r. Obejrzano ponad 150 000 zdjęć, które zostały wspólnie udostępnione ponad 9 milionów razy. Dane powiedziały im, które osoby (węzły) udostępniły ponownie każde zdjęcie iw jakim czasie, co pozwoliło im dokładnie zrekonstruować sieci, za pośrednictwem których nastąpiło ponowne udostępnienie.

W przeszłości naukowcy przyglądali się, jak zaczynają się duże kaskady, a następnie próbowali wykorzystać te informacje do wykrywania dużych kaskad w przyszłości, uzyskując mieszane wyniki.



Cheng i spółka przyjmują inne podejście. Zaczynają od zdjęcia, które zostało udostępnione określoną liczbę razy, powiedzmy k. Następnie określają prawdopodobieństwo, że to zdjęcie zostanie udostępnione dwa razy więcej razy. Innymi słowy, ich zadaniem jest przewidzenie, czy kaskada podwoi się.

To dobry wybór, ponieważ rozkład wielkości kaskady jest zgodny z pewnym rodzajem prawa mocy. To prawo zapewnia, że ​​w przypadku kaskad o danej wielkości połowa zwiększy się ponad dwukrotnie, a druga połowa nie. Tak więc przy podejmowaniu decyzji, czy dana kaskada podwoi się, losowe zgadywanie da prawidłową odpowiedź w około połowie przypadków.

Pytanie brzmi, czy możliwe jest wybranie funkcji ze zbioru danych, które pozwalają algorytmowi uczenia maszynowego działać lepiej. Tak więc Cheng i koledzy wykorzystują część swoich danych do trenowania algorytmu uczenia maszynowego w celu wyszukiwania cech kaskad, które czynią je przewidywalnymi.



Te cechy obejmują rodzaj obrazu, czy to zbliżenia, na zewnątrz, czy z podpisem i tak dalej; liczba obserwujących oryginalny plakat; kształt tworzącej się kaskady, czy to prosty wykres gwiezdny, czy bardziej złożone struktury; i wreszcie jak szybko zachodzi kaskada, jej prędkość.

Po wytrenowaniu swojego algorytmu wykorzystali go, aby sprawdzić, czy może on przewidywać inne kaskady. Zaczęli od zdjęć, które zostały udostępnione tylko pięć razy, więc pytanie brzmiało, czy w końcu zostaną udostępnione więcej niż 10 razy.

Okazuje się, że jest to zaskakująco przewidywalne. W przypadku tego zadania losowe zgadywanie osiągnęłoby skuteczność 0,5, podczas gdy nasza metoda osiąga zaskakująco wysoką wydajność: dokładność klasyfikacji 0,795, jak mówią.



A niektóre cechy kaskady to znacznie lepsze predyktory i inne. W rzeczywistości czasowa wydajność kaskady, jak szybko się rozprzestrzenia, jest najlepszym wskaźnikiem ze wszystkich. Więc na początku coś szybko się rozprzestrzenia, prawdopodobnie rozprzestrzeni się bardziej.

Innym ważnym czynnikiem są tematy wymienione w podpisie związanym z obrazem, na przykład czy to warte opublikowania, czy związane z aktualnym memem.

Cheng i spółka twierdzą również, że wraz ze wzrostem liczby ponownych udziałów łatwiej jest dokonać prognozy. To pokazuje, że więcej informacji jest zawsze lepszych: im większa liczba obserwowanych udostępnień, tym lepsze prognozy, mówią.

I dlatego poprzednie wysiłki w dużej mierze się nie powiodły – zawsze zaczynają się od zbyt małej ilości informacji.

Oczywiście istnieją ograniczenia w pracy. Najbardziej oczywiste jest to, że zrobiono to tylko ze zdjęciami udostępnionymi w całości na Facebooku. Możliwe, że ponowne udostępnienia na Facebooku różnią się w jakiś sposób od tych, które mają miejsce w innych miejscach w sieci, a zdjęcia są traktowane inaczej niż na przykład linki do historii.

Ale Cheng i spółka są przekonani, że wiele z tego, co znaleźli, przyda się gdzie indziej. Mimo tych ograniczeń uważamy, że wyniki dają ogólne spostrzeżenia, które będą przydatne w innych sytuacjach.

I pozostawia wiele zainteresowania dla innych badaczy. Cheng i spółka natknęli się na bogaty wgląd w naturę kaskad w sieciach społecznościowych. A na wzgórzach jest więcej złota.

Nr ref.: arxiv.org/abs/1403.4608 : Czy można przewidzieć kaskady?

ukryć