Jak dane z Wikipedii rewolucjonizują prognozowanie grypy

W zeszłym roku Centers for Disease Control and Prevention w Atlancie ogłosiło konkurs na najlepszy sposób prognozowania charakterystyki sezonu grypowego 2013-2014 na podstawie danych zebranych z Internetu. Dzisiaj Kyle Hickmann z Los Alamos National Laboratories w Nowym Meksyku wraz z kilkoma kolegami ujawnia wyniki swojego modelu, który wykorzystywał dane z Wikipedii w czasie rzeczywistym do prognozowania danych gruntowych zebranych przez CDC, które pojawiły się około dwa tygodnie później.





Mówią, że ich model ma potencjał, aby przekształcić prognozowanie grypy z czarnej sztuki w nowoczesną naukę, równie dobrze ugruntowaną jak prognozowanie pogody.

Grypa zabija każdego roku w USA od 3 000 do 49 000 osób, więc dokładna prognoza może mieć znaczący wpływ na sposób, w jaki społeczeństwo przygotowuje się do epidemii. Obecna metoda monitorowania epidemii grypy jest nieco przestarzała. Opiera się na dobrowolnym systemie, w którym urzędnicy zdrowia publicznego zgłaszają odsetek pacjentów, których odwiedzają co tydzień z chorobami grypopodobnymi. Jest to określane jako odsetek osób z temperaturą wyższą niż 100 stopni, kaszlem i nie ma innego wytłumaczenia niż grypa.

Liczby te dają poczucie zachorowalności na grypę w dowolnym momencie, ale dokładność jest wyraźnie ograniczona. Nie uwzględniają na przykład osób z grypą, które nie zgłaszają się na leczenie, ani osób z objawami grypopodobnymi, które zgłaszają się na leczenie, ale nie mają grypy.



Jest jeszcze jeden poważny problem. Sieć, która raportuje te dane, jest stosunkowo powolna. Przefiltrowanie liczb przez system zajmuje około dwóch tygodni, więc dane są zawsze sprzed kilku tygodni.

Dlatego CDC jest zainteresowane znalezieniem nowych sposobów monitorowania rozprzestrzeniania się grypy w czasie rzeczywistym. W szczególności Google wykorzystał liczbę wyszukiwań hasła i objawów grypopodobnych do prognozowania grypy w różnych częściach świata. Takie podejście odniosło spory sukces, ale także zagadkowe porażki. Problem polega jednak na tym, że Google nie udostępnia swoich danych bezpłatnie i ten brak przejrzystości jest potencjalnym źródłem kłopotów dla tego rodzaju badań.

Więc Hickmann i spółka zwrócili się do Wikipedii. Ich pomysł polega na tym, że zmienność liczby osób przeglądających artykuły o grypie jest wskaźnikiem rozprzestrzeniania się choroby. A ponieważ Wikipedia bezpłatnie udostępnia te dane wszystkim zainteresowanym stronom, jest to całkowicie przejrzyste źródło, które prawdopodobnie będzie dostępne w przewidywalnej przyszłości.



Hickman i jego współpracownicy wykorzystują dane dotyczące grypy z wcześniejszych lat, aby wytrenować algorytm uczenia maszynowego, aby wykryć powiązanie z danymi dotyczącymi chorób grypopodobnych zebranymi przez CDC. Następnie wykorzystali algorytm do przewidywania poziomu grypy w czasie rzeczywistym podczas zeszłorocznego sezonu grypowego.

Wyniki są dobrym predyktorem danych podstawowych, które CDC udostępnia dwa tygodnie później. Wykazano, że dzienniki dostępu do artykułów w Wikipedii są silnie skorelowane z historycznymi zapisami chorób grypopodobnych i pozwalają na dokładne przewidywanie danych o chorobach grypopodobnych na kilka tygodni przed ich udostępnieniem, twierdzą Hickmann i spółka.

Jest jednak zastrzeżenie. Jednym z problemów jest to, że prognozy znacznie zaniżają rozmiar końca sezonu grypowego. Dzieje się tak prawdopodobnie dlatego, że ludzie nie wracają do artykułów Wikipedii na temat grypy, jeśli ponownie zakażą się innym szczepem grypy, który jest znaczącym źródłem choroby pod koniec sezonu. Przyznają, że ponieważ nasz model nie uwzględnia reinfekcji ani wielu szczepów grypy, ogona epidemii nie można przewidzieć na długo po tym, jak minął szczyt sezonu grypowego.



Niemniej jednak praca jest ważnym krokiem w kierunku systemu przewidywania, który jest tak szczegółowy i uzasadniony jak prognozowanie pogody. Jedną z przydatnych cech ich metody jest to, że pokazuje, kiedy model odbiega od danych podstawowych. Dzięki temu można go modyfikować w czasie rzeczywistym, aby uwzględnić te różnice, podobnie jak prognoza pogody.

Prognozowanie chorób jest nauką w powijakach, ale ma potencjał, aby radykalnie poprawić poziom przygotowania świata medycznego na epidemie. Wstępne szacunki, z którymi do tej pory musieli pracować medycy, często prowadzą do znacznego poziomu nadmiernego lub niedostatecznego przygotowania.

To prawdopodobnie się zmieni. A skoro sezon grypowy 2014-2015 już się zbliża, im szybciej, tym lepiej.



Nr ref.: arxiv.org/abs/1410.7716 : Prognozowanie sezonu grypowego 2013-2014 za pomocą Wikipedii

ukryć