Lekcje od supergwiazdowego badacza danych pandemii, Youyang Gu

Youyang Gu

Pani Tech | Zdjęcie dzięki uprzejmości





Naukowiec danych Youyang Gu uważa się za realistę — deklaruje to w swoim Profil na Twitterze : Prezenter bezstronnych ujęć. Realista.

Kiedy zauważył prognozy scattershot covid-19 zeszłej wiosny – jeden model przewidywał 2 miliony zgonów w USA do lata, inny przewidywał 60 000 – Gu zakwestionował, czy to było tak dobre, jak to tylko możliwe. Postanowił sam spróbować stworzyć model covid-19. Całym moim celem było stworzenie możliwie najdokładniejszego modelu, mówi Gu, ze swojego mieszkania na Manhattanie. Żadnego „jeśli to” lub „jeśli tamto”. Zasadniczo nie ma „jeśli”. To naprawdę nie ma znaczenia, jakie są scenariusze. Chciałem tylko przedstawić: „To najbardziej prawdopodobna lub realistyczna prognoza tego, co się wydarzy”.

W ciągu tygodnia zbudował model uczenia maszynowego i uruchomił swój Witryna dotycząca prognoz COVID-19 . Codziennie uruchamiał model — zajęło mu to tylko godzinę na swoim laptopie — i publikował prognozy zgonów z powodu wirusa Covid-19 dla 50 stanów USA, 34 hrabstw i 71 krajów.



Czy covid może doprowadzić do choroby autoimmunologicznej przez całe życie?

Coraz więcej dowodów wskazuje na to, że u niektórych osób infekcje ciążowe wytwarzają autoprzeciwciała skierowane przeciwko narządom organizmu. Jeśli to prawda, dla wielu może to oznaczać lata długotrwałych chorób i nieszczęścia.

Pod koniec kwietnia przyciągał uwagę — ostatecznie miliony codziennie odwiedzały jego stronę internetową. Carl Bergstrom, profesor biologii na Uniwersytecie Waszyngtońskim, zauważył i skomentował na Twitterze że model Gu tworzy prognozy, które wydają się tak dobre, jak wszystkie, które widziałem.

Potrafię być trochę sceptycznym ML. Ale w tym przypadku nie pozwól, aby tekst „uczenia maszynowego” zmylił Cię, myśląc, że to olej wężowy, napisał na Twitterze Bergstrom.



27-letni Gu, absolwent MIT z tytułem magistra elektrotechniki i informatyki (plus dyplom z matematyki), pracował nad startem w dziedzinie analityki sportowej, gdy wybuchła pandemia. Ale wstrzymał to przedsięwzięcie, gdy zamknięto sporty ligowe. A potem, po prostu googlując epidemiologię, rozpoczął swoją przygodę z modelowaniem covid-19.

Mówi, że nie miałem żadnego doświadczenia w modelowaniu chorób zakaźnych. Miał jednak kilkuletnie doświadczenie jako analityk danych w finansach, pracując z modelami statystycznymi — modelami, które w oparciu o pewne założenia statystyczne analizują dane i sporządzają prognozy dotyczące, powiedzmy, przyszłej ceny akcji. .

Okazuje się, że wiele modelowania chorób zakaźnych to w zasadzie modelowanie statystyczne, mówi Gu. A cel branży finansowej nastawiony na zysk, dotyczący dokładności, dobrze mu służył w dziedzinie epidemiologicznej. Jeśli nie potrafisz stworzyć dokładnego modelu w finansach, nie będziesz już miał pracy – mówi. Natomiast celem w środowisku akademickim – przynajmniej z perspektywy Gu – nie jest tworzenie dokładnych modeli, ale raczej publikowanie artykułów i informowanie o polityce publicznej. Nie oznacza to, że nie tworzą dokładnych modeli – po prostu nie optymalizują pod kątem dokładności, mówi.



Model Gu łączy uczenie maszynowe z klasycznym symulatorem chorób zakaźnych zwanym modelem SEIR (uwzględniającym osoby w populacji, które są podatne, narażone, zakaźne, wyleczone lub usunięte z powodu śmierci).

Składnik SEIR wykorzystuje jako dane wejściowe symulowany zestaw parametrów — zakres najlepszego odgadnięcia dla zmiennych, takich jak podstawowa liczba reprodukcyjna (szybkość, z jaką nowe przypadki pojawiają się w całkowicie podatnej populacji na początku epidemii, przed interwencjami lub odpornością) , wskaźnik infekcji, data zablokowania, data ponownego otwarcia i efektywna liczba reprodukcji (współczynnik, z jakim pojawiają się nowe przypadki po niektórych interwencjach). Jeśli chodzi o dane wyjściowe, symulator SEIR najpierw oblicza infekcje w czasie, a następnie oblicza zgony (mnożąc infekcje przez wskaźnik śmiertelności infekcji).

Warstwa uczenia maszynowego Gu generuje następnie tysiące różnych kombinacji dla tych zestawów parametrów, próbując znaleźć rzeczywiste parametry dla każdego regionu geograficznego. Dowiaduje się, które parametry generują najdokładniejsze prognozy zgonów, porównując przewidywania SEIR z rzeczywistymi danymi dotyczącymi codziennych zgonów z Uniwersytetu Johnsa Hopkinsa. Próbuje dowiedzieć się, jakie zestawy parametrów generują zgony, które są najbardziej zgodne z rzeczywiście obserwowanymi danymi, patrząc wstecz, mówi Gu. A następnie wykorzystuje te parametry do prognozowania i prognozowania zgonów w przyszłości.



Prognozy okazały się niezwykle trafne. Na przykład 3 maja pojawił się w dniu CNN dzisiaj i podzielił się prognozami swojego modelu, że Stany Zjednoczone osiągną 70 000 zgonów 5 maja, 80 000 zgonów 11 maja, 90 000 zgonów 18 maja i 100 000 zgonów 27 maja. 28 maja tweetował , covid19-projections.com ma dokładnie wszystkie 4 daty. Z pewnym zaokrągleniem to była prawda.

Nie mówię, że przez ostatni rok byłam idealna. Wiele razy się myliłem. Ale myślę, że wszyscy możemy nauczyć się podchodzić do nauki jako metody odnajdywania prawdy, a nie samej prawdy.

Youyang Gu

Model oczywiście nie był doskonały, ale wywarł wrażenie na Nicholasie Reichu, biostatystyku i badaczu chorób zakaźnych z Uniwersytetu Massachusetts w Amherst, którego laboratorium we współpracy z amerykańskimi Centrami Kontroli i Zapobiegania Chorobom: agreguje wyniki z około 100 międzynarodowych zespołów modelarskich. Spośród wszystkich modeli zagregowanych, jak zauważył Reich, model Gu konsekwentnie plasował się na szczycie.

6 października Gu opublikował swoją ostateczną prognozę śmierci, tuż przed falą jesienną. Model przewidywał, że do 1 listopada w Stanach Zjednoczonych zginie 231 000 osób. Łączna liczba odnotowana do tego dnia: 230 995.

Gu zamknął swój pierwszy model na początku października, ponieważ do tego czasu było wiele zespołów, które dobrze prognozowały liczbę zgonów. Zamiast tego zwrócił się do modelowania prawdziwych infekcji w porównaniu do zgłoszonych infekcji. A potem w grudniu zaczął śledzić wprowadzanie szczepionek i nieuchwytne poklepać h do odporności na stado — który na początku 2021 r. zrewidował na ścieżce do normalności. Natomiast odporność na stado osiąga się, gdy wystarczająca część populacji jest odporna na wirusa, ograniczając w ten sposób dalsze rozprzestrzenianie się, Gu definiuje normalność jako zniesienie wszystkich ograniczeń związanych z COVID-19 w większości stanów USA.

Jak niewielka firma medialna pomaga ludziom zaszczepić się

Ponieważ wiele osób w Nowym Jorku wciąż walczy o zaszczepienie się na krukowicę, jeden z lokalnych biuletynów działa jako swatka szczepionkowa.

Stało się jasne, że w 2021 roku nie uda nam się osiągnąć immunitetu stadnego, a przynajmniej na pewno nie w całym kraju – mówi. I myślę, że to ważne, zwłaszcza jeśli próbujesz zaszczepić pewność siebie, abyśmy wytyczyli rozsądne ścieżki, kiedy będziemy mogli wrócić do normalności . Nie powinniśmy wiązać tego z nierealistycznym celem, takim jak osiągnięcie odporności stada. Nadal jestem ostrożnym optymistą, że moja pierwotna prognoza na luty, dotycząca powrotu do normalności latem, będzie aktualna.

Na początku marca całkowicie zapakował sklep — pomyślał, że wniósł wkład, jaki mógł. Chciałem się cofnąć i pozwolić innym modelarzom i ekspertom wykonać swoją pracę, mówi. Nie chcę zagmatwać przestrzeni.

Nadal obserwuje dane, prowadzi badania i analizy – dotyczące wariantów, wprowadzenia szczepionek i czwartej fali. Jeśli zobaczę coś, co jest szczególnie niepokojące lub niepokojące, o czym myślę, że ludzie nie mówią, na pewno to opublikuję, mówi. Ale na razie skupia się na innych projektach, takich jak: Akcje YOLO , platforma do analizy notowań giełdowych. Jego główną pracą w przypadku pandemii jest członkostwo w technicznej grupie doradczej Światowej Organizacji Zdrowia ds. oceny śmiertelności związanej z wirusem Covid-19, gdzie dzieli się wiedzą specjalistyczną z zewnątrz.

Zdecydowanie dużo się nauczyłem przez ostatni rok, mówi Gu. To było bardzo pouczające.

Lekcja 1: Skup się na podstawach

Z punktu widzenia nauki o danych, moje modele pokazały znaczenie prostoty, która często jest niedoceniana, mówi Gu. Jego model prognozowania śmierci był prosty nie tylko pod względem projektu — komponentu SEIR z warstwą uczenia maszynowego — ale także bardzo oszczędnego, oddolnego podejścia do danych wejściowych. „Oddolne” oznacza rozpoczęcie od minimum i dodawanie złożoności w razie potrzeby – mówi. Mój model wykorzystuje tylko przeszłe zgony do przewidywania przyszłych zgonów. Nie korzysta z żadnego innego prawdziwego źródła danych.

Gu zauważył, że inne modele opierały się na eklektycznej różnorodności danych dotyczących przypadków, hospitalizacji, testów, mobilności, używania masek, chorób współistniejących, rozkładu wieku, demografia , sezonowość zapalenia płuc, roczna śmiertelność z powodu zapalenia płuc, gęstość zaludnienia, zanieczyszczenie powietrza, wysokość, dane dotyczące palenia, zgłaszane kontakty, ruch pasażerski w liniach lotniczych, punkty opieki, inteligentne termometry, posty na Facebooku, wyszukiwania w Google i inne.

Istnieje przekonanie, że jeśli dodasz więcej danych do modelu lub uczynisz go bardziej wyrafinowanym, model będzie działał lepiej, mówi. Ale w rzeczywistych sytuacjach, takich jak pandemia, gdy dane są tak zaszumione, chcesz, aby wszystko było tak proste, jak to tylko możliwe.

Wcześnie zdecydowałem, że przeszłe zgony są najlepszym prognostykiem przyszłych zgonów. To bardzo proste: wejście, wyjście. Dodanie większej liczby źródeł danych tylko utrudni wyodrębnienie sygnału z szumu.

Lekcja 2: Minimalizuj założenia

Gu uważa, że ​​miał przewagę w podejściu do problemu z czystą kartą. Moim celem było po prostu śledzenie danych dotyczących krowa, aby dowiedzieć się o krowie, mówi. To jedna z głównych zalet perspektywy osoby z zewnątrz.

Ale nie będąc epidemiologiem, Gu musiał również mieć pewność, że nie robi błędnych lub niedokładnych założeń. Moją rolą jest zaprojektowanie modelu tak, aby mógł nauczyć się za mnie założeń – mówi.

Zauważa, że ​​kiedy pojawiają się nowe dane, które są sprzeczne z naszymi przekonaniami, czasami je przeoczamy lub ignorujemy, co może mieć konsekwencje w dalszej perspektywie. Z pewnością padłem ofiarą tego i wiem, że wielu innych ludzi również.

Tak więc świadomość potencjalnego uprzedzenia, które mamy, i rozpoznanie go, a także możliwość dostosowania naszych uprzedzeń – dostosowania naszych przekonań, jeśli nowe dane je obalają – jest naprawdę ważne, szczególnie w szybko zmieniającym się środowisku, takim jak to, które widzieliśmy z covid .

Lekcja 3: Sprawdź hipotezę

To, co widziałem w ciągu ostatnich kilku miesięcy, to to, że każdy może wysuwać twierdzenia lub manipulować danymi, aby pasowały do ​​narracji tego, w co chce wierzyć, mówi Gu. Podkreśla to znaczenie prostego stawiania testowalnych hipotez.

Dla mnie to jest cała podstawa moich prognoz i prognoz. Mam zestaw założeń i jeśli te założenia są prawdziwe, to przewidujemy, że tak się stanie w przyszłości – mówi. A jeśli założenia okażą się błędne, to oczywiście musimy przyznać, że założenia, które przyjmujemy, nie są prawdziwe i odpowiednio je dostosować. Jeśli nie stawiasz testowalnych hipotez, nie ma sposobu, aby pokazać, czy rzeczywiście masz rację, czy nie.

Lekcja 4: Ucz się na błędach

Nie wszystkie moje przewidywania były poprawne, mówi Gu. W maju 2020 r. przewidywał 180 000 zgonów w USA do początku sierpnia. To znacznie więcej niż widzieliśmy, wspomina (było około 155 000 zgonów). Jego sprawdzalna hipoteza okazała się błędna — a to zmusiło mnie do zmiany moich założeń.

W tym czasie Gu stosował w symulatorze SEIR stałą śmiertelność infekcji wynoszącą około 1%. Kiedy latem obniżył śmiertelność infekcji do około 0,4% (a później do około 0,7%), jego przewidywania wróciły do ​​bardziej realistycznego zakresu.

Lekcja 5: Angażuj krytyków

Nie wszyscy zgodzą się z moimi pomysłami i cieszę się z tego, mówi Gu, który używał Twittera do publikowania swoich prognoz i analiz. Staram się jak najwięcej odpowiadać ludziom, bronić swojego stanowiska i dyskutować z ludźmi. Zmusza cię do zastanowienia się, jakie są twoje założenia i dlaczego uważasz, że są poprawne.

Wraca do błędu potwierdzenia, mówi. Jeśli nie jestem w stanie odpowiednio obronić swojego stanowiska, to czy rzeczywiście jest to słuszne roszczenie i czy powinienem je wysuwać? Pomaga mi zrozumieć, poprzez kontakt z innymi ludźmi, jak myśleć o tych problemach. Kiedy inni ludzie przedstawiają dowody, które są sprzeczne z moim stanowiskiem, muszę być w stanie przyznać, że mogę się mylić w niektórych moich założeniach. I to rzeczywiście bardzo mi pomogło w ulepszeniu mojego modelu.

Lekcja #6: Ćwicz zdrowy sceptycyzm

Jestem teraz o wiele bardziej sceptyczny wobec nauki – i nie jest to zła rzecz, mówi Gu. Myślę, że ważne jest, aby zawsze kwestionować wyniki, ale w zdrowy sposób. To cienka linia. Ponieważ wiele osób po prostu odrzuca naukę, a to też nie jest sposób na to.

Ale myślę, że ważne jest również, aby nie tylko ślepo ufać nauce, kontynuuje. Naukowcy nie są doskonali. Właściwe jest, mówi, jeśli coś wydaje się nie w porządku, zadawać pytania i znajdować wyjaśnienia. Ważne jest, aby mieć różne perspektywy. Jeśli jest coś, czego nauczyliśmy się w ciągu ostatniego roku, to tego, że nikt nie ma 100% racji przez cały czas.

Nie mogę mówić w imieniu wszystkich naukowców, ale moim zadaniem jest przebić się przez cały hałas i dotrzeć do prawdy, mówi. Nie mówię, że przez ostatni rok byłam idealna. Wiele razy się myliłem. Ale myślę, że wszyscy możemy nauczyć się podchodzić do nauki jako metody odnajdywania prawdy, a nie samej prawdy.

ukryć