211service.com
Łowienie sensu w morzu danych
Narzędzie do analizy danych może pomóc naukowcom skoncentrować się na najciekawszych pytaniach. 27 czerwca 2018 r.
Kaplica Webba
Krzywa linia przesuwa się po jego twarzy, gdy David Reshef '08, MEng '09, PhD '17 staje przed projektorem w sali seminaryjnej Broad Institute. Na ekranie znajduje się stos wykresów, niektóre przedstawiają wyraźne linie, podczas gdy inne pokazują grube pasma kropek przybliżające nachylenie lub parabolę.
Wykresy ilustrują, w jaki sposób narzędzie, które Reshef opracował wraz ze swoim bratem Yakirem, identyfikuje i klasyfikuje różne rodzaje relacji w dużym zbiorze danych. Dla tych, którzy borykają się z ogromnymi ilościami danych, narzędzie oferuje ekscytujący sposób porównywania jabłek i pomarańczy. Ponieważ może znaleźć praktycznie dowolny rodzaj powiązania między parami zmiennych — zamiast skupiać się tylko na dobrze zrozumianych relacjach, takich jak na przykład liniowe lub wykładnicze — narzędzie może ujawnić nieoczekiwane korelacje. A ponieważ potrafi uszeregować różne rodzaje relacji według siły, może wskazać badaczom, gdzie szukać znaczenia w morzu danych. Na ekranie cienkie linie i ostre krzywe wznoszą się na górę, podczas gdy bardziej rozmyte formy – reprezentujące słabsze relacje – opadają na dół.
Naukowcy zajmujący się genomiką mogą być idealnymi użytkownikami tego narzędzia – a w Broad jest ich mnóstwo, gdzie cały ludzki genom jest sekwencjonowany co 12 minut. Gdy bracia żartują i łączą siły, prezentując swoje badania, ich płynne wyjaśnienia sprawiają, że ich logika wydaje się oczywista. Ale spędzili już dekadę, pracując, aby dowiedzieć się, jak analizować tego rodzaju informacje.
Reshefowie dorastali w Izraelu i Kenii, gdzie ich rodzice — lekarz i epidemiolog — pracowali w służbie zdrowia na całym świecie. Gdy David miał osiem lat, rodzina osiedliła się w Maryland, a chłopcy wkrótce zakochali się w informatyce. David zawsze planował zająć się medycyną, a studiując elektrotechnikę i informatykę na MIT, studiował dynamikę przenoszenia chorób. Od HIV po cholerę, każda choroba miała zestaw danych z własnymi unikalnymi cechami.
Kiedy w 2009 roku w Stanach Zjednoczonych pojawiła się świńska grypa, David dołączył do zespołu naukowców zajmujących się zdrowiem publicznym z Harvardu w Milwaukee, jednym z najbardziej dotkniętych miast. Przejrzał ręcznie spisane zapisy w lokalnym wydziale zdrowia, wprowadzając dane do modeli obliczeniowych, aby spróbować zrozumieć, jak szybko choroba się rozprzestrzeniała, aby pracownicy służby zdrowia mogli zareagować.
Badacze potrzebowali narzędzi, które mogłyby analizować cały zestaw danych i oznaczać najsilniejsze relacje — narzędzi, które mogłyby pomóc w generowaniu hipotez.
W międzyczasie zdał sobie sprawę, że chociaż naukowcy mieli dostęp do znacznie większej ilości danych i mocy obliczeniowej niż w przeszłości, było to mieszane błogosławieństwo. Mogli teraz identyfikować relacje między zmiennymi — a nawet relacje między relacjami — na znacznie bardziej szczegółowym poziomie, ale sama ilość i złożoność danych sprawiały, że robienie tego było wyjątkowo trudne.
Reshef zaczął myśleć, że potrzebowali narzędzi statystycznych, które mogłyby przeanalizować cały zestaw danych i wskazać najsilniejsze powiązania — narzędzi, które mogłyby pomóc w generowaniu nowych hipotez. Zamiast zawsze przewidywać, co warto zbadać, badacze mogliby użyć takich narzędzi, aby skoncentrować się na najciekawszych pytaniach, jakie można zadać.
Jak mówi, problem polegał na tym, jak opracować narzędzia, które pomogą nam znaleźć rzeczy, których niekoniecznie przewidujemy w danych.
W 2011 Nauka Na papierze bracia opisali nowe podejście w postaci tego, co nazywają statystyką maksymalnej eksploracji nieparametrycznej opartej na informacjach (MINE). Ich narzędzia, opracowane we współpracy z Pardis Sabeti i Michaelem Mitzenmacherem z Harvardu, są motywowane prostym pomysłem: jeśli chcemy szukać wzorców, w których może występować wiele rodzajów relacji, potrzebujemy sposobu na zidentyfikowanie, które są prawdziwe, i które są najsilniejsze. Jedno z narzędzi, zwane maksymalnym współczynnikiem informacyjnym (MIC), wykrywa zależność, czyli istnienie nielosowych relacji między parami zmiennych. Klasyfikuje również te relacje według ich siły, w oparciu o to, jak bardzo są hałaśliwe. Idealna korelacja (wyobraźmy sobie wyraźną linię lub parabolę na wykresie bez zbłąkanych punktów) miałaby najwyższą pozycję, a następnie relacje zawierające więcej punktów danych, które nie pasują do dominujących kształtów lub linii. Zmienne całkowicie niepowiązane (pomyśl o wykresie pełnym losowych punktów) spadłyby na sam dół listy.

Kaplica Webba
Kiedy Reshefowie zastosowali MIC do zbioru 357 zmiennych ze Światowej Organizacji Zdrowia, ujawnili dwa związki między dochodem a otyłością kobiet. Otyłość była niska wśród zubożałych kobiet, wzrastała wraz z dochodami do pewnego punktu, a następnie ponownie spadała przy wyższych poziomach dochodów. (Nie było to zaskakujące: kobiety, których nie stać na jedzenie, prawdopodobnie nie będą otyłe, podobnie jak kobiety, których stać na najzdrowszą dietę). dla kobiet z krajów wyspiarskich Pacyfiku, gdzie otyłość jest ceniona kulturowo. Chociaż urzędnicy ds. zdrowia publicznego wiedzieli już o tym regionalnym trendzie, wynik pokazał, w jaki sposób narzędzie może uchwycić zależności statystyczne, które nie pasują do przewidywalnego wzorca.
MINE może być używany do eksploracji dowolnego zestawu danych, który ma tak wiele zmiennych, że poszczególnych relacji między nimi nie można ocenić ręcznie. Kiedy bracia użyli swoich narzędzi do przeanalizowania 131 zmiennych w zestawie danych z 2008 roku z Major League Baseball, na przykład, zidentyfikowali trzy najsilniej powiązane z zarobkami graczy: trafienia, łączne podstawy i nieco tajemną statystykę znaną jako poziom zastąpienia marginalna wartość składu (oszacowanie, o ile więcej lub mniej przebiegów na mecz wnosi zawodnik niż statystycznie przeciętny zastępujący zawodnik na tej samej pozycji). Chociaż żadna z nich nie jest szczególnie zaskakująca, znaleźli się na szczycie długiej listy zmiennych, z których wszystkie miały sens. Inny model, który uwzględnia tylko relacje liniowe — i nie porównuje różnych rodzajów relacji — wymyślił zupełnie inną trójkę.
Reshefowie wykorzystali również MINE do zidentyfikowania 9472 znaczących relacji — spośród około 22 milionów możliwości — między różnymi gatunkami bakterii jelitowych. Wiele można wytłumaczyć dobrze poznanymi czynnikami, takimi jak dieta i płeć gospodarza. Ale po wykluczeniu ich pozostało 188 silnych, niewyjaśnionych związków, które mogą zasługiwać na dalsze badania: mogą sugerować konkurencję między gatunkami bakterii lub wskazywać na inne czynniki, które kształtują ekologię mikroflory jelitowej, co może wpływać na ogólny stan zdrowia. Naukowcy zajmujący się mikrobiomem nadal wykorzystują te narzędzia do rozwiązywania relacji między różnymi bakteriami jelitowymi.
Podobnie narzędzia braci można wykorzystać do zrozumienia narastającej fali danych dotyczących ekspresji genów. Na przykład, mierząc aktywność każdego z naszych około 20 000 genów, MINE może pomóc w odkryciu relacji, które prowadzą do jaśniejszego obrazu tego, co odróżnia normalne od patologicznego zachowanie komórek.
Po opracowaniu narzędzi na przecięciu statystyki i uczenia maszynowego David jest teraz chętny do opracowania sposobów wykorzystania uczenia maszynowego do badań biologicznych. Mówi, że ostatecznie może nam to pomóc w jak najefektywniejszym uczeniu się na podstawie naszych danych. Odkrywanie tego będzie niesamowicie ekscytujące, mówi.