211service.com
Nauka o danych i statystyka: możliwości i wyzwania
dostarczone przez Edukacja zawodowa MIT
Żyjemy teraz w świecie, w którym wydaje się, że wszystko, co nas dotyczy, jest (lub wkrótce będzie) śledzone i rejestrowane: co jemy, co oglądamy, jak się spotykamy, co lubimy, a czego nie lubimy, nasze ważne statystyki zdrowotne — oraz lista trwa.
Taki bezprecedensowy dostęp do danych osobowych stwarza potencjalnie ogromne możliwości, na przykład, aby pomóc urzędnikom państwowym w podejmowaniu lepszych decyzji politycznych, umożliwić przedsiębiorstwom bardziej efektywne i zyskowne działanie, usprawnić wykorzystanie zasobów publicznych, wspierać bardziej spersonalizowaną opiekę zdrowotną i projektowanie leków oraz w inny sposób poprawić ogólna jakość życia w naszym społeczeństwie. Kluczem do wykorzystania tych szans jest nasza zdolność do przekształcenia dostępnych danych w ważne decyzje.
Nauka o danych i statystyka: możliwości i wyzwania
Ten nowy 6-tygodniowy kurs online rozpoczyna się 4 października.
Zarejestruj się dziś!
Zbliżający się sześciotygodniowy internetowy kurs MIT Professional Education, Nauka o danych: dane do wglądu , oferowany we współpracy z Instytutem MIT ds. Danych, Systemów i Społeczeństwa ( IDSS ), skupi się na analityce. Odniesie się jednak również do takich kwestii, jak najnowsze trendy w uczeniu maszynowym: jak wydobyć sensowne spostrzeżenia i preferencje z ogólnych danych klientów oraz jak zadawać właściwe pytania, aby podejmować lepsze decyzje biznesowe.
Wyzwanie
W ciągu ostatnich kilku dekad zbudowaliśmy infrastrukturę, która może przechowywać i przetwarzać ogromne ilości danych. Jednak nadal brakuje nam krytycznej zdolności do płynnego łączenia różnych elementów danych w celu tworzenia znaczących prognoz, które prowadzą do ważnych decyzji. Biorąc pod uwagę nieskończone możliwości, które można odblokować, zajmując się tym niedociągnięciem, uważam, że jest to jedno z najważniejszych wyzwań naszych czasów.
Instytucje edukacyjne mogą odegrać wiodącą rolę w sprostaniu temu ważnemu wyzwaniu. W MIT IDSS i jego nowe Centrum Statystyki i Nauki o Danych ( SDSC ) pomoże stawić czoła wyzwaniu, jakim jest przekształcenie danych w rzeczywiste decyzje dzięki dwutorowemu podejściu:
- Kształcenie naszych uczniów możliwość pracy z dużymi ilościami danych i używania narzędzi do wydobywania z nich znaczących informacji. Innymi słowy, musimy kształcić studentów we wszystkich dyscyplinach, aby byli jednocześnie naukowcami danych oraz statystycy. Wymaga to od instytucji zaprojektowania usprawnionego, interdyscyplinarnego programu edukacyjnego zawierającego elementy inżynierii, nauk matematycznych i nauk społecznych.
- Opracowanie programu badawczego co ostatecznie tworzy system statystycznego przetwarzania danych, który można łatwo wykorzystać do tworzenia wszelkiego rodzaju dokładnych prognoz. Taki system musi współpracować z heterogenicznymi źródłami danych, działać na dużą skalę i prowadzić do przewidywań, które można skutecznie interpretować. Ten ambitny program może pomóc zmobilizować interdyscyplinarny i ekscytujący wysiłek intelektualny w dziedzinie nauki o danych i statystyce na następną dekadę lub dłużej.
Myślenie o decyzjach
Zastanówmy się, jak podejmowane są decyzje. W typowej organizacji podstawowe zadania operacyjne zależą od decyzji o tym, jak zainwestować dostępne zasoby wśród różnych konkurencyjnych opcji, mając na uwadze jeden lub więcej celów.
Na przykład rząd USA podejmuje takie decyzje przy opracowywaniu budżetu. Firma handlowa inwestuje pieniądze w różne instrumenty finansowe, aby tworzyć portfele o wysokich zwrotach i potencjalnie dobrze zrozumianym ryzyku. Organizacja handlu detalicznego podejmuje decyzje o tym, które zakupy towarów przyniosą wysokie przychody i zyski. Gospodarstwo domowe podejmuje decyzje o tym, jak najlepiej wykorzystać dochód rodziny. Racjonalna jednostka podejmuje decyzje o tym, co jeść (i co) nie jeść), aby uzyskać wystarczającą ilość energii i zachować zdrowie.
Wszystkie takie decyzje sprowadzają się w dużym skrócie do dokonywania prognoz, a następnie podejmowania określonych działań optymalizacyjnych z wykorzystaniem tych prognoz.
Jak to działa: przykład sprzedaży detalicznej
Spójrzmy teraz na konkretny przykład dotyczący sprzedawcy odzieży. Podstawowym problemem operacyjnym sprzedawcy detalicznego jest ustalenie, które produkty zaprezentować klientom, biorąc pod uwagę różne ograniczenia operacyjne, takie jak budżet na zakup zapasów, ograniczenia powierzchni półek w sklepach i harmonogramy dostawców. Kwestia wyboru produktów do zaprezentowania pojawia się w różnym czasie w przypadku różnych rodzajów decyzji, takich jak podejmowanie decyzji, które produkty kupić w sieci sklepów, które wysłać do różnych lokalizacji z centrów dystrybucji, które produkty przecenić, które promować za pośrednictwem e-mail, który ma być wyświetlany klientom, gdy odwiedzają sklepy lub witryny e-commerce.
Wszystkie te pytania zasadniczo wymagają zrozumienia tego, co ludzie lubią, a czego nie. Niektóre istniejące systemy dostarczają takich informacji i mogą wskazywać na przykład, że niebieskie koszule zyskują na popularności, podczas gdy czerwone spodenki przestały się sprzedawać. Ale jak zamienić te spostrzeżenia na działanie?
Podejmowanie decyzji na podstawie danych
Koncepcyjnie podejmowanie decyzji na podstawie danych wymaga połączenia zmiennych decyzyjnych i opcji z danymi, a następnie rozwiązania problemu optymalizacji z różnymi celami. Z operacyjnego punktu widzenia wymaga to zbudowania systemu przetwarzania danych, który może mieć bardzo dużą skalę i który może wymagać działania w czasie rzeczywistym z trzema komponentami wysokiego poziomu: interfejsami, infrastrukturą i algorytmami.
Interfejsy. Zapewniają one sposoby dostarczania informacji klientom końcowym i czujnikom w celu gromadzenia informacji. Na przykład interfejsy internetowe (przeglądarki) lub aplikacje mobilne umożliwiają zbieranie informacji o działaniach klientów online. Podobnie, takie interfejsy mogą pomóc decydentowi w organizacji handlu detalicznego w interakcji z danymi i spostrzeżeniami, a także uzyskać wsparcie decyzyjne. Standaryzacja takich interfejsów pozwoliła na masowe innowacje w tej dziedzinie w ciągu ostatniej dekady.
Infrastruktura. Rolą infrastruktury jest zapewnienie środków do bezproblemowego przechowywania i przetwarzania ogromnych ilości danych. Potrzeba takiej infrastruktury pojawiła się naturalnie pod koniec lat 90., gdy era Internetu nabrała rozpędu. Nic dziwnego, że firmy zajmujące się wyszukiwarką internetową są pionierami w zakresie podstawowych innowacji. Co ciekawe, wyszukiwarka internetowa, pozornie prosta funkcja, doprowadziła do rozwoju ogólnej skalowalnej infrastruktury pamięci masowej i obliczeniowej. To z kolei było głównym powodem ostatnich ekscytujących innowacji w skalowalnych obliczeniach i przetwarzaniu danych.
Algorytmy. Algorytmy przetwarzania danych przekształcają zebrane surowe dane w cenne spostrzeżenia i decyzje. Do połączenia tych danych ze zmiennymi decyzyjnymi wykorzystywane są odpowiednie modele. Na przykład, gdy surowe dane są generowane przez ludzi, sensowne może być użycie modelu behawioralnego w celu połączenia zaobserwowanych danych ze zmiennymi decyzyjnymi. Powstałe algorytmy wykorzystują infrastrukturę obliczeniową i pamięciową, opartą na danych uzyskanych za pośrednictwem interfejsu, i generują wyniki końcowe, które mogą być dostarczane użytkownikowi końcowemu za pośrednictwem interfejsu.
Jednak dużym wyzwaniem jest umożliwienie rozwoju algorytmów przetwarzania danych dla: wszyscy. W przeciwieństwie do dostępności znormalizowanych interfejsów lub ogólnej architektury obliczeniowej i pamięci masowej, daleko nam do ogólnej architektury algorytmicznej przetwarzania danych.
Wróćmy do powyższego przykładu detalicznego. W szczególności rozważ zadanie polegające na podejmowaniu decyzji, które produkty pokazać klientom odwiedzającym witrynę handlu elektronicznego — czyli w jaki sposób nadać cechy osobiste doświadczenie każdego klienta? Oczywiście zależy to od danych o konkretnym kliencie, a także od danych zebranych o innych.
Dane te są gromadzone na podstawie historii przeglądania klienta i kliknięć w witrynie handlu elektronicznego, wcześniejszych zakupów i innej aktywności online zebranej za pośrednictwem naszych interfejsów internetowych i mobilnych. Prawdopodobnie jest przechowywany w infrastrukturze pamięci masowej. Jest przekształcany w spersonalizowane decyzje w czasie rzeczywistym za pomocą potencjalnie wyrafinowanych algorytmów przetwarzania danych, które wykorzystują modele behawioralne z nauk społecznych, wraz z metodami statystyki matematycznej i uczenia maszynowego. Algorytmy przetwarzania danych wykorzystują infrastrukturę obliczeniową, aby móc podejmować takie decyzje w czasie rzeczywistym. W ten sposób spersonalizowane decyzje są dostarczane do klienta za pośrednictwem interfejsu.
Kluczem do zbudowania tego typu systemu personalizacji lub rekomendacji jest dostęp do wykwalifikowanego zespołu analityków danych i statystyków, którzy potrafią zidentyfikować odpowiednie metody statystyczne i modele behawioralne w celu opracowania algorytmów przetwarzania danych. Następnie mogą zaprojektować przyjazne dla człowieka interfejsy, które mogą gromadzić przydatne dane, a następnie dostarczać decyzje. Chociaż jest to kosztowne przedsięwzięcie, niektórzy z największych detalistów już wybrali tę drogę.
Z drugiej strony, system personalizacji/rekomendacji posiada określone funkcje, które przybierają bardzo podobną formę w różnych organizacjach. To podobieństwo umożliwiło rozwój ogólnych systemów rekomendacji. Dlatego wielu detalistów kupuje takie systemy od zewnętrznych dostawców, którzy po prostu podłączają system personalizacji za pomocą interfejsów.
Zamykanie pętli
Jak wspomniano wcześniej, jednym z głównych wyzwań jest przejście od danych do decyzji. Mamy już dużo danych — i mamy dobrą infrastrukturę do ich przechowywania i przetwarzania — ale musimy się rozgryźć jak przetworzyć to. Omówienie systemu personalizacji/rekomendacji wyjaśnia dokładnie dwa podejścia, które możemy zastosować jednocześnie, aby sprostać temu wyzwaniu.
Po pierwsze, musimy umożliwić organizacjom zbudowanie zespołu wykwalifikowanych analityków danych. Po drugie, powinniśmy opracować ogólną architekturę algorytmiczną przetwarzania danych. W szczególności ta architektura przetwarzania danych musi koncentrować się na opracowaniu ogólnego systemu prognozowania. Dzieje się tak, ponieważ system decyzyjny zasadniczo składa się z dwóch elementów: przewidywania niewiadomych i wykorzystywania przewidywań do przeprowadzania optymalizacji. W ciągu ostatnich kilku dekad poczyniono znaczne postępy w rozwoju teorii i praktyki optymalizacji. Jednak nadal nie możemy zdefiniować, na czym polega ogólny i uniwersalny problem przewidywania.
IDSS, SDSC i „Nauka o danych”
MIT uruchomił IDSS, aby odpowiedzieć na pytania społeczne pojawiające się w następnym stuleciu. Chociaż wiele z tych problemów obejmuje wiele dyscyplin, wszystkie łączy jedno wspólne wyzwanie: decyzje oparte na danych. Aby opracować program edukacyjny i umożliwić prowadzenie badań w zakresie nauki o danych i statystyki w IDSS, MIT stworzył SDSC pod patronatem IDSS.
Pomożemy stawić czoła wyzwaniu przekształcania danych w decyzje, włączając dwa podejścia, które opisałem zarówno w SDSC, jak i IDSS. W szczególności SDSC będzie kształcić zaawansowanych analityków danych i statystyków poprzez interdyscyplinarne programy edukacyjne. IDSS zapewni interdyscyplinarne środowisko badawcze, które umożliwi jego członkom podjęcie ambitnych programów badawczych w dziedzinie statystyki i nauki o danych.
Tymczasem nasz nowy sześciotygodniowy kurs online Nauka o danych: dane do wglądu , która rozpocznie się 4 października, będzie udostępniać najnowsze informacje o sposobach zastosowania technik analizy danych w celu skuteczniejszego radzenia sobie z wieloma wyzwaniami organizacji. Aby dowiedzieć się więcej o tym, jak stworzyć przyszłość analizy danych swojej firmy, odwiedź strona rejestracji kursu .
Podziękowanie: Autor dziękuje Muntherowi Dahlehowi i Philippe'owi Rigolletowi za przekazanie opinii na temat wcześniejszej wersji tego artykułu, a Stefanie Koperniak i Myriam Joseph za jego korektę i edycję.
Devavrat Shah, współdyrektor kursu Data Science: Data to Insights, jest profesorem na Wydziale Elektrotechniki i Informatyki MIT, dyrektorem SDSC i głównym członkiem wydziału w IDSS. Jest również członkiem Laboratorium Systemów Informacyjnych i Decyzyjnych MIT (LIDS) oraz Centrum Badań Operacyjnych (ORC).