Twitter Data Scientist przejmuje całe menu McDonald's, Survives

Edwin Chen jest analitykiem danych na Twitterze, który dzieli się tajemnymi sekretami swojej mrocznej sztuki, co jest dobrą rzeczą, biorąc pod uwagę, że prawdopodobnie najszybciej rozwijająca się dziedzina w USA





Mmmm, nauka o danych. (cc Evan Blaser )

(Poniżej zamieściłem cały wywiad e-mailowy, który przeprowadziłem z Chenem, do którego możesz pominąć, jeśli szukasz ogólnego przeglądu jego pracy. Ujawnia między innymi, że jest uważany za wydobywanie Twittera dane, aby sprawdzić, czy ludzie jedzą fast foody, gdy są smutni).

Nauka o danych jest tak nowa, że ​​nie ma podręczników na ten temat ani programów uniwersyteckich zaprojektowanych z myślą o naukowcach danych. Jest jednak integralną częścią wszystkiego, od handlu ilościowego na Wall Street po kierowanie reklam w Internecie i optymalizację rzeczywistych łańcuchów dostaw.



Zanim zaczął wydobywać terabajty tweetów w poszukiwaniu spostrzeżeń, które można było przekształcić w interaktywne wizualizacje, Chen doskonalił swoje umiejętności, studiując lingwistykę i czystą matematykę na MIT. Jest to typowo nietypowe dla naukowców zajmujących się danymi, którzy mają doświadczenie w matematycznie rygorystycznych dyscyplinach, czymkolwiek one są. (Na Twitterze na przykład wszyscy analitycy danych muszą mieć co najmniej tytuł magistra w pokrewnej dziedzinie .)

Oto jeden z bardziej zwariowanych przykładów wszechstronności nauki o danych z własnego bloga Chena. W poście z porywającym tytułem Modele nieskończonych mieszanin z nieparametrycznymi Bayesami i procesem Dirichleta Chen zagłębia się w problem grupowania. To znaczy, jak zebrać masę danych i posortować je w grupy powiązanych ze sobą elementów? To trudny problem – ile powinno być grup? jakie są kryteria ich sortowania? – a szczegóły, jak sobie z tym radzi, wykraczają poza te, które nie mają doświadczenia w tego rodzaju analizach.

Dla reszty z nas Chen stanowi konkretny i przystępny przykład: McDonald's



Wrzucając całe menu McDonald's do swojego matematycznego pudełka do sortowania, Chen odkrywa na przykład, że nie wszystkie sosy McDonald's są sobie równe. Ostra Musztarda i Pikantny Buffalo nie należą do tego samego grona, co Creamy Ranch, które ma więcej wspólnego z mrożoną kawą McDonald's z bezcukrowym syropem waniliowym niż z niskotłuszczowym winegretem balsamicznym Newmana.

Pojawiają się inne skupiska, w tym wszystkie produkty burgerowe, produkty śniadaniowe i napoje cukrowe. Jak dotąd nie jest to zaskakujące, dopóki nie dojdziesz do jednego klastra w menu McDonald's, który zawiera tylko jedną pozycję.

Co jest takiego specjalnego w płatkach owsianych McDonald's Fruit & Maple? To prawdopodobnie zawartość błonnika, stosunkowo (podkreślam stosunkowo) wysoki poziom składników odżywczych i niższy poziom cukru, tłuszczów trans i cholesterolu.



Innymi słowy, kiedy jeden z najnowszych analityków danych na Twitterze zastosuje swoje rzemiosło do menu McDonalda, jego algorytm automatycznie wyodrębni z niego jedyne jedzenie, które każdy z nas prawdopodobnie powinien nawet rozważyć. Płatki owsiane: w McDonald's to naprawdę klasa sama w sobie.

Oto pełny wywiad z Chenem:

1. Jak długo jesteś analitykiem danych na Twitterze?



Jestem na Twitterze od około czterech miesięcy.

2. Czym zajmuje się analityk danych na Twitterze?

Pracujemy nad wszystkim, od tworzenia modeli uczenia maszynowego i ulepszania naszych struktur przetwarzania danych na dużą skalę, po tworzenie wizualizacji danych, przeprowadzanie analiz statystycznych i znajdowanie lepszych sposobów na zrozumienie naszych użytkowników i wykresu Twittera. Różnorodność jest duża i naprawdę zależy od umiejętności i zainteresowań każdej osoby.

Na przykład w dowolnym momencie prawdopodobnie będę eksperymentował z nowymi algorytmami kierowania reklam, pisząc zadania MapReduce w celu wydobywania terabajtów tweetów (za pomocą Scalding, naszego wewnętrznego języka MapReduce), tworząc interaktywne wizualizacje, aby uzyskać wgląd we wszystkie zbierane przez nas dane, pisanie raportu wyjaśniającego nowe odkrycia, przeprowadzanie eksperymentu na Mechanical Turk i wiele innych.

3. Czy Twój ostatni post (na temat klastrowania) był zainspirowany czymś, nad czym pracujesz na Twitterze (o czym możesz porozmawiać)?

Pracowałem nad grupowaniem naszych użytkowników i reklamodawców, automatycznie wnioskowałem kategorie tematyczne w tekście i zastanawiałem się, czego możemy się nauczyć z jedzenia na Twitterze (na przykład, czy mężczyźni i kobiety lub mieszkańcy San Francisco i nowojorczycy różnią się co jedzą? czy istnieje związek między tym, co ludzie jedzą, a tym, co tweetują, np. czy ludzie częściej jedzą niezdrowe jedzenie, gdy są smutni?). Więc chociaż post nie był bezpośrednio zainspirowany tym, nad czym pracuję na Twitterze, jest zdecydowanie powiązany.

4. Nauka o danych jest teraz czymś, ale (poinformowano mnie) jest to tak nowa dziedzina, że ​​nie ma podręczników ani kursów uniwersyteckich dla niej. Czy zgadzasz się / nie zgadzasz się?

Zgadzam się – ale to zależy od twojej definicji data science (z którą wiele osób się nie zgadza!). Dla mnie data science to połączenie trzech rzeczy: analizy ilościowej (dla rygoru niezbędnego do zrozumienia danych), programowania (abyś mógł przetwarzać dane i działać na podstawie swoich spostrzeżeń) oraz opowiadania historii (aby pomóc innym zrozumieć, co środki danych). Tak więc przydatne umiejętności dla analityka danych mogą obejmować:

* Statystyki, uczenie maszynowe (po stronie analizy ilościowej). Na przykład niemożliwe jest wydobycie znaczenia z danych, jeśli nie wiesz, jak odróżnić sygnały od szumu. (Podkreślę jednak, że wierzę, że każdy rodzaj silnej zdolności ilościowej jest w porządku – moje własne doświadczenie było pierwotnie w czystej matematyce i lingwistyce, a wielu innych tutaj wywodzi się z dziedzin takich jak fizyka i chemia. Zawsze możesz wybrać konkretnych narzędzi, których będziesz potrzebować).

* Ogólna umiejętność programowania oraz znajomość konkretnych obszarów, takich jak MapReduce/Hadoop i bazy danych. Na przykład typowym dla mnie wzorcem jest to, że zakoduję zadanie MapReduce w Scali, wykonam kilka prostych poleceń wiersza poleceń na wynikach, przekażę dane do Pythona lub R w celu dalszej analizy, wyciągnę z bazy danych, aby pobrać dodatkowe pola i tak dalej, często integrując to, co znalazłem w niektórych modelach uczenia maszynowego.

* Programowanie internetowe, wizualizacja danych (po stronie storytellingu). Na przykład uważam, że niezwykle przydatna jest możliwość wyrzucenia szybkiej aplikacji internetowej lub pulpitu nawigacyjnego, który pozwala innym osobom (w tym mnie) na interakcję z danymi – podczas komunikowania się zarówno z osobami technicznymi, jak i nietechnicznymi, dobra wizualizacja danych jest często o wiele bardziej pomocne i wnikliwe niż abstrakcyjna liczba.

Chociaż nie ma wielu podręczników lub kursów obejmujących wszystkie trzy obszary (jednym wyjątkiem może być kurs Jeffa Hammerbachera i Mike'a Franklina w Berkeley: http://datascience.es/ ), istnieją oczywiście zasoby, które obejmują tylko każdą umiejętność. (Wydaje się, że wizualizacja danych nadal jest niedocenianą umiejętnością, więc zajęcia z tego obszaru są rzadsze).

Obserwuj @Mims lub skontaktuj się z nami

ukryć