211service.com
Co dalej z algorytmami Netflix?
Kiedy Nagroda Netflixa nagrodzony w zeszłym miesiącu, zakończył trzy lata intensywnej rywalizacji mającej na celu znalezienie lepszego algorytmu przewidywania preferencji filmowych użytkowników.
Zwycięski zespół, Pragmatyczny chaos BellKora , był pierwszym, który prognozował oceny filmów klientów Netflix z dokładnością o 10 procent większą niż wewnętrzny system firmy – wyczyn, który wielu ekspertów uważał za niemożliwy, gdy ogłoszono nagrodę w wysokości miliona dolarów. Netflix planuje zaoferować druga nagroda , tym razem dla algorytmów, które przewidują preferencje filmowe przy użyciu większej ilości informacji użytkownika, takich jak płeć, wiek i kod pocztowy. Eksperci twierdzą jednak, że prawdziwym wyzwaniem jest znalezienie sposobów zastosowania wniosków wyciągniętych z oryginalnego wyzwania Netflix do innych systemów rekomendacji.
Pod koniec października eksperci w tej dziedzinie spotkają się na Konferencja ACM na temat systemów rekomendujących w Nowym Jorku, aby zapytać m.in. o to, czego nauczyliśmy się z nagrody Netflix.
Uczestnicy oryginalnego konkursu Netflixa trenowali swoje algorytmy, korzystając z ogromnego zbioru danych: ponad 100 milionów ocen obejmujących prawie 18 000 tytułów od blisko pół miliona subskrybentów. Aby przetestować ich wyniki, ich algorytmy zostały przetestowane na zestawie danych utrzymywanych przez Netflix i utrzymywane w tajemnicy przed konkursami, aby zapobiec oszustwom.
Dane Netflixa przedstawiały kilka poważnych przeszkód, wyjaśnia Mikołaja Ampazisa , adiunkt na wydziale inżynierii finansowej i zarządzania na Uniwersytecie Morza Egejskiego w Grecji, którego zespół, Zespół , zakończył konkurs na drugim miejscu. Zbiór danych był ogromny, ale był też rzadki, co oznacza, że klienci zazwyczaj oceniali około 1 procent filmów, które oglądali. Przełamanie bariery 10 procent oznaczało zatem znaczne przesunięcie granic istniejących technik modelowania, mówi Ampazis.
Jednak wyzwania, jakie niosą ze sobą dane Netflix, również sprawiły, że konkurencja była bardzo cenna, według Te Bertino , inny członek The Ensemble. Badacze zwykle mają luksus wyboru zestawów danych i posiadania większej ilości informacji o tych danych. W konkursie Netflix uczestnicy zostali zmuszeni do zastosowania wszystkich algorytmów do tego samego zestawu frustrująco nierównych danych ze świata rzeczywistego. Ponieważ ludzie musieli używać stałego zestawu danych, musieli radzić sobie nie tylko z zaletami konkretnej metody, ale także z jej słabościami, mówi Bertino. Nie mogłeś przed tym uciec.
Gavin Potter , który zdobył uznanie za przebicie się w pierwszej dziesiątce nagrody Netflix w 2008 roku pod pseudonimem Tylko facet w garażu, mówi, że kilka kluczowych realizacji pozwoliło zwycięskim algorytmom osiągnąć cel. Po pierwsze, zaawansowany algorytm wyszukiwania wzorców w zestawach danych, technika znana jako filtrowanie zespołowe, został usprawniony, aby można go było używać w dużym zestawie danych Netflix. Po drugie, uczestnicy nauczyli się zwracać uwagę na pewne nowe typy szczegółów, na przykład fakt, że zamówienie filmu w ogóle wskazuje na jego preferencje, nawet jeśli klient go nie ocenił. Istotne okazały się również informacje o dacie i godzinie. Ale największym uświadomieniem, zauważa Potter, było to, że połączenie różnych podejść dało najlepsze rezultaty.
Mieszanie różnych podejść przyciągnęło wiele uwagi w sekcji zwłok zawodów, ale Jan Riedl , profesor informatyki na University of Minnesota, mówi, że ma mieszane uczucia. Ludzie tacy jak ja szukali pomysłów, które dałyby nam wgląd w strukturę rozwiązania, mówi, gdzie naprawdę rozumiemy coś nowego nie tylko o tym, co rozwiązanie działa dobrze, ale także dlaczego tak się dzieje.
Zwycięskie modele nie dały jednak takiego wglądu. Według Riedla sugerują, że połączenie wielu algorytmów z technikami uczenia maszynowego może być dobrym podejściem do ogólnej obsługi dużych zbiorów danych. Jednak nawet to pozostaje do udowodnienia. Wielu z nas martwi się, że takie podejście może nie być tak owocne gdzie indziej – dodaje.
Oczywiste jest, że wiele branż mogłoby skorzystać na typach modeli tworzonych dla konkurencji. Oprócz innych internetowych systemów rekomendacji, Ampazis sugeruje, że takie algorytmy mogą być stosowane w handlu rynkowym, wykrywaniu oszustw, walce ze spamem i bezpieczeństwie komputerowym. Bertino mówi, że członkowie The Ensemble zastanawiają się obecnie, jak najlepiej wykorzystać technologię, którą wygenerowali podczas konkursu.
Potter pracuje nad zastosowaniem własnych badań do nagrody w internetowym serwisie randkowym TakNieMajB , który wykorzystuje dwukierunkowe algorytmy rekomendacji w celu znalezienia użytkowników, którzy mogą chcieć się spotkać. W szczególności ma nadzieję, że wykorzysta spostrzeżenia z nagrody Netflix, aby przewidywać na podstawie ukrytych preferencji użytkowników, takich jak to, jakie strony ładują.
Nagroda Netflixa skupiła wiele uwagi na systemach rekomendacji i przyniosła ogromne postępy w tej dziedzinie. Wydaje się, że druga konkurencja zrobi to samo. Ale Riedl uważa, że inne elementy systemów rekomendacji mogą zostać w tym procesie pominięte. Teraz nadszedł czas, abyśmy jako dziedzina zastanowili się, jakie inne aspekty mogły zostać zaniedbane, mówi, i jak naukowcy mogą poczynić postępy w tych aspektach w sposób, który ma wpływ na przemysł.
Na przykład Riedl widzi potrzebę stworzenia algorytmów, które pozwalają systemom rekomendacji na używanie coraz większych zbiorów danych, systemów wyjaśniających użytkownikowi, dlaczego dana rekomendacja została wydana, oraz lepszych interfejsów użytkownika. Zauważa również, że chociaż konkurencja Netflix poczyniła imponujące postępy w interpretacji rzadkich danych, w niektórych przypadkach warto nauczyć się projektować witryny, aby zachęcić użytkowników do podawania większej ilości danych. Ma nadzieję, że zbliżające się spotkanie w Nowym Jorku pomoże zdefiniować szerszy zestaw pytań, na które naukowcy mogą odpowiedzieć.