Jeśli wykonałeś Wyzwanie Manekina, teraz rozwijasz badania nad robotyką

Kategoria: Sztuczna inteligencja Opublikowany 26 czerwca





Wróć myślami do Internetu w 2016 roku. Czy masz mgliste wspomnienia z Wyzwania Manekinów? Cóż, wirusowy trend YouTube został teraz wykorzystany do trenowania sieci neuronowej w rozumieniu scen 3D.

Kontekst: Oczywiście jesteśmy dobrzy w interpretowaniu filmów 2D jako scen 3D, ale trzeba nauczyć maszyny, jak to robić. To przydatna umiejętność: umiejętność rekonstrukcji głębokości i rozmieszczenia swobodnie poruszających się obiektów może pomóc robotom manewrować w nieznanym otoczeniu. Dlatego wyzwanie to od dawna urzeka badaczy wizji komputerowych, zwłaszcza w kontekście autonomicznych samochodów.

Dane: Aby rozwiązać ten problem, zespół Google AI zwrócił się do nieoczekiwany zestaw danych : tysiące filmów na YouTube przedstawiających ludzi wykonujących Mannequin Challenge. (Jeśli zdarzyło się, że w tym czasie cię minęło, oznaczało to stanie jak najbardziej nieruchomo, podczas gdy ktoś poruszał się wokół ciebie, filmując pozę ze wszystkich stron). Te filmy są również nowatorskim źródłem danych do zrozumienia głębi Obraz 2D.



Metoda: Naukowcy przekonwertowali 2000 filmów na obrazy 2D z danymi głębi o wysokiej rozdzielczości i wykorzystali je do trenowania sieci neuronowej. Następnie był w stanie przewidzieć głębokość poruszających się obiektów w filmie ze znacznie większą dokładnością niż było to możliwe przy użyciu poprzednich najnowocześniejszych metod. W zeszłym tygodniu naukowcy zostali nagrodzeni wyróżnienie za najlepszy papier na dużej konferencji poświęconej wizji komputerowej.

Nieznający uczestników: Naukowcy udostępnili również swój zestaw danych, aby wesprzeć przyszłe badania, co oznacza, że ​​tysiące osób, które wzięły udział w Mannequin Challenge, będą nieświadomie nadal przyczyniać się do postępu w badaniach nad wizją komputerową i robotyką. Chociaż dla niektórych może to być nieprzyjemna niespodzianka, jest to raczej reguła w badaniach nad sztuczną inteligencją niż wyjątek.

Wiele z najbardziej fundamentalnych zbiorów danych w tej dziedzinie, w tym Fei-Fei Li ImageNet , które zapoczątkowały rewolucję głębokiego uczenia się, zostały skompilowane z publicznie dostępnych danych zebranych z Twittera, Wikipedii, Flickr i innych źródeł. Praktyka jest motywowana ogromną ilością danych wymaganych do trenowania algorytmów głębokiego uczenia się i została zaostrzona w ostatnich latach, ponieważ naukowcy produkują coraz większe modele aby osiągnąć przełomowe wyniki.



Prywatność danych: Jak pisaliśmy wcześniej, ta praktyka zbierania danych nie jest ani oczywiście dobra, ani zła, ale kwestionuje normy dotyczące zgody w branży. Ponieważ dane stają się coraz bardziej utowarowione i monetyzowane, technolodzy powinni zastanowić się, czy sposób, w jaki wykorzystują czyjeś dane, jest zgodny z duchem, dlaczego zostały pierwotnie wygenerowane i udostępnione.