211service.com
Następny wielki krok dla sztucznej inteligencji? Zrozumienie wideo

Zrzut ekranu z jednego z filmów w zbiorze danych Moments in Time, który może pomóc AI lepiej zrozumieć zawartość wideo. Zbiór danych momentów w czasie
Jak na komputer, rozpoznanie kota lub kaczki na nieruchomym obrazie jest całkiem sprytne. Ale trudniejszym testem na sztuczną inteligencję będzie zrozumienie, kiedy kot jeździ Roomba i goniąc kaczkę po kuchni .
MIT i IBM opublikowały w tym tygodniu ogromny zestaw klipów wideo, starannie opatrzonych adnotacjami ze szczegółami prowadzonej akcji. ten Zbiór danych momentów w czasie zawiera trzysekundowe fragmenty wszystkiego, od wędkowania po breakdance.
Wiele rzeczy na świecie zmienia się z jednej sekundy na drugą, mówi Aude Oliva , główny naukowiec w MIT i jedna z osób stojących za projektem. Jeśli chcesz zrozumieć, dlaczego coś się dzieje, ruch dostarcza wielu informacji, których nie możesz uchwycić w jednej klatce.
Obecny boom na sztuczną inteligencję został po części wywołany sukcesem w nauczeniu komputerów rozpoznawania zawartości statycznych obrazów poprzez trenowanie głębokich sieci neuronowych na dużych, oznaczonych zbiorach danych (zobacz Rewolucyjna technika, która na zawsze zmieniła widzenie maszynowe).
Systemy sztucznej inteligencji, które dziś interpretują wideo, w tym systemy znajdujące się w niektórych autonomicznych samochodach, często opierają się na identyfikowaniu obiektów w statycznych klatkach, a nie na interpretacji czynności. W poniedziałek firma Google uruchomiła narzędzie zdolne do rozpoznawania obiektów w wideo w ramach swojej platformy Cloud Platform, usługi, która zawiera już narzędzia AI do przetwarzania obrazu, dźwięku i tekstu.
Kolejnym wyzwaniem może być nauczenie maszyn rozumienia nie tylko zawartości wideo, ale także tego, co dzieje się w materiale. Może to przynieść pewne praktyczne korzyści, być może prowadząc do nowych, potężnych sposobów wyszukiwania, dodawania adnotacji i wydobywania materiału wideo. Daje również możliwość lepszego zrozumienia przez roboty lub autonomiczne samochody tego, jak rozwija się świat wokół nich.
Projekt MIT-IBM jest w rzeczywistości tylko jednym z kilku zestawów danych wideo zaprojektowanych w celu pobudzenia postępów w maszynach treningowych w celu zrozumienia działań w świecie fizycznym. Na przykład w zeszłym roku Google wypuściło zestaw osiem milionów oznaczonych filmów z YouTube o nazwie YouTube-8M. Facebook opracowuje zestaw danych z adnotacjami dla działań wideo o nazwie zestaw Sceny, Akcje i Obiekty.
Olga Russakovsky, adiunkt na Uniwersytecie Princeton, która specjalizuje się w wizji komputerowej, mówi, że opracowanie użytecznych zestawów danych wideo okazało się trudne, ponieważ wymagają one więcej pamięci i mocy obliczeniowej niż obrazy nieruchome. Jestem podekscytowana, że mogę bawić się tymi nowymi danymi, mówi. Myślę, że długość trzech sekund jest świetna — zapewnia kontekst czasowy, jednocześnie utrzymując niskie wymagania dotyczące przechowywania i obliczeń.
Inni przyjmują bardziej kreatywne podejście. Dwadzieścia miliardów neuronów , startup z siedzibą w Toronto i Berlinie, stworzył niestandardowy zestaw danych, płacąc pracownikom crowdsourcingowym za wykonywanie prostych zadań. Jeden ze współzałożycieli firmy, Roland Memisević , mówi, że wykorzystuje również sieć neuronową zaprojektowaną specjalnie do przetwarzania informacji o wizji czasowej.
Sieci przeszkolone na innych zestawach danych mogą powiedzieć, czy film pokazuje mecz piłki nożnej, czy imprezę, mówi. Nasze sieci mogą powiedzieć, czy ktoś właśnie wszedł do pokoju.
Danny Gutfreund, badacz z IBM, który współpracował przy projekcie, mówi, że skuteczne rozpoznawanie działań będzie wymagało, aby maszyny poznały, powiedzmy, osobę podejmującą działanie i przeniosły tę wiedzę do przypadku, w którym, powiedzmy, zwierzę wykonuje tę samą czynność. Postęp w tej dziedzinie, znany jako transfer learning, będzie ważny dla przyszłości sztucznej inteligencji. Zobaczmy, jak maszyny mogą przeprowadzić uczenie transferowe, tę analogię, że robimy to bardzo dobrze, mówi.
Gutfreund dodaje, że technologia może mieć praktyczne zastosowania. Można go użyć do opieki nad osobami starszymi, mówiąc, czy ktoś upadł lub zażył lekarstwo, mówi. Możesz pomyśleć o urządzeniach, które pomagają osobom niewidomym.