211service.com
Wyszukiwanie wideo za pomocą wzroku i skryptu
Przejęcie przez Google w tym tygodniu YouTube.com wzbudziło nadzieje, że wyszukiwanie wideo ulegnie poprawie. Według strony internetowej ponad 65 000 filmów jest przesyłanych do YouTube każdego dnia. Przy całej tej zawartości znalezienie odpowiedniego klipu może być trudne.
Teraz naukowcy opracowali system, który wykorzystuje kombinację rozpoznawania twarzy, informacji o napisach i oryginalnych scenariuszach telewizyjnych, aby automatycznie nazywać twarze, które pojawiają się na ekranie, tworząc odcinki programu telewizyjnego Buffy pogromczyni wampirów przeszukiwać.
Zasadniczo postrzegamy tę pracę jako jeden z pierwszych kroków w uzyskaniu automatycznych opisów tego, co dzieje się w filmie, mówi Mark Everingham , informatyk obecnie pracujący na Uniwersytecie w Leeds (dawniej na Uniwersytecie Oksfordzkim), który we wrześniu zaprezentował swoje badania na brytyjskiej konferencji Machine Vision Conference.
Obecnie wyszukiwania wideo oferowane przez Wideo AOL , Google , oraz youtube nie przeszukuj samej treści wideo, ale polegaj głównie na metadanych lub opisach tekstowych napisanych przez użytkowników w celu opracowania przeszukiwalnego indeksu treści multimedialnych w sieci Web.
Użytkownicy często (i nielegalnie) przesyłają fragmenty swoich ulubionych seriali komediowych do witryn do udostępniania wideo, takich jak YouTube. Na przykład niedawne wyszukiwanie Buffy the Vampire Slayer w serwisie YouTube pojawiło się prawie 2000 klipów, z których wiele obejrzano tysiące razy. Większość z tych klipów ma mniej niż pięć minut, a opisy są niejasne. Na przykład jeden zatytułowany Nadszedł nowy dzień jest opisywany przez użytkownika w następujący sposób: Zawiera głównie Buffy i Spike. Pokazuje, jak Spike był tam dla Buffy, dopóki nie umarł, a potem poczuła się samotna.
Everingham mówi, że poprzednie prace nad wyszukiwaniem filmów wykorzystywały dane z napisów do wyszukiwania filmów, ale nie jest świadomy, że ktokolwiek korzystał z jego metody, która łączy – w technicznej prezentacji – napisy i adnotacje do skryptu. Scenariusz mówi ci, co zostało powiedziane i kto to powiedział, a napisy informują, o której godzinie coś zostało powiedziane, wyjaśnia. Oprogramowanie Everingham łączy te dwa źródła informacji z potężnymi narzędziami opracowanymi wcześniej do śledzenia twarzy i identyfikacji mówców bez konieczności ingerencji użytkownika.
Co sprawiło, że Buffy Projekt takie wyzwanie, mówi Everingham, polega na tym, że w filmie i telewizji osoba mówiąca nie zawsze znajduje się w kadrze. Gwiazda, Buffy, może na przykład mówić poza ekranem lub odwracać się od kamery, a kamera pokaże ci reakcje słuchacza. Innym razem na ekranie może być wielu aktorów lub twarz aktora nie jest skierowana bezpośrednio w stronę kamery. Wszystkie te niejasności są łatwe do zinterpretowania przez ludzi, ale trudne dla komputerów – przynajmniej do tej pory. Everingham twierdzi, że ich system multimodalny jest dokładny w 80% przypadków.
Pojedynczy odcinek Buffy może zawierać do 20 000 wykrytych twarzy, ale większość z tych przypadków jest wynikiem wielu klatek jednego znaku w danym ujęciu. Oprogramowanie śledzi kluczowe punkty orientacyjne na twarzach aktorów – na przykład nozdrza, źrenice i oczy – i jeśli jeden z nich nakłada się na następną klatkę, obie twarze są uważane za część jednej ścieżki. Jeśli jednak te punkty orientacyjne są niejasne, oprogramowanie wykorzystuje opis odzieży, aby połączyć dwie uszkodzone ślady twarzy. Wreszcie oprogramowanie obserwuje również usta aktorów, aby zidentyfikować, kto mówi lub czy mówca jest poza ekranem. Ostatecznie system tworzy szczegółową adnotację do filmu „odtwórz po odtworzeniu”.
Ogólna idea jest taka, że chcesz uzyskać więcej informacji bez konieczności ich przechwytywania przez ludzi, mówi Alex Berg z Grupa wizji komputerowej na Uniwersytecie Kalifornijskim w Berkeley. Jeśli chcesz znaleźć konkretną scenę z postacią, musisz najpierw znaleźć sceny zawierające tę postać. Mówi, że badania Everinghama utorują drogę bardziej złożonym wyszukiwaniom programów telewizyjnych.
Informatyk Josef Sivic w Oxfordzie Grupa geometrii wizualnej , który przyczynił się do powstania Buffy mówi, że w przyszłości będzie można wyszukiwać wysokopoziomowe koncepcje, takie jak Buffy i Spike idący w kierunku kamery trzymając się za rękę lub wszystkie sceny plenerowe zawierające Buffy.
Timothy Tuttle, wiceprezes AOL Video, mówi: Wygląda na to, że w ciągu najbliższych pięciu do dziesięciu lat coraz więcej osób będzie wybierać, co oglądać według własnego harmonogramu, i będzie oglądać treści na żądanie. Zauważa również, że bariera w adaptacji technologii takich jak Everingham może nie być już techniczna, ale legalna.
Te bariery prawne znikają wraz z mediami drukowanymi, ponieważ firmy czerpią korzyści finansowe z treści przeszukiwalnych – wykazano, że programy wyszukiwania Google Book Scan i Amazon wzrost sprzedaży książek w ciągu ostatnich dwóch lat .
Nie jest jednak jasne, czy wideo z możliwością wyszukiwania może w ten sam sposób zwiększyć sprzedaż płyt DVD. Obecnie Google oferuje zwiastuny treści wideo premium, mówi naukowiec Michele Covell. Mówi, że w przypadku niektórych gatunków, takich jak filmy sportowe, łatwiej jest wybrać zwiastun, który zachęci ludzi do zakupu filmu.
Shumeet Baluja, pracownik naukowy Google, zgadza się, że dodawanie adnotacji do filmów w sieci będzie wyzwaniem, ale z czasem będą mogli dodawać coraz więcej metadanych do popularnych klipów wideo w trybie offline, co poprawi szybkość i dokładność wyszukiwania.