211service.com
Kiedy sztuczna inteligencja dostarcza dźwięk w klipach wideo, ludzie nie są w stanie powiedzieć różnicy
Uczenie maszynowe zmienia sposób, w jaki myślimy o obrazach i sposobie ich tworzenia. Naukowcy wyszkolili maszyny do generowania twarzy, rysowania kreskówek, a nawet przenoszenia stylu obrazów na obrazy. To tylko krótki krok od tych technik do tworzenia filmów w ten sposób, i rzeczywiście jest to już robione.
Wszystko to wskazuje na sposób tworzenia wirtualnych środowisk całkowicie przez maszynę. To otwiera wszelkiego rodzaju możliwości dla przyszłości ludzkiego doświadczenia.
Ale jest problem. Wideo to nie tylko doświadczenie wizualne; generowanie realistycznego dźwięku jest równie ważne. Tak więc interesujące pytanie brzmi, czy maszyny mogą przekonująco generować komponent audio wideo.
Dzisiaj otrzymujemy odpowiedź dzięki pracy Yipina Zhou i kumpli z University of North Carolina w Chapel Hill oraz kilku kumpli z Adobe Research. Ci faceci wyszkolili algorytm uczenia maszynowego, aby generować realistyczne ścieżki dźwiękowe do krótkich klipów wideo.
Rzeczywiście, dźwięki są tak realistyczne, że większość ludzi oszukuje, że są prawdziwe. Możesz zrób test sam tutaj aby zobaczyć, czy potrafisz odróżnić.
Zespół przyjmuje standardowe podejście do uczenia maszynowego. Algorytmy są zawsze tak dobre, jak dane użyte do ich trenowania, więc pierwszym krokiem jest utworzenie dużego, wysokiej jakości zestawu danych z adnotacjami i przykładami wideo.
Zespół tworzy ten zestaw danych, wybierając podzbiór klipów z kolekcji Google o nazwie Audioset, która składa się z ponad dwóch milionów 10-sekundowych klipów z YouTube, z których wszystkie zawierają zdarzenia dźwiękowe. Te filmy są podzielone na kategorie oznaczone przez człowieka, skupiające się na takich rzeczach jak psy, piły łańcuchowe, helikoptery itp.
Aby trenować maszynę, zespół musi mieć klipsy, w których źródło dźwięku jest wyraźnie widoczne. Dlatego każdy film, który zawiera dźwięk z wydarzeń poza ekranem, jest nieodpowiedni. Zespół odfiltrowuje je za pomocą pracowników crowdsourcingowych z usługi Amazon Mechanical Turk, aby znaleźć klipy, w których źródło dźwięku jest wyraźnie widoczne i dominuje w ścieżce dźwiękowej.
W ten sposób powstał nowy zestaw danych z ponad 28 000 filmów, każdy o długości około siedmiu sekund, obejmujący 10 różnych kategorii.
Następnie zespół wykorzystał te filmy, aby wyszkolić maszynę w rozpoznawaniu przebiegów skojarzonych z każdą kategorią i odtwarzać je od podstaw za pomocą sieci neuronowej o nazwie SampleRNN.
Na koniec przetestowali wyniki, prosząc osoby oceniające o ocenę jakości dźwięku towarzyszącego filmowi i ustalenie, czy jest on prawdziwy czy sztucznie wygenerowany.
Wyniki sugerują, że maszyny mogą być całkiem dobre w tym zadaniu. Nasze eksperymenty pokazują, że generowane dźwięki są dość realistyczne i mają dobrą synchronizację czasową z sygnałami wizualnymi, powiedzmy Zhou i spółka.
I wydaje się, że oceniający ludzie są zgodni. Oceny pokazują, że ponad 70% dźwięku generowanego przez nasze modele może oszukać ludzi, by myśleli, że są prawdziwe, mówią Zhou i spółka.
To interesująca praca, która toruje drogę do zautomatyzowanej edycji dźwięku. Częstym problemem w filmach jest to, że obcy hałas ze źródła poza ekranem może zepsuć klip. Przyda się więc możliwość automatycznego zastąpienia dźwięku realistyczną alternatywą generowaną maszynowo.
A dzięki zaangażowaniu firmy Adobe w te badania, może nie potrwać długo, zanim zobaczymy tego rodzaju możliwości w komercyjnym oprogramowaniu do edycji wideo.
Nr ref.: arxiv.org/abs/1712.01393 : Wizualizacja na dźwięk: generowanie naturalnego dźwięku dla filmów wideo na wolności