System AI Facebooka może mówić głosem Billa Gatesa

Bill Gates

Bill Gates Jack Taylor / Stringer / Getty





Mowa maszynowa jest czymś w rodzaju rozczarowania. Nawet najlepsze systemy zamiany tekstu na mowę mają mechaniczną jakość i brak podstawowych zmian w intonacji, których używają ludzie. Przykładem jest często kopiowany system mowy Stephena Hawkinga.

To trochę niespodzianka, biorąc pod uwagę ogromne postępy w uczeniu maszynowym w ostatnich latach. Z pewnością techniki, które tak dobrze sprawdziły się w rozpoznawaniu twarzy i obiektów, a następnie tworzeniu ich realistycznych obrazów, powinny równie dobrze działać z dźwiękiem. Nie całkiem.

Przynajmniej nie do dzisiaj. Oto Sean Vasquez i Mike Lewis z Facebook AI Research, którzy znaleźli sposób na pokonanie ograniczeń systemów zamiany tekstu na mowę w celu tworzenia niezwykle realistycznych klipów audio generowanych w całości przez maszynę. Ich maszyna o nazwie MelNet nie tylko odtwarza ludzką intonację, ale potrafi to robić tym samym głosem, co prawdziwi ludzie. Tak więc zespół wyszkolił go, by mówił między innymi jak Bill Gates. Dzieło otwiera możliwość bardziej realistycznej interakcji między człowiekiem a komputerem, ale także podnosi widmo nowej ery fałszywych treści audio.



Najpierw trochę tła. Powolny postęp w realistycznych systemach zamiany tekstu na mowę nie wynika z braku prób. Wiele zespołów próbowało wytrenować algorytmy uczenia głębokiego w celu odtworzenia prawdziwych wzorców mowy przy użyciu dużych baz danych audio.

Problem z tym podejściem, powiedzmy Vasquez i Lewis, dotyczy rodzaju danych. Do tej pory większość prac koncentrowała się na nagraniach fal dźwiękowych. Pokazują one, jak amplituda dźwięku zmienia się w czasie, przy czym każda sekunda nagranego dźwięku składa się z dziesiątek tysięcy kroków czasowych.

Te przebiegi pokazują określone wzorce w wielu różnych skalach. Na przykład podczas kilkusekundowej mowy przebieg odzwierciedla charakterystyczne wzory związane z sekwencjami słów. Ale w skali mikrosekundowej kształt fali wykazuje cechy związane z wysokością i barwą głosu. A w innych skalach kształt fali odzwierciedla intonację mówiącego, strukturę fonemów i tak dalej.



Innym sposobem myślenia o tych wzorcach jest korelacja między przebiegiem w jednym kroku czasowym a następnym kroku czasowym. Tak więc dla danej skali czasu dźwięk na początku słowa jest skorelowany z dźwiękami, które następują po nim.

Spektrogram v przebieg

Systemy uczenia głębokiego powinny być dobre w uczeniu się tego typu korelacji i ich odtwarzaniu. Problem polega na tym, że korelacje działają w wielu różnych skalach czasowych, a systemy uczenia głębokiego mogą badać korelacje tylko w ograniczonych skalach czasowych. Dzieje się tak z powodu stosowanego przez nich procesu uczenia się, zwanego wsteczną propagacją, który wielokrotnie przebudowuje sieć, aby poprawić jej wydajność na podstawie widzianych przykładów.

Częstotliwość powtarzania ogranicza skalę czasu, w której można się nauczyć korelacji. Tak więc sieć głębokiego uczenia się może uczyć się korelacji w kształtach fal audio w długich lub krótkich skalach czasowych, ale nie w obu. Dlatego tak źle radzą sobie z odtwarzaniem mowy.



Vasquez i Lewis mają inne podejście. Zamiast fal dźwiękowych używają spektrogramów do trenowania swojej sieci głębokiego uczenia się. Spektrogramy rejestrują całe spektrum częstotliwości audio i ich zmiany w czasie. Tak więc, podczas gdy przebiegi rejestrują zmianę w czasie jednego parametru, amplitudy, spektrogramy rejestrują zmianę w ogromnym zakresie różnych częstotliwości.

Oznacza to, że informacje audio są upakowane gęściej w tego typu reprezentacji danych. Oś czasowa spektrogramu jest o rzędy wielkości bardziej zwarta niż w przypadku przebiegu fali, co oznacza, że ​​zależności obejmujące dziesiątki tysięcy kroków czasowych na falach obejmują tylko setki kroków czasowych na spektrogramach, mówią Vasquez i Lewis.

To sprawia, że ​​korelacje są bardziej dostępne dla systemu głębokiego uczenia się. Dzięki temu nasze modele spektrogramów mogą generować bezwarunkowe próbki mowy i muzyki ze spójnością przez wiele sekund.



A wyniki są imponujące. Po wytrenowaniu systemu przy użyciu zwykłej mowy z przemówień TED, MelNet jest następnie w stanie odtworzyć głos mówiącego TED, mówiącego mniej więcej cokolwiek w ciągu kilku sekund. Badacze Facebooka demonstrują jego elastyczność, używając rozmowy TED Billa Gatesa, aby wyszkolić MelNet, a następnie użyć jego głosu do wypowiedzenia szeregu losowych fraz.

To jest system mówiący, że marszczymy brwi, gdy wydarzenia przybierają zły obrót, a porto to mocne wino o dymnym smaku. Inne przykłady są tutaj.

Marszczymy brwi, gdy wydarzenia przybierają zły obrót

porto to mocne wino o dymnym smaku

Oczywiście istnieją pewne ograniczenia. Mowa zwyczajna zawiera korelacje w jeszcze dłuższych skalach czasowych. Na przykład ludzie używają zmian w intonacji, aby wskazać zmiany tematu lub nastroju, gdy historie rozwijają się przez dziesiątki sekund lub minut. Maszyna Facebooka nie wydaje się jeszcze do tego zdolna.

Tak więc, chociaż MelNet może tworzyć niezwykle realistyczne frazy, zespół nie udoskonalił jeszcze dłuższych zdań, akapitów ani całych historii. Nie wydaje się to być celem, który prawdopodobnie wkrótce zostanie osiągnięty.

Niemniej jednak prace mogą mieć znaczący wpływ na interakcję człowiek-komputer. Wiele rozmów zawiera tylko krótkie frazy. Operatorzy telefoniczni i help deski w szczególności mogą poradzić sobie z szeregiem stosunkowo krótkich fraz. Tak więc ta technologia może zautomatyzować te interakcje w sposób znacznie bardziej ludzki niż obecne systemy.

Na razie jednak Vasquez i Lewis milczą na temat potencjalnych zastosowań.

I jak zawsze, istnieją potencjalne problemy z naturalnie brzmiącymi maszynami, szczególnie tymi, które potrafią niezawodnie naśladować ludzi. Nie trzeba wiele wyobraźni, aby wymyślić scenariusze, w których ta technologia mogłaby zostać wykorzystana do psot. Z tego powodu jest to kolejny postęp związany z AI, który rodzi więcej pytań etycznych niż odpowiada.

Nr ref.: arxiv.org/abs/1906.01083 : MelNet: generatywny model dźwięku w domenie częstotliwości

ukryć