Aktorzy głosowi AI brzmią bardziej ludzko niż kiedykolwiek — i są gotowi do zatrudnienia

Koncepcja aktora lektora AI

Pani Tech | Getty





Firmowy wpis na blogu ocieka entuzjazmem amerykańskiego filmu informacyjnego z lat 90. WellSaid Labs opisuje, czego klienci mogą oczekiwać od ośmiu nowych cyfrowych aktorów głosowych! Tobin jest energiczny i wnikliwy. Paige jest opanowana i wyrazista. Ava jest dopracowana, pewna siebie i profesjonalna.

Każdy z nich oparty jest na prawdziwym aktorze głosowym, którego podobizna (za zgodą) została zachowana za pomocą sztucznej inteligencji. Firmy mogą teraz licencjonować te głosy, aby mówiły, czego potrzebują. Po prostu wprowadzają tekst do silnika głosowego, a na wyjściu wyświetlają wyraźny klip audio o naturalnie brzmiącym brzmieniu.

Laboratoria WellSaid , startup z siedzibą w Seattle, który wyłonił się z non-profit badawczej Allen Institute of Artificial Intelligence, jest najnowszą firmą oferującą klientom głosy AI. Na razie specjalizuje się w głosach do firmowych filmów e-learningowych. Inne startupy przemawiają za asystenci cyfrowi , operatorzy call center , i nawet postacie z gier wideo .



KH · Aktor podkładający głos pod sztuczną inteligencją WellSaid w promocyjnym stylu

Nie tak dawno temu takie głębokie głosy miały kiepską reputację ze względu na ich użycie w oszustwa telefoniczne oraz oszustwo internetowe . Jednak ich poprawiająca się jakość wzbudziła od tego czasu zainteresowanie coraz większej liczby firm. Ostatnie przełomy w uczeniu głębokim umożliwiły odtworzenie wielu subtelności ludzkiej mowy. Te głosy zatrzymują się i oddychają we wszystkich właściwych miejscach. Mogą zmienić swój styl lub emocje. Możesz dostrzec sztuczkę, jeśli mówią zbyt długo, ale w krótkich klipach audio niektóre z nich stały się nie do odróżnienia od ludzi.

Głosy AI są również tanie, skalowalne i łatwe w obsłudze. W przeciwieństwie do nagrania ludzkiego aktora głosowego, syntetyczne głosy mogą również aktualizować swój scenariusz w czasie rzeczywistym, otwierając nowe możliwości personalizacji reklam.

Jednak pojawienie się hiperrealistycznych fałszywych głosów nie jest wolne od konsekwencji. W szczególności aktorzy głosowi musieli się zastanawiać, co to oznacza dla ich źródeł utrzymania.



Jak sfałszować głos

Głosy syntetyczne istnieją już od jakiegoś czasu. Ale stare, w tym głosy oryginału Syria oraz Alexa , po prostu sklejając słowa i dźwięki, aby uzyskać niezgrabny, robotyczny efekt. Sprawienie, by brzmiały bardziej naturalnie, było pracochłonnym zadaniem manualnym.

Głębokie uczenie się to zmieniło. Twórcy głosu nie musieli już dyktować dokładnego tempa, wymowy lub intonacji generowanej mowy. Zamiast tego mogliby wprowadzić kilka godzin dźwięku do algorytmu i sprawić, by algorytm sam nauczył się tych wzorców.

Jeśli jestem Pizza Hut, z pewnością nie mogę brzmieć jak Domino, a już na pewno nie mogę brzmieć jak Papa John.



Rupal Patel, założyciel i dyrektor generalny VocaliD

Przez lata naukowcy wykorzystywali tę podstawową ideę do budowania coraz bardziej wyrafinowanych silników głosowych. Na przykład ten, który zbudował WellSaid Labs, wykorzystuje dwa podstawowe modele uczenia głębokiego. Pierwsza przewiduje, na podstawie fragmentu tekstu, szerokie pociągnięcia tego, jak będzie brzmiał mówca — w tym akcent, wysokość i barwa. Drugi wprowadza szczegóły, w tym oddechy i sposób, w jaki głos rezonuje w swoim otoczeniu.

Jednak stworzenie przekonującego syntetycznego głosu wymaga czegoś więcej niż tylko naciśnięcia przycisku. Częścią tego, co sprawia, że ​​ludzki głos jest tak ludzki, jest jego niespójność, ekspresja i zdolność do przekazywania tych samych linii w zupełnie różnych stylach, w zależności od kontekstu.

Uchwycenie tych niuansów polega na znalezieniu odpowiednich aktorów głosowych w celu dostarczenia odpowiednich danych szkoleniowych i dostrojenia modeli uczenia głębokiego. WellSaid mówi, że proces wymaga co najmniej godziny lub dwóch dźwięku i kilku tygodni pracy, aby stworzyć realistycznie brzmiącą syntetyczną replikę.



KH · Agent obsługi klienta Resemble.ai KH · Aktor głosowy Resemble.ai w stylu konwersacyjnym

Głosy AI stały się szczególnie popularne wśród marek, które chcą zachować spójny dźwięk w milionach interakcji z klientami. Wraz z wszechobecnością inteligentnych głośników i wzrostem liczby zautomatyzowanych agentów obsługi klienta, a także cyfrowych asystentów wbudowanych w samochody i inteligentne urządzenia, marki mogą być zmuszone do produkowania nawet stu godzin dźwięku miesięcznie. Ale nie chcą już używać ogólnych głosów oferowanych przez tradycyjną technologię przetwarzania tekstu na mowę – trend, który przyspieszył podczas pandemii, ponieważ coraz więcej klientów pomijało interakcje w sklepie, aby wirtualnie kontaktować się z firmami.

Jeśli jestem Pizza Hut, z pewnością nie mogę brzmieć jak Domino, a już na pewno nie mogę brzmieć jak Papa John's, mówi Rupal Patel, profesor na Northeastern University oraz założyciel i dyrektor generalny VocaliD, który obiecuje tworzyć niestandardowe głosy. które pasują do tożsamości marki firmy. Te marki pomyślały o swoich kolorach. Pomyśleli o swoich czcionkach. Teraz muszą również zacząć myśleć o tym, jak brzmi ich głos.

Karen Hao, MIT Tech Review · Próbka reklamy VocaliD z męskim głosem Karen Hao, MIT Tech Review · Próbka reklamy VocaliD z żeńskim głosem

Podczas gdy firmy musiały zatrudniać różnych aktorów głosowych na różnych rynkach — północno-wschodnim kontra południowe Stany Zjednoczone lub Francja kontra Meksyk — niektóre firmy wykorzystujące sztuczną inteligencję głosową mogą manipulować akcentem lub zmieniać język jednego głosu na różne sposoby. Otwiera to możliwość dostosowania reklam na platformach streamingowych w zależności od tego, kto słucha, zmieniając nie tylko charakterystykę głosu, ale także wypowiadanych słów. Reklama piwa może powiedzieć słuchaczowi, aby zatrzymał się w innym pubie, w zależności od tego, czy gra się na przykład w Nowym Jorku czy Toronto. Resemble.ai, który projektuje głosy do reklam i inteligentnych asystentów, twierdzi, że już współpracuje z klientami nad uruchomieniem takich spersonalizowanych reklam audio w Spotify i Pandorze.

Korzyści dostrzegają również branże gier i rozrywki. Sonantic, firma specjalizująca się w głosach emocjonalnych, które potrafią śmiać się i płakać lub szeptać i krzyczeć, współpracuje z twórcami gier wideo i studiami animacji, aby zapewnić podkłady głosowe ich postaciom. Wielu jej klientów używa zsyntetyzowanych głosów tylko w fazie przedprodukcyjnej i przełącza się na prawdziwych aktorów głosowych do ostatecznej produkcji. Ale Sonantic mówi, że niektórzy zaczęli ich używać podczas całego procesu, być może w przypadku postaci z mniejszą liczbą wierszy. Resemble.ai i inni współpracowali również z filmami i programami telewizyjnymi, aby załatać występy aktorów, gdy słowa zostaną przekręcone lub źle wymówione.

Ale istnieją ograniczenia dotyczące tego, jak daleko może się posunąć sztuczna inteligencja. Nadal trudno jest zachować realizm głosu przez długi czas, który może być wymagany w przypadku audiobooka lub podcastu. I nie ma możliwości kontrolowania działania głosu AI w taki sam sposób, w jaki reżyser może kierować ludzkim wykonawcą. Wciąż jesteśmy w początkach mowy syntetycznej, mówi Zohaib Ahmed, założyciel i dyrektor generalny Resemble.ai, porównując ją do czasów, kiedy technologia CGI była używana głównie do retuszu, a nie do tworzenia zupełnie nowych światów z zielonych ekranów .

Ludzki dotyk

Innymi słowy, aktorzy z ludzkim głosem jeszcze nie odchodzą. Ekspresyjne, kreatywne i długofalowe projekty nadal najlepiej wykonują ludzie. W przypadku każdego syntetycznego głosu wyprodukowanego przez te firmy aktor głosowy musi również dostarczyć oryginalne dane szkoleniowe.

Ale niektórzy aktorzy coraz bardziej martwią się o swoje źródła utrzymania, mówi rzecznik SAG-AFTRA, związku reprezentującego aktorów głosowych w USA. Jeśli nie boją się zautomatyzowania przez sztuczną inteligencję, obawiają się niesprawiedliwego wynagrodzenia lub utraty kontroli nad głosami, które stanowią o ich marce i reputacji.

To jest teraz przedmiot pozwu przeciwko TikTok wniesionemu przez kanadyjskiego aktora głosowego Bev Standing, który twierdzi, że wbudowana funkcja podkładania głosu w aplikacji wykorzystuje syntetyczną kopię jej głosu bez jej zgody. Doświadczenie Standing również odzwierciedla to z Susan Bennett , oryginalny głos amerykańskiej Siri, której zapłacono za pierwsze nagrania, ale nie za dalsze wykorzystywanie jej podobizny wokalnej na milionach urządzeń Apple.

Niektóre firmy chcą być bardziej odpowiedzialne za to, jak angażują się w branżę aktorską. Najlepsi, mówi przedstawiciel SAG-AFTRA, zwrócili się do związku, aby znaleźć najlepszy sposób na wynagrodzenie i szacunek dla aktorów głosowych za ich pracę.

Ci przerażający fałszywi ludzie zwiastują nową erę w sztucznej inteligencji

Potrzebujesz więcej danych do głębokiego uczenia? Firmy zajmujące się danymi syntetycznymi zrobią to za Ciebie.

Kilka z nich korzysta teraz z modelu podziału zysków, aby płacić aktorom za każdym razem, gdy klient licencjonuje ich określony syntetyczny głos, co otworzyło nowy strumień pasywnego dochodu. Inne angażują aktorów w proces projektowania ich podobizny AI i dają im prawo weta w stosunku do projektów, w których zostanie wykorzystana. SAG-AFTRA naciska również na ustawodawstwo chroniące aktorów przed nielegalnymi replikami ich głosu.

Ale dla Patel z VocaliD celem głosów AI nie jest ostatecznie replikowanie ludzkiej wydajności ani automatyzacja istniejącej pracy z lektorem. Zamiast tego obiecują, że mogą otworzyć zupełnie nowe możliwości. Co by było, gdyby w przyszłości, jak mówi, syntetyczne głosy mogły być używane do szybkiego dostosowywania internetowych materiałów edukacyjnych do różnych odbiorców? Jeśli próbujesz dotrzeć, powiedzmy, do grupy dzieci z śródmieścia, czy nie byłoby wspaniale, gdyby ten głos rzeczywiście brzmiał tak, jakby pochodził z ich społeczności?

ukryć