Dokąd zmierza rozpoznawanie mowy





Do niedawna pomysł prowadzenia rozmowy z komputerem wydawał się czystym science fiction. Jeśli poprosiłeś komputer, aby otworzył drzwi wnęki na kapsuły - cóż, to było tylko w filmach.

Ale wszystko się zmienia i to szybko. Coraz więcej osób rozmawia teraz ze swoimi telefonami komórkowymi, prosząc ich o wysyłanie e-maili i wiadomości tekstowych, szukanie wskazówek lub znajdowanie informacji w Internecie.

Jesteśmy w punkcie przejściowym, w którym głos i rozumienie języka naturalnego nagle wysuwają się na pierwszy plan, mówi Vlad Sejnoha, dyrektor ds. technologii Nuance Communications, firmy z siedzibą w Burlington w stanie Massachusetts, która dominuje na rynku rozpoznawania mowy dzięki oprogramowaniu Dragon i inne produkty. Myślę, że rozpoznawanie mowy naprawdę zmieni obecny interfejs [komputera].



Postęp nastąpił po części dzięki stałemu postępowi w technologiach potrzebnych maszynom do rozumienia ludzkiej mowy, w tym uczeniu maszynowemu i technikom statystycznego eksploracji danych. Zaawansowana technologia głosowa jest już powszechna w call center, gdzie umożliwia użytkownikom poruszanie się po menu i pomaga zidentyfikować zirytowanych klientów, których należy przekazać prawdziwemu przedstawicielowi obsługi klienta.

Teraz szybki rozwój wydajnych urządzeń mobilnych sprawia, że ​​interfejsy głosowe są jeszcze bardziej użyteczne i wszechobecne.

Jim Glass, starszy naukowiec w MIT, który od lat 80. pracuje nad interfejsami mowy, mówi, że dzisiejsze smartfony mają taką samą moc obliczeniową, jak urządzenia laboratoryjne, z którymi pracował w latach 90. Smartfony mają również szerokopasmowe połączenia transmisji danych z chmurą, gdzie serwery mogą wykonywać najtrudniejsze zadania związane zarówno z rozpoznawaniem głosu, jak i rozumieniem wypowiadanych zapytań. Połączenie większej ilości danych i większej mocy obliczeniowej oznacza, że ​​dziś możesz robić rzeczy, których wcześniej nie mogłeś robić, mówi Glass. Możesz użyć bardziej wyrafinowanych modeli statystycznych.



Najbardziej znanym przykładem mobilnego interfejsu głosowego jest oczywiście Siri, aktywowany głosem osobisty asystent, który jest wbudowany w najnowszy iPhone. Jednak funkcje głosowe są wbudowane w system Android, platformę Windows Phone i większość innych systemów mobilnych, a także w wiele aplikacji. Chociaż te interfejsy nadal mają znaczne ograniczenia (patrz Inteligencja społeczna), zbliżamy się coraz bardziej do interfejsów maszyn, z którymi możemy faktycznie rozmawiać.

Nuance jest sercem boomu w technologii głosowej. Firma została założona w 1992 roku jako Visioneer i przejęła dziesiątki innych firm zajmujących się technologiami głosowymi. Obecnie zatrudnia ponad 6000 pracowników w 35 lokalizacjach na całym świecie, a jej przychody w drugim kwartale 2012 roku wyniosły 390,3 mln USD, co stanowi 22,4 procentowy wzrost w porównaniu z tym samym okresem w 2011 roku.

W ostatnich latach firma Nuance zręcznie zastosowała swoje doświadczenie w rozpoznawaniu głosu na wschodzącym rynku interfejsów głosowych. Firma dostarcza technologię rozpoznawania głosu wielu innym firmom i powszechnie uważa się, że dostarcza komponent mowy Siri.



Mowa idealnie nadaje się do komputerów przenośnych, mówi dyrektor ds. technologii Nuance, częściowo dlatego, że użytkownicy mają zajęte ręce i oczy, ale także dlatego, że pojedyncze polecenie głosowe może wykonać zadania, które normalnie wymagałyby wielu przeciągnięć i naciśnięć. Nagle masz ten nowy budulec, ten nowy wymiar, który możesz wnieść do problemu – mówi Sejnoha. I myślę, że będziemy projektować podstawowy, nowoczesny interfejs użytkownika, mając to na uwadze.

Zainspirowany sukcesem oprogramowania do rozpoznawania głosu w telefonach komórkowych, firma Nuance ma nadzieję umieścić swoje interfejsy głosowe w wielu innych miejscach, w szczególności w telewizji i samochodzie. Oba są popularne i gotowe do innowacji.

Aby znaleźć program w telewizji lub zaplanować nagrywanie na DVR, widzowie muszą obecnie poruszać się po niewygodnych menu za pomocą pilota, który nigdy nie był przeznaczony do wprowadzania zapytań tekstowych. Produkty, które miały ułatwić znalezienie programu, takie jak Google TV, okazały się zbyt skomplikowane dla osób, które chcą po prostu odpocząć na wieczorną rozrywkę.



W laboratoriach badawczych Nuance, Sejnoha zademonstrowała oprogramowanie o nazwie Dragon TV działające na telewizorze w wymyślonym salonie. Kiedy kolega powiedział, Dragon TV, znajdź filmy z Meryl Streep, interfejs natychmiast przejrzał listę kanałów, aby wybrać kilka odpowiednich filmów. Wersja tej technologii jest już w niektórych telewizorach sprzedawanych przez Samsunga.

Powszechnie mówi się, że Apple opracowuje własny telewizor i spekuluje się, że Siri będzie jego kontrolerem. Pomysł podsyciła biografia Steve'a Jobsa autorstwa Waltera Isaacsona, w której zmarły dyrektor generalny twierdził, że w końcu rozwiązał problem z interfejsem telewizyjnym.

Tymczasem system rozrywki Sync w samochodach Forda już wykorzystuje technologię Nuance, aby umożliwić kierowcom wyświetlanie wskazówek, informacji o pogodzie i piosenek. Około czterech milionów samochodów Forda na drogach ma funkcję Sync z rozpoznawaniem głosu. W zeszłym tygodniu firma Nuance wprowadziła oprogramowanie o nazwie Dragon Drive, które pozwoli innym producentom samochodów dodawać do pojazdów funkcje sterowania głosowego.

Oba te nowe konteksty są wyzwaniem. Jednym z powodów, dla których interfejsy głosowe stały się popularne w smartfonach, jest to, że użytkownicy mówią bezpośrednio do mikrofonu urządzenia. Aby upewnić się, że system działa dobrze w telewizorach i samochodach, gdzie jest więcej hałasu w tle, firma eksperymentuje z mikrofonami kierunkowymi i technologią redukcji szumów.

Firma Nuance udostępnia wiele zestawów programistycznych dla każdego, kto chce włączyć technologię rozpoznawania głosu do aplikacji. Montrue Technologies, firma z siedzibą w Ashland w stanie Oregon, wykorzystała mobilny medyczny SDK Nuance do opracowania aplikacji na iPada, która pozwala lekarzom dyktować notatki.

To zadziwiająco dokładne, mówi Brian Phelps, dyrektor generalny i współzałożyciel Montrue, a także lekarz z oddziału ratunkowego. Mowa skręciła za rogiem; Doszło do punktu, w którym uzyskujemy niesamowitą dokładność od razu po wyjęciu z pudełka.

Z kolei zestawy wzmacniają pozycję Nuance, pomagając firmie ulepszyć jej algorytmy rozpoznawania głosu i przetwarzania języka poprzez wysyłanie coraz większej ilości danych głosowych przez jej serwery. Jak mówi Glass z MIT, w społeczności zajmującej się rozpoznawaniem mowy od dawna mówi się: „Nie ma takich danych, jak więcej danych”. Nuance twierdzi, że przechowuje dane w anonimowym formacie, aby chronić prywatność.

Sejnoha wierzy, że w ciągu kilku lat mobilne interfejsy głosowe będą znacznie bardziej wszechobecne i wydajne. Powinienem móc z nim rozmawiać bez dotykania go, mówi. Będzie stale nasłuchiwać słów wyzwalających i po prostu to zrobi - wyskoczy kalendarz, przygotuje wiadomość tekstową lub przeglądarkę, która jest nawigowana do miejsca, w którym chcesz się udać.

Być może ludzie będą nawet rozmawiać z komputerami, które noszą, takimi jak okulary do robienia zdjęć, które powstają w Google. Źródła w Nuance twierdzą, że aktywnie planują, w jaki sposób technologia mowy musiałaby zostać zaprojektowana, aby działała na komputerach do noszenia.

ukryć