211service.com
System głębokiego uczenia Baidu rywalizuje z ludźmi w rozpoznawaniu mowy
Wiodąca chińska firma zajmująca się wyszukiwarką internetową, Baidu, opracowała system głosowy, który w niektórych przypadkach może lepiej rozpoznawać mowę angielską i mandaryńską niż ludzie.
Nowy system, zwany Głęboka mowa 2 , ma szczególne znaczenie ze względu na to, że tłumaczenie opiera się całkowicie na uczeniu maszynowym. Podczas gdy starsze systemy rozpoznawania głosu zawierają wiele ręcznie wykonanych komponentów, które wspomagają przetwarzanie i transkrypcję dźwięku, system Baidu nauczył się rozpoznawać słowa od podstaw, po prostu słuchając tysięcy godzin transkrybowanego dźwięku.
Technologia ta opiera się na potężnej technice zwanej głębokim uczeniem, która polega na trenowaniu bardzo dużej, wielowarstwowej wirtualnej sieci neuronów w celu rozpoznawania wzorców w ogromnych ilościach danych. Aplikacja Baidu na smartfony umożliwia użytkownikom wyszukiwanie głosowe, a także zawiera osobistego asystenta sterowanego głosem o nazwie Duer (patrz: Baidu Duer dołącza do imprezy z osobistym asystentem ). Zapytania głosowe są bardziej popularne w Chinach, ponieważ wprowadzanie tekstu jest bardziej czasochłonne, a niektórzy ludzie nie wiedzą, jak używać Pinyin, fonetycznego systemu transkrypcji mandaryńskiego przy użyciu znaków łacińskich.
W przeszłości ludzie postrzegali chiński i angielski jako dwa bardzo różne języki, więc istniała potrzeba zaprojektowania bardzo różnych funkcji, mówi Andrew Ng, były profesor Stanford i badacz Google, a obecnie główny naukowiec chińskiej firmy. Algorytmy uczenia się są teraz tak ogólne, że możesz się po prostu uczyć.
Głębokie uczenie ma swoje korzenie w pomysłach opracowanych po raz pierwszy ponad 50 lat temu, ale w ciągu ostatnich kilku lat nowe techniki matematyczne, w połączeniu z większą mocą komputera i ogromnymi ilościami danych treningowych, doprowadziły do niezwykłego postępu, zwłaszcza w zadaniach, które wymagają pewnego rodzaju percepcji wzrokowej lub słuchowej. Technika ta już poprawiła wydajność rozpoznawania głosu i przetwarzania obrazu, a duże firmy, w tym Google, Facebook i Baidu, stosują ją do ogromnych zbiorów danych, które posiadają.
Głębokie uczenie jest również dostosowywane do coraz większej liczby zadań. Na przykład Facebook wykorzystuje głębokie uczenie się, aby znajdować twarze na obrazach przesyłanych przez użytkowników. A ostatnio poczyniono postępy w używaniu głębokiego uczenia się do analizowania tekstu pisanego (patrz Uczenie maszyn, aby nas zrozumieć ). Google wykorzystuje teraz głębokie uczenie w ponad 100 różnych projektach, od wyszukiwania po samochody autonomiczne.
W 2013 r. Baidu rozpoczął własne wysiłki, aby wykorzystać tę nową technologię, Instytut Deep Learning , zlokalizowanych w centrali firmy w Pekinie oraz w Dolinie Krzemowej. Deep Speech 2 został opracowany głównie przez zespół z Kalifornii.
Opracowując Deep Speech 2, Baidu stworzył również nową architekturę sprzętową do głębokiego uczenia, która działa siedmiokrotnie szybciej niż poprzednia wersja. Głębokie uczenie zwykle opiera się na procesorach graficznych, ponieważ są one dobre w przypadku intensywnych obliczeń równoległych.
Osiągnięta prędkość pozwoliła nam przeprowadzić eksperymenty na znacznie większą skalę niż ludzie osiągnęli wcześniej, mówi Jesse Engel , naukowiec z Baidu i jeden z ponad 30 badaczy wymienionych w artykule opisującym Deep Speech 2. Udało nam się przeszukać wiele architektur [sieci neuronowych] i zmniejszyć wskaźnik błędów słów o 40 procent.
Ng dodaje, że ostatnio przyniosło to imponujące rezultaty. W przypadku krótkich fraz, wyrwanych z kontekstu, wydaje się, że przekraczamy ludzkie poziomy rozpoznania, mówi.
Dodaje: W mandaryńskim istnieje wiele regionalnych dialektów, którymi posługują się znacznie mniejsze populacje, więc danych jest znacznie mniej. Pomoże nam to lepiej rozpoznać dialekty.