Również w przypadku komputerów trudno jest nauczyć się mówić po chińsku





Naukowcy często nazywają rok 2017 rokiem komputerów konwersacyjnych w Chinach. Wykorzystując ostatnie postępy w rozpoznawaniu głosu i przetwarzaniu języka naturalnego, gigant e-commerce Alibaba i gigant wyszukiwania Baidu opracowują technologię łamania komunikacji głosowej (patrz 10 przełomowych technologii: interfejsy konwersacyjne). Obecnie produkty obsługiwane głosem wywodzące się od Baidu a technologia Alibaba wkracza na rynek chiński.

Tmall Genie, który ma wbudowanego asystenta głosowego Alibaba, AliGenie, jest podobny do Amazon Echo. Może składać zamówienia online, sprawdzać pogodę, odtwarzać ulubioną muzykę i sterować innymi inteligentnymi urządzeniami w domu za pomocą poleceń głosowych.

Platforma konwersacyjna Baidu DueOS została dodana jako funkcja w takich produktach, jak robot asystujący w domu, dekoder telewizyjny i smartfon HTC. Ma podobne funkcje do AliGenie i innych asystentów głosowych, a także podstawowe możliwości prowadzenia losowego czatu, a firma twierdzi, że otrzymała dużą liczbę zamówień na zestaw deweloperski DuerOS.



Kun Jing, dyrektor generalny jednostki biznesowej Baidu Duer, spodziewa się, że w tym roku na rynek wejdzie o wiele więcej firm, częściowo motywowanych sukcesem produktów takich jak Echo na rynku amerykańskim, który wzbudził zainteresowanie chińskich inwestorów technologicznych.

Firma badawcza IDC przewiduje, że do 2020 r. 51 procent branży inteligentnej jazdy i 68 procent branży telefonów komórkowych i urządzeń do noszenia w Chinach będzie miało wbudowany system sztucznej inteligencji oparty na rozmowach. o wiele prostsze, konwersacyjne interfejsy sprawią, że interakcja będzie bardziej naturalna i przyciągnie więcej ludzi do połączonego świata, mówi Jing, który nadzoruje rozwój DueOS.

Przetwarzanie głosowe to dobra opcja dla Chin. Dzisiaj pisanie po chińsku na typowej klawiaturze QWERTY opiera się na systemie zwanym pinyin, opartym na wymowie znaków, ale ponieważ mandaryński ma cztery tony i każdy ma inne znaczenie, użytkownik musi starannie wybrać właściwy znak z rozwijanego menu po wpisaniu wymowy. Powszechna sylaba, taka jak yi, może odpowiadać 60 lub więcej często używanym chińskim znakom. Niektóre metody wprowadzania mogą priorytetyzować najbardziej prawdopodobny znak w zależności od kontekstu, ale nie zawsze są one dokładne. Nic dziwnego, że użytkownicy technologii mobilnych, takich jak popularna aplikacja komunikacyjna WeChat, mają tendencję do pozostawiania sobie nawzajem wiadomości słownych, a nie typowych dla USA tekstów maszynowych.



W dzisiejszych Chinach technologia asystenta głosowego działa poprzez przekształcanie poleceń głosowych użytkownika w tekst i generowanie odpowiedzi na podstawie znaczenia tekstu. Ten proces działa całkiem dobrze w przypadku poleceń opartych na zadaniach — sprawdź pogodę lub poszukaj angielskiego tłumaczenia określonego chińskiego słowa — ale nie może utrzymać rozmowy w tę i z powrotem na wiele tematów.

Rozwiązanie przetwarzania konwersacyjnego będzie wymagało pokonania niektórych trudnych zawiłości języka chińskiego. Na przykład w języku chińskim te same znaki ułożone w różnej kolejności oznaczają różne rzeczy, a nawet ułożone w tej samej kolejności mogą mieć różne znaczenia w zależności od tego, co nastąpi przed lub po nich. Ponadto w pisanym języku chińskim nie występują spacje naturalnie dzielące słowa, jak w języku angielskim. Tak więc chińscy badacze zajmujący się przetwarzaniem języka naturalnego muszą nauczyć swoje algorytmy, gdzie wstawiać spacje, aby ustalić właściwe znaczenie określonej kombinacji znaków. Brak chińskich czasów czasownikowych – nie ma odrębnych form dla przeszłości, teraźniejszości lub przyszłości – również utrudnia maszynom rozszyfrowanie osi czasu sekwencji.

Chińscy badacze zajmujący się przetwarzaniem języka naturalnego mierzą się również z innymi wyzwaniami: istnieje wiele dialektów, z których niektóre są wzajemnie niezrozumiałe, a to samo wyrażenie może oznaczać różne rzeczy w różnych kontekstach.



Zhiyong Wu, profesor nadzwyczajny na Uniwersytecie Tsinghua, który bada rozumienie języka naturalnego, zauważa, że ​​aby komputery naprawdę zrozumiały intencje mówcy i odpowiednio się komunikowały, będą musiały wychwycić subtelne wskazówki, takie jak intonacja i stres. Będą musieli również zrozumieć emocje, ponieważ ludzkie decyzje nie opierają się wyłącznie na logice, zauważa Jia Jia, profesor nadzwyczajny na Uniwersytecie Tsinghua, która zajmuje się badaniem afektywnych obliczeń społecznych.

Aby uczynić swój system bardziej inteligentnym, Baidu wprowadził w tym roku na swojej platformie tryb trenera, aby umożliwić programistom dostarczanie danych językowych w czasie rzeczywistym za pomocą wbudowanego bota adnotatora. Bot otrzymuje informację zwrotną od dewelopera (np. wyjaśnienie zapytania, którego system nie zrozumiał za pierwszym razem), uczy się z tego, a następnie poprawia system.

Jedną z zalet chińskich badaczy, którzy próbują rozwiązać te problemy, jest duża ilość danych. Sieci neuronowe, które stanowią podstawę rozumienia języka przez dzisiejsze komputery, wymagają do trenowania dużych ilości danych. Im więcej danych posiada firma, tym inteligentniejsze staną się jej sieci neuronowe, a firmy takie jak Baidu i Alibaba będą korzystać z ogromnych baz użytkowników. Na koniec 2016 r. Baidu miał 665 milionów aktywnych użytkowników mobilnych miesięcznie, a od marca tego roku Alibaba miał 507 milionów aktywnych użytkowników mobilnych miesięcznie.



Ale Gang Wang, naukowiec z Alibaby AI. Lab mówi, że naukowcy będą musieli zaprojektować sieci neuronowe, które nie potrzebują dużej ilości danych, aby skuteczniej uczyć się języka. Zauważa, że ​​w prawdziwym świecie ludzie wyrażają to samo znaczenie na różne sposoby i niemożliwe jest nauczenie komputera każdego możliwego wyrażenia. Pełniąc swoją poprzednią rolę badacza akademickiego, on i jego koledzy opracowali metodę uczenia komputerów rozumienia tematu, gdy dostępnych jest bardzo mało danych: użyj danych z pokrewnych tematów. Na przykład, aby wytrenować sieć neuronową do rozumienia tekstów w medycynie sportowej, można wykorzystać dane ze sportu i dane z medycyny. Podejście to nie jest tak dobre, jak wykorzystanie danych organicznych, zauważa Wang, ale gdy ich brakuje, umożliwia trenowanie sieci neuronowych na dany temat.

Ostatecznie to, co sprawi, że asystent głosowy odniesie sukces w Chinach, to jego zawartość i usługi, mówi Chenfeng Song, założyciel Ainemo, startupu, który produkuje aktywowanego głosem robota asystenta domowego o nazwie Little Fish, który trafił do sprzedaży w czerwcu. Song planuje stopniowo wbudowywać programy edukacyjne i zdrowotne w asystenta domowego swojej firmy. Little Fish korzysta z platformy konwersacyjnej DueOS. Voice, Song notes, to sposób na dostarczanie treści osobom, które nie mają bardzo dobrego dostępu do Internetu za pośrednictwem komputerów stacjonarnych i smartfonów, zwłaszcza osobom starszym i małym dzieciom.

ukryć