211service.com
Alexa, zrozum mnie
rzymski muradow
31 sierpnia 2012 r. czterech inżynierów Amazona złożyło fundamentalny patent na to, co ostatecznie stało się Alexą, systemem sztucznej inteligencji zaprojektowanym do współpracy z jednym z największych i najbardziej skomplikowanych zbiorów danych na świecie: ludzką mową. Inżynierowie potrzebowali zaledwie 11 słów i prostego diagramu, aby opisać, jak to działa. Mężczyzna w cichym pokoju mówi: Zagraj w „Let It Be” Beatlesów. Mała maszyna stołowa odpowiada: Nie ma problemu, John, i zaczyna odtwarzać żądaną piosenkę.
Od tego skromnego początku oparta na głosie sztuczna inteligencja w domu stała się dla Amazona wielkim biznesem i, w coraz większym stopniu, strategicznym polem bitwy z rywalami technologicznymi. Google, Apple, Samsung i Microsoft angażują do pracy tysiące naukowców i specjalistów biznesowych, próbując stworzyć nieodparte wersje łatwych w użyciu urządzeń, z którymi będziemy mogli rozmawiać. Do tej pory wszyscy staraliśmy się dostosować do technologii, jeśli chodzi o pisanie, stukanie lub przesuwanie. Teraz nowe interfejsy użytkownika uginają się ku nam, zauważa Ahmed Bouzid, dyrektor generalny firmy Witlingo, która buduje wszelkiego rodzaju aplikacje sterowane głosem dla banków, uniwersytetów, kancelarii prawnych i innych.
Ta historia była częścią naszego wydania z września 2017 r.
- Zobacz resztę numeru
- Subskrybuj
Dla Amazona to, co zaczęło się jako platforma lepszej szafy grającej, stało się czymś większym: systemem sztucznej inteligencji zbudowanym na ludzkich danych i stale się na nich uczącym. Jego cylinder Echo z zasilaniem Alexa i mniejsza kropka to wszechobecni pomocnicy domowi, którzy mogą wyłączyć światło, opowiadać dowcipy lub czytać wiadomości bez użycia rąk. Zbierają również ryzy danych o swoich użytkownikach, które są wykorzystywane do ulepszania Alexy i zwiększania jej zastosowań.
Od czasu ich debiutu rynkowego w 2014 roku sprzedano dziesiątki milionów maszyn z technologią Alexa. Uważa się, że na amerykańskim rynku urządzeń wykorzystujących głosową sztuczną inteligencję Amazon generuje około 70 procent wszystkich sprzedaży jednostkowych, chociaż konkurencja się zaostrza. Google Home również sprzedał miliony jednostek, a Apple i Microsoft wkrótce wypuszczają własne wersje.
Ostateczną wypłatą jest możliwość kontrolowania – lub przynajmniej wpływania – na trzy ważne rynki: automatyki domowej, domowej rozrywki i zakupów. Trudno powiedzieć, ile osób chce rozmawiać ze swoimi lodówkami, ale schematy codziennego życia szybko się zmieniają. W ten sam sposób, w jaki smartfony zmieniły wszystko, od etykiety randkowej po prędkość chodzenia pieszych, sztuczna inteligencja oparta na głosie zaczyna wywracać wiele aspektów życia domowego. Po co wstawać, by zamknąć drzwi wejściowe lub włączyć ogrzewanie w samochodzie w przejmująco zimny dzień, kiedy Alexa lub jej krewni mogą natychmiast załatwić sprawę?
Na razie Amazon nie próbuje zbierać przychodów od firm produkujących inteligentne termostaty, żarówki i inne urządzenia połączone z Alexą. Jednak w dalszej części łatwo wyobrazić sobie sposoby, w jakie mogą się zastosować umowy o podziale dochodów lub inne płatności. Najmniejszy z tych trzech rynków, automatyka domowa, już teraz generuje ponad 5 miliardów dolarów wydatków rocznie, podczas gdy sprzedaż detaliczna w USA w zeszłym roku wyniosła 4,9 biliona dolarów. Dzisiaj Amazon zarabia na samych maszynach, w cenach od 50 USD za kropki do 230 USD za najwyższej klasy Echos z ekranami wideo, i zbiera drugą wypłatę, jeśli użytkownicy kończą intensywniejsze zakupy w ogromnym sklepie internetowym Amazon. (Amazon nie ujawni jednak tych numerów ruchu).
Aby Echos stało się tak wszechobecne jak smartfony, będą musieli zrobić o wiele więcej rzeczy. W tym celu Amazon zachęca niezależnych programistów do tworzenia nowych usług na platformie, tak jak Apple od dawna robił to z programistami aplikacji. Do tej pory zbudowano ponad 15 000 takich umiejętności lub aplikacji, a narzędzia do tworzenia aplikacji stały się tak łatwe do połączenia, że teraz można zbudować prostą umiejętność w około godzinę, bez dużej wiedzy programistycznej. Wśród najpopularniejszych aplikacji znajdują się opcje przejażdżek od Uber i Lyft. Niewypały obejmują 48 oddzielnych umiejętności, które bombardują słuchaczy obelgami.
Wśród najbardziej ambitnych programistów są firmy produkujące sprzęt lub sprzedające usługi współpracujące z Alexą. Na przykład Capital One oferuje swoim klientom bankowym opłacanie rachunków w oparciu o Alexę; Ecobee z siedzibą w Toronto jest jednym z wielu producentów inteligentnych termostatów, którzy tworzą wersje zasilane przez Alexę, które pozwalają ludziom podnieść lub obniżyć temperaturę w pomieszczeniu, wypowiadając tylko kilka słów. Nasi klienci mają intensywne życie, mówi Stuart Lombard, dyrektor generalny Ecobee, która obecnie uzyskuje około 40 procent ogólnej sprzedaży ze swoich urządzeń Alexa, najszybciej rozwijającej się linii produktów 10-letniej firmy. Aby wrócić do domu, muszą walczyć z korkami, a potem karmić dzieci, pieluchować dziecko i kto wie, co jeszcze. Dajemy im możliwość wykonywania zadań bez użycia rąk, gdy są w trakcie innych zadań.
Kiedy mowa spotyka AI
To, co sprawia, że sztuczna inteligencja oparta na głosie jest tak atrakcyjna dla konsumentów, to obietnica dostosowania się do nas, reagowania na sposób, w jaki mówimy – i myślimy – bez konieczności pisania na klawiaturze lub ekranie. To również sprawia, że jest tak trudny technicznie do zbudowania. W ogóle nie jesteśmy uporządkowani, kiedy rozmawiamy. Zamiast tego przerywamy sobie. Pozwalamy dyndać myślom. Używamy słów, kiwa się głową i pomrukuje w dziwny sposób i zakładamy, że mamy sens, nawet jeśli tak nie jest.
Niektórzy ludzie mówią nie, nie, nie; inni wolą to anulować, a trzecia grupa próbuje jakiegoś wariantu Wait, właściwie oto czego chcę zamiast tego. Alexa nie musi dekodować każdej wypowiedzi.
Tysiące pracowników Amazona pracuje nad tym wyzwaniem, w tym niektórzy w centrach badawczych w Seattle, Sunnyvale w Kalifornii i Cambridge w stanie Massachusetts. Mimo to strona kariery Amazona oferowała ostatnio 1100 dodatkowych miejsc pracy dla Alexy w kilkunastu działach, w tym 215 miejsc dla specjalistów od uczenia maszynowego. Podczas spotkania w biurach firmy w Cambridge zapytałem głównego naukowca Alexy, Rohita Prasada, dlaczego potrzebuje tak wielu ludzi – i kiedy jego zespół badawczy może być w pełni rozbudowany.
– Śmieję się z każdego aspektu twojego pytania – odpowiedział Prasad.
Po kilku sekundach odzyskania opanowania Prasad wyjaśnił, że pracuje nad technologią mowy od 20 lat, z frustrująco wolnymi wynikami przez większość tego okresu. Jednak w ciągu ostatnich pięciu lat otworzyły się ogromne możliwości. Stworzenie naprawdę skutecznej sztucznej inteligencji wyzwalanej głosem jest złożonym i wciąż niewykonalnym zadaniem (patrz Problem językowy AI). Ale podczas gdy w przeszłości naukowcy zajmujący się mową mieli trudności z określeniem dokładnego znaczenia czasami chaotycznych wypowiedzi przy pierwszej próbie, nowe podejścia do uczenia maszynowego robią postępy, przyjmując inną taktykę: działają na podstawie niedoskonałych dopasowań na początku, a następnie dostrajanie tymczasowych domysłów. Kluczem jest praca z dużymi obszarami danych użytkownika i uczenie się na wcześniejszych błędach. Im więcej czasu Alexa spędza ze swoimi użytkownikami, tym więcej zbiera danych, z których może się uczyć, i tym mądrzejsza się uzyskuje. Wraz z postępem pojawia się więcej możliwości i potrzeba więcej siły roboczej.
Podam przykład, powiedział Prasad. Jeśli zapytasz Alexę „Jaki był pierwszy album Adele?”, odpowiedź powinna brzmieć „ 19 .’ Jeśli następnie powiesz „Odtwórz”, Alexa będzie wiedziała wystarczająco dużo, aby zacząć odtwarzać ten album. Ale co, jeśli w środku jest jakiś konwersacyjny przekomarzanie się? Co jeśli najpierw zapytasz Alexę, w którym roku ukazał się album i ile egzemplarzy się sprzedał? Zakończ taką wymianę za pomocą tajemniczego Play it, a wcześniejsze wersje Alexy zostałyby zakłopotane. Teraz technologia może, przynajmniej czasami, podążać za tym tokiem myślenia i rozpoznać, że to nadal oznacza: 19 .
To ulepszenie pochodzi z technik uczenia maszynowego, które ponownie przeanalizowały tysiące poprzednich wymian, w których Alexa się potknęła. System dowiaduje się, jakie utwory użytkownicy rzeczywiście chcieli usłyszeć i gdzie we wcześniejszych częściach rozmowy po raz pierwszy zidentyfikowano ten utwór. Na początku musisz poczynić pewne założenia dotyczące tego, jak ludzie będą o coś pytać, mówi James Glass, szef grupy systemów mówionych w MIT. Następnie zbierasz dane i dostrajasz swoje modele.
Jak mówi Glass, argumenty za takim podejściem do uczenia maszynowego są powszechnie doceniane, ale aby to zadziałało, wymaga znacznie więcej danych, niż badacze uniwersyteccy mogą łatwo zebrać. Wraz ze wzrostem użycia Alexy, Amazon ma teraz dostęp do obszernego repozytorium interakcji między człowiekiem a komputerem, co daje mu przewagę w dostrajaniu technologii głosowej, którą Google od dawna cieszy się w zapytaniach tekstowych. Pomagają też dane zewnętrzne: ogromna baza danych tekstów piosenek załadowana na przykład do Alexy w 2016 roku pomogła zapewnić, że użytkownicy, którzy proszą o piosenkę, która zawiozła mojego Chevy do grobli, zostaną skierowani do American Pie Dona McLeana.
Jeden z najnowszych projektów grupy Prasad podkreśla elastyczność tego podejścia. Polega na rozszyfrowaniu momentów, w których użytkownicy wycofują się ze swoich początkowych żądań. Frazy sygnalizacyjne mogą się bardzo różnić. Niektórzy ludzie mówią nie, nie, nie; inni wolą to anulować, a trzecia grupa próbuje jakiegoś wariantu Wait, właściwie oto czego chcę zamiast tego. Alexa nie musi dekodować każdej wypowiedzi. Duże próbki i częściowo nadzorowane uczenie maszynowe umożliwiają nakreślenie zbioru prawdopodobnych markerów zanegowanej mowy, a następnie odebranie spójnego nowego żądania po zmianie kursu.
Oprócz tego, że Alexa jest lepszym słuchaczem, eksperci Amazon AI wykorzystują zasoby danych, aby uczynić ją lepszym głośnikiem, dostrajając kadencję syntetycznego kobiecego głosu maszyny, aby zwiększyć długotrwałe użytkowanie. Tradycyjne próby syntezy mowy polegają na łączeniu wielu fragmentów nagranej mowy ludzkiej. Chociaż ta technika może wytwarzać w miarę naturalny dźwięk, nie nadaje się do szeptów, ironii ani innych modulacji, których może użyć angażujący ludzki mówca. Aby wyostrzyć radzenie sobie Alexy ze wszystkim, od zadziornego dialogu po spokojny recital, algorytmy uczenia maszynowego Amazona mogą przyjąć inne podejście, szkoląc się na chętnych, niespokojnych – i mądrze brzmiących – głosach profesjonalnych narratorów. Pomaga to, że Amazon jest właścicielem wydawcy audiobooków Audible.
Tyle do omówienia
Wśród najbardziej zagorzałych zwolenników sztucznej inteligencji opartej na głosie są osoby, które nie potrafią łatwo pisać na telefonach lub tabletach. Gavin Kerr, dyrektor naczelny firmy Inglis w Filadelfii, która zapewnia mieszkania i usługi dla osób niepełnosprawnych, zainstalował urządzenia Amazon Echo i Dot w ośmiu domach mieszkańców. Ma nadzieję, że w końcu doda je do wszystkich 300 domów po zakończeniu testów pilotażowych. To niesamowite dobrodziejstwo dla mieszkańców, mówi Kerr. Mogą być wygodniejsze. Daje im niezależność.
Kerr współpracuje z setkami osób cierpiących na stwardnienie rozsiane lub inne wyniszczające schorzenia. Dla osób przykutych do łóżka lub poruszających się na wózkach inwalidzkich trudno dostępny termostat ścienny może być stałym źródłem udręki. Ich ciała mają trudności z regulowaniem temperatury, wyjaśnia Kerr. W pokoju o temperaturze 72°C przez godzinę może być gorąco, a następnej zimno. Przy ograniczonej mobilności nie ma łatwego sposobu, aby poczuć się komfortowo, zwłaszcza jeśli nie jest dostępna całodobowa pomoc.
Przy odrobinie majsterkowania oprogramowanie Alexy może służyć nawet osobom z bardzo ograniczoną mową. Kerr opowiada o pewnym mężczyźnie po trzydziestce, który chciał opuścić zakład opieki długoterminowej i wrócić do codziennej społeczności. Powiedział nam: „Nigdy nie będę mógł używać poleceń Alexy” — wspomina Kerr. Zapytaliśmy go więc: „Co możesz powiedzieć?”. Następnie przerobiliśmy oprogramowanie, aby mógł zmusić Alexę do pracy na jego warunkach. Teraz mówi „mama”, gdy chce włączyć światło w kuchni, i „Jan”, gdy chce zapalić światło w łazience.
Chociaż Inglis zapewnia użytkownikom Echo cztery godziny szkolenia, nowi użytkownicy znacznie częściej szukają drogi po omacku. Wyciągnij Echo z pudełka, a trochę opakowania podkreśli szczególnie popularne aplikacje, takie jak odtwarzanie muzyki, ustawianie alarmów lub aktualizowanie list zakupów. Zorganizowani użytkownicy mogą wywoływać panele sterowania Alexa na swoich smartfonach lub laptopach, aby dostosować ustawienia, wyszukać nowe aplikacje lub uzyskać wskazówki, które podpowiedzi sprawią, że aplikacja będzie działać najlepiej.
Szerszy sukces Alexy polega na jej zdolności do łagodzenia stresu związanego z przepełnionym życiem. To towarzysz, który jest zawsze gotowy do zaangażowania.
W powszechnie czytany post na blogu w czerwcu menedżer produktu Microsoft, Darren Austin, napisał, że szerszy sukces Alexy polega na jej zdolności do łagodzenia stresu związanego z przepełnionym życiem. Austin napisał, że prostym działaniem pytania Alexa łagodzi negatywne emocje związane z niepewnością i strachem przed zapomnieniem. Użytkownicy uzależniają się od przynoszenia Alexie wszelkiego rodzaju chwilowych zagadek lub pragnień, twierdził; to towarzysz, który jest zawsze gotowy do zaangażowania.
Co tydzień — czasami częściej — dyrektor generalny Alexy, Rob Pulciani, skanuje zbiorcze dane dotyczące najczęstszych wypowiedzi użytkowników Alexy i Dot. Zazwyczaj na szczycie listy dominują prośby o muzykę, wiadomości, pogodę, natężenie ruchu i gry. Jednak minionej wiosny szybko pojawił się nowicjusz. Popularne zdanie: Alexa, pomóż mi się zrelaksować.
Gdy użytkownicy zgłaszają tę prośbę, są kierowani do kolekcji kojących dźwięków. ćwierkają ptaki; dalekie fale uderzają o brzeg; pociągi towarowe przetaczają się przez noc. Takie pętle dźwięków otoczenia mogą grać przez wiele godzin, jeśli użytkownicy wybiorą. Pulciani uważał te aplikacje za drobne dziwactwa, kiedy po raz pierwszy pojawiły się na platformie Alexa w 2015 roku. Ale szybko zyskały sporą rzeszę fanów. Zestresowani dorośli używają dźwięków do zasypiania. Rodzice zamieniają je w substytuty kołysanek dla zepsutych niemowląt. W ciągu następnych kilku tygodni po swoim odkryciu Pulciani i współpracownicy dopracowali wewnętrzną architekturę Alexy, aby nowi nabywcy Echo mogli szybko odkryć kojące dźwięki, jeśli poprosiliby o wskazówki dotyczące nowych umiejętności do wypróbowania.
Długotrwała rozmowa
W badaniach platformy AI Google, Apple, Microsoft i Amazon wykazują różne mocne strony. Asystent Google jest najlepszy w szerokim zakresie poleceń wyszukiwania. Siri firmy Apple i Cortana firmy Microsoft mają inne talenty. Alexa szczególnie dobrze radzi sobie z poleceniami zakupów.
Ostatecznym triumfem sztucznej inteligencji opartej na głosie byłoby prowadzenie realistycznej, wielominutowej rozmowy z użytkownikami. Taki wyczyn będzie wymagał ogromnych skoków w zdolności maszyn do rozpoznawania intencji ludzkich mówców, nawet jeśli nie ma oczywistej prośby. Ludzie mogą zorientować się, że przyjaciel, który mówi, że nie byłem na siłowni od tygodni, prawdopodobnie chce porozmawiać o stresie lub poczuciu własnej wartości. W przypadku oprogramowania AI to trudny krok. Nagłe zmiany tematu – lub niejasne aluzje – też są trudne.
Chcąc wzmocnić więzi z następną generacją badaczy sztucznej inteligencji i mowy, rok temu Amazon zaprosił studentów inżynierii z kilkunastu uniwersytetów na całym świecie do zbudowania botów głosowych, które mogą wytrzymać 20-minutową rozmowę. Kampus, który zrobi największe postępy w listopadowym terminie, wygra nagrodę w wysokości 500 000 USD. W jeden weekend przesłuchałem pół tuzina tych botów, za każdym razem przechodząc od prostych zapytań do bardziej skomplikowanych, otwartych opinii, które zachęcały do wszelkiego rodzaju możliwych odpowiedzi. Dobrze rozpoczęliśmy, gdy jeden bot zapytał mnie: Czy widziałeś jakieś ostatnie filmy? Tak, odpowiedziałem, widzieliśmy Ukryte postacie . Zamiast naśladować recenzje w gazecie dotyczące tego przejmującego filmu o wczesnych latach NASA, bot społecznościowy odpowiedział: pomyślałem Ukryte postacie bardzo wątła w rzeczywistą matematykę tego wszystkiego. Nie moje podejście do filmu, ale wydawało się, że program AI wydaje się czarująco odpowiedni. Nasza rozmowa ucichła wkrótce potem, ale przynajmniej mieliśmy ten krótki, piękny moment.
Powiązana historia
Powiązana historia Maszyny, które naprawdę rozumieją język, byłyby niezwykle przydatne. Ale nie wiemy, jak je zbudować.Niestety, żaden z pozostałych robotów nie mógł się zbliżyć. Najbardziej zdezorientowany wypalił zdania takie jak Czy lubisz usługi przy krawężnikach? kiedy myślałem, że próbujemy porozmawiać o stronach internetowych. Powiedziałem coś, być może trochę ostro o ograniczeniach bota, tylko po to, by zapytać: Czy można negocjować zbiorowe?
Kilka dni później, kiedy zapytałem Prasada Amazona o jego podejście do botów społecznościowych, żadne z ich wczesnych błędów nie przeszkadzało mu. Powiedział mi, że to bardzo ważny obszar. To miejsce, w którym Alexa może się udać, jeśli chodzi o bycie bardzo inteligentną. Ale to jest o wiele trudniejsze niż granie w gry takie jak Go czy szachy. W tych grach, mimo że mają wiele możliwych ruchów, wiesz, jaki jest ostateczny cel. Podczas rozmowy nie wiesz nawet, co druga osoba próbuje osiągnąć. Kiedy Alexa będzie w stanie to rozgryźć, naprawdę będziemy rozmawiać.
George Anders relacjonował Amazon w krajowych publikacjach od późnych lat 90-tych. Jego najnowsza książka to Możesz wszystko.
