Przepisywanie głosu w twojej głowie

Lorrie Lejeune / MIT





Naukowcy z MIT opracowali interfejs komputerowy, który może transkrybować słowa, które użytkownik werbalizuje wewnętrznie, ale w rzeczywistości nie mówi na głos.

Elektrody w urządzeniu do noszenia odbierają sygnały nerwowo-mięśniowe w szczęce i twarzy, które są wyzwalane przez wypowiadanie słów w głowie, ale są niewykrywalne dla ludzkiego oka. Sygnały są podawane do systemu uczenia maszynowego, który został wyszkolony w celu skorelowania poszczególnych sygnałów z określonymi słowami.

Urządzenie o nazwie AlterEgo zawiera również słuchawki na przewodnictwo kostne, które przenoszą wibracje przez kości twarzy do ucha wewnętrznego. Ponieważ słuchawki nie zasłaniają przewodu słuchowego, system może przekazywać informacje bez przerywania rozmowy lub zakłócania wrażeń słuchowych.



AlterEgo zapewnia prywatny i dyskretny kanał do przesyłania i odbierania informacji, pozwalając użytkownikom robić takie rzeczy, jak niewykrywalne pozowanie i otrzymywanie odpowiedzi na trudne problemy obliczeniowe lub ciche zgłaszanie ruchów przeciwników w grze w szachy i równie ciche otrzymywanie rekomendowanych przez komputer odpowiedzi.

Zasadniczo nie możemy żyć bez naszych telefonów komórkowych, mówi Pattie Maes, profesor sztuk i nauk o mediach oraz doradca magisterski Arnava Kapura, absolwenta Media Lab, który kierował rozwojem systemu. Ale w tej chwili korzystanie z tych urządzeń jest bardzo uciążliwe. Jeśli chcę znaleźć coś, co jest istotne dla prowadzonej przeze mnie rozmowy, muszę znaleźć telefon, wpisać hasło, otworzyć aplikację i wpisać słowo kluczowe wyszukiwania. Celem AlterEgo było zbudowanie nieinwazyjnego systemu zwiększania inteligencji, który byłby całkowicie kontrolowany przez użytkownika.

Pomysł, że wewnętrzne werbalizacje mają fizyczne korelacje, istnieje od XIX wieku i był poważnie badany w latach pięćdziesiątych. Jednym z celów ruchu szybkiego czytania z lat 60. było wyeliminowanie tej subwokalizacji, jak wiadomo.



Ale subwokalizacja jako interfejs komputerowy jest w dużej mierze niezbadana. Aby określić, które miejsca na twarzy dostarczają najbardziej wiarygodnych sygnałów nerwowo-mięśniowych, naukowcy przymocowali 16 elektrod do twarzy badanych i czterokrotnie kazali im subwokalizować tę samą serię słów.

Naukowcy napisali kod do analizy uzyskanych danych i odkryli, że sygnały z siedmiu lokalizacji elektrod były w stanie konsekwentnie odróżnić subwokalizowane słowa. W artykule, który zaprezentowali na konferencji Association for Computing Machinery's ACM Intelligent User Interface, opisali prototyp nadającego się do noszenia interfejsu cichej mowy, który owija się wokół szyi jak zestaw słuchawkowy i ma zakrzywione wypustki, które dotykają twarz w siedmiu miejscach po obu stronach ust i wzdłuż szczęk.

Ale w kolejnych eksperymentach naukowcy osiągnęli porównywalne wyniki, używając tylko czterech elektrod wzdłuż jednej szczęki, co może sprawić, że urządzenie będzie mniej rzucające się w oczy.



Po wybraniu lokalizacji elektrod badacze zebrali dane dotyczące kilku zadań obliczeniowych ze słownictwem liczącym około 20 słów. Jedną z nich była arytmetyka, w której użytkownik subwokalizował duże problemy z dodawaniem lub mnożeniem; kolejną była aplikacja szachowa, w której użytkownik zgłaszał ruchy przy użyciu standardowego szachowego systemu numeracji.

Następnie dla każdej aplikacji użyto a sieć neuronowa znaleźć korelacje między poszczególnymi sygnałami nerwowo-mięśniowymi a określonymi słowami.

Korzystając z prototypowego interfejsu, naukowcy przeprowadzili badanie użyteczności, w którym 10 osób spędziło około 15 minut, dostosowując aplikację arytmetyczną do własnej neurofizjologii, a kolejne 90 minut używało jej do wykonywania obliczeń. W tym badaniu dokładność transkrypcji wynosiła średnio około 92 procent. Kapur mówi jednak, że wydajność powinna się poprawić dzięki większej liczbie danych treningowych, które można zebrać podczas zwykłego użytkowania.



W ramach trwających prac naukowcy zbierają dane dotyczące bardziej rozbudowanych rozmów, w nadziei na zbudowanie aplikacji o znacznie bardziej rozbudowanych słownikach. Mówi Kapur, myślę, że pewnego dnia dojdziemy do pełnej rozmowy.

ukryć