211service.com
Wyzwania i zagrożenia związane z automatycznym czytaniem z ust
W XVI wieku hiszpański mnich benedyktyński Pietro Ponce był pionierem pozornie magicznej sztuki czytania z ruchu warg. Chociaż technika prawdopodobnie wyprzedziła go, Ponce był pierwszym skutecznym nauczycielem czytania z ruchu warg.
Wtedy, tak jak teraz, technika ta była przede wszystkim wykorzystywana do pomocy osobom mającym problemy ze słuchem w interpretacji mowy. Ale jest również używany przez innych do podsłuchiwania rozmów. Rzeczywiście, różne eksperymenty pokazują, że nasza zdolność interpretacji mowy poprawia się, gdy widzimy poruszające się usta mówiącego. Innymi słowy, prawie każdy używa do pewnego stopnia czytania z ruchu warg.
To rodzi interesujące pytanie. Czy proces czytania z ruchu warg może być zautomatyzowany i wykonywany przez komputer? A jeśli tak, to jak skuteczne może być to podejście i jakie zagrożenie stanowi dla prywatności?
Dziś kilka odpowiedzi otrzymujemy dzięki pracy Ahmada Hassanata z Uniwersytetu Mu’tah w Jordanii. Przedstawia wyzwania, przed którymi stoją badacze w dziedzinie automatycznego czytania z ruchu warg, znanego również jako wizualne rozpoznawanie mowy. Z jego analizy jasno wynika, że jeśli czytanie z ruchu warg ma zostać pomyślnie zautomatyzowane, nadal trzeba będzie przezwyciężyć istotne wyzwania.
Podstawowym procesem czytania z ruchu warg jest rozpoznanie sekwencji kształtów tworzonych przez usta, a następnie dopasowanie jej do konkretnego słowa lub sekwencji słów.
Tu jest spore wyzwanie. Podczas mowy usta przybiera od 10 do 14 różnych kształtów, zwanych visemami. Natomiast mowa zawiera około 50 pojedynczych dźwięków zwanych fonemami. Tak więc pojedynczy visem może reprezentować kilka różnych fonemów.
I na tym polega problem. Sekwencja visemów zwykle nie może być powiązana z unikalnym słowem lub sekwencją słów. Zamiast tego sekwencja visemów może mieć kilka różnych rozwiązań. Wyzwaniem dla czytelnika ust jest wybór tego, którego użył mówca.
Problem potęguje fakt, że usta mówiącego są często zasłonięte, tak że przeciętnie czytelnik warg widzi tylko około 50 procent wypowiadanych słów. W rezultacie czytanie z ruchu warg wcale nie jest idealne nawet dla najbardziej doświadczonych praktyków.
Eksperymenty pokazują, jakie to trudne, nawet gdy słownictwo jest bardzo ograniczone. kiedy ludzie są proszeni o podjęcie decyzji, które cyfry od 1 do 9 zostały wypowiedziane, wyłącznie poprzez czytanie z ruchu warg, ich wskaźnik sukcesu wynosi średnio nieco ponad 50 procent. Wcale nie dobrze.
Łatwo więc sobie wyobrazić, że perspektywy automatyzacji tej techniki są nikłe. Ale Hassanat wskazuje na rosnącą liczbę badań, które zajmują się tym problemem, wspomagane szybką poprawą widzenia maszynowego w ostatnich latach.
Pierwszym problemem związanym z automatycznym czytaniem z ruchu warg jest rozpoznawanie twarzy i ust. W ostatnich latach poprawiło się to skokowo. Trudniejszym wyzwaniem jest rozpoznawanie, wydobywanie i kategoryzowanie cech geometrycznych ust podczas mowy.
Odbywa się to poprzez pomiar wysokości i szerokości warg oraz innych cech, takich jak kształt elipsy otaczającej wargi, ilość widocznych zębów oraz zaczerwienienie obrazu, które określa ilość widocznego języka .
Określenie dokładnego konturu ust jest trudne ze względu na stosunkowo niewielką różnicę między pikselami przedstawiającymi twarz i usta. Rzeczywiście, Hassanat mówi, że nie jest to konieczne, ponieważ otaczająca elipsa oraz wysokość i kształt ust zapewniają przyzwoite przybliżenie rzeczywistych konturów. Twierdzimy, że nie jest konieczne wykorzystanie wszystkich lub niektórych punktów konturu ust do zdefiniowania zewnętrznego kształtu ust, mówi.
Eksperymenty, które on i inni przeprowadzili, przyniosły jednak inne problemy. Jednym z nich jest to, że brody i wąsy mogą znacząco dezorientować systemy wizualnego rozpoznawania mowy. W związku z tym odnoszą większe sukcesy z kobietami niż mężczyznami.
Innym problemem jest to, że niektórzy ludzie wyrażają się bardziej ustami niż inni, więc łatwiej jest zinterpretować to, co mówią, na podstawie samych ruchów ust. Rzeczywiście, niektórzy ludzie prawie w ogóle nie poruszają ustami, a te tak zwane wizualnie niemowe osoby są prawie niemożliwe do zinterpretowania.
Niemniej jednak własny system wizualnego rozpoznawania mowy Hassanata jest wyjątkowo dobry. Jego eksperymenty osiągają średni wskaźnik sukcesu 76 procent, aczkolwiek w starannie kontrolowanych warunkach. Wskaźnik sukcesu jest jeszcze wyższy dla kobiet z powodu braku brody i wąsów.
Wszystko to sugeruje, że istnieje znaczny potencjał dla systemów wizualnego rozpoznawania mowy w przyszłości, zwłaszcza jako pomocy w innych formach rozpoznawania mowy.
Pozostają jednak ważne wyzwania. W szczególności Hassanat zwraca uwagę, że najlepsi czytelnicy ludzkich ust polegają na znacznych ilościach dodatkowych informacji do interpretacji mowy, takich jak kontekst rozmowy, ruchy ciała mówiącego oraz dobra znajomość gramatyki, idiomów i mowy potocznej.
Są to czynniki, z którymi komputery jeszcze się nie zorientowały. Zautomatyzowane czytanie z ruchu warg może nadal być nieco odległe, ale pierwsze oznaki wskazują, że w żadnym wypadku nie jest to niemożliwe.
A to rodzi cały szereg innych problemów związanych z prywatnością. Na przykład może się zdarzyć, że filmy z rozmowami bez dźwięku są obecnie niemożliwe do zinterpretowania, ale mogą być łatwe do zinterpretowania w przyszłości. W jaki sposób politycy, liderzy biznesu i popularne osobistości mogą stawić czoła takim analizom przyszłości?
Coś, o czym warto pomyśleć następnym razem, gdy zobaczysz kamerę CCTV.
Nr ref.: arxiv.org/abs/1409.1411 : Wizualne rozpoznawanie mowy