211service.com
Trudniejszy test Turinga ujawnia głupotę chatbotów
Użytkownik: Siri, zadzwoń po karetkę.
Siri: Dobra, od teraz zadzwonię po karetkę.
Apple naprawił ten błąd wkrótce po tym, jak jego wirtualny asystent został po raz pierwszy wydany w 2011 roku. Jednak nowy konkurs pokazuje, że komputerom wciąż brakuje zdrowego rozsądku wymaganego do uniknięcia takich kłopotliwych pomyłek.
Wyniki konkursu zostały zaprezentowane na konferencji naukowej w Nowym Jorku w tym tygodniu i dają pewną miarę pracy, jaką trzeba wykonać, aby komputery były naprawdę inteligentne.

Ilustracja autorstwa Maxa Bode
ten Wyzwanie schematu Winograd prosi komputery o zrozumienie zdań, które są niejednoznaczne, ale zwykle proste do przeanalizowania przez ludzi. Ujednoznacznienie zdań schematu Winograd wymaga pewnego zdroworozsądkowego zrozumienia. W zdaniu Radni miejscy odmówili demonstrantom zezwolenia, ponieważ obawiali się przemocy, logicznie nie jest jasne, do kogo się odnoszą, choć ludzie rozumieją je z szerszego kontekstu.
Programy zgłoszone do wyzwania nieco lepiej niż losowo wybierały właściwe znaczenie zdań. Najlepsi dwaj uczestnicy mieli rację w 48 procentach przypadków, w porównaniu z 45 procentami, jeśli odpowiedzi zostały wybrane losowo. Aby móc ubiegać się o główną nagrodę w wysokości 25 000 $, uczestnicy musieliby osiągnąć co najmniej 90 procent dokładności. Wspólnie najlepsze zgłoszenia pochodziły od Quan Liu, badacza z Uniwersytetu Nauki i Technologii w Chinach oraz Nicosa Issaka, badacza z Open University of Cyprus.
Nic dziwnego, że maszyny były ledwie lepsze niż przypadek, mówi Gary Marcus , psycholog badawczy z New York University i doradca konkursu. Dzieje się tak, ponieważ przekazywanie komputerom zdroworozsądkowej wiedzy jest niezwykle trudne. Wiedza o ręcznym kodowaniu jest niemożliwie czasochłonna, a komputery nie są łatwe do poznania świata rzeczywistego poprzez statystyczną analizę tekstu. Większość uczestników Winograd Schema Challenge stara się wykorzystać kombinację ręcznie kodowanego rozumienia gramatyki i bazy wiedzy opartej na faktach.
Marcus, który jest również współzałożycielem nowego startupu AI, Geometric Intelligence, mówi, że warto zauważyć, że Google i Facebook nie brały udziału w wydarzeniu, mimo że badacze z tych firm sugerowali, że robią znaczne postępy w zrozumieniu języka naturalnego. Mogło być tak, że ci faceci weszli do tego pokoju i zdobyli sto procent i powiedzieli „hah!”, mówi. Ale to by mnie zdziwiło.
Konkurs służy nie tylko jako miara postępu w sztucznej inteligencji. Pokazuje również, jak trudno będzie zbudować bardziej intuicyjne i pełne gracji chatboty oraz nauczyć komputery wydobywania większej ilości informacji z tekstu pisanego.
Badacze z Google, Facebooka, Amazona i Microsoftu zwracają uwagę na język. Wykorzystują najnowsze techniki uczenia maszynowego, w szczególności sieci neuronowe głębokiego uczenia, aby opracowywać inteligentniejsze, bardziej intuicyjne chatboty i osobistych asystentów (patrz „Uczenie maszyn, aby nas zrozumieć”). W rzeczywistości, ponieważ chatboty i asystenci głosowi stają się coraz bardziej powszechni, a także dramatyczny postęp w obszarach takich jak rozpoznawanie obrazu i mowy, można by pomyśleć, że maszyny całkiem nieźle radzą sobie z rozumieniem języka.
Jeden z dwóch pierwszych wpisów faktycznie wykorzystywał nowatorskie podejście do uczenia maszynowego. Grupa Liu, w skład której weszli naukowcy z Uniwersytetu York w Toronto i National Research Council of Canada, wykorzystała głębokie uczenie, aby na podstawie tysięcy tekstów nauczyć komputer rozpoznawania relacji między różnymi wydarzeniami, takimi jak gra w koszykówkę, wygrana lub kontuzje.
Byłem zachwycony, widząc, jak zastosowano głębokie uczenie, mówi Leora Morgenstern , starszy naukowiec w firmie konsultingowej Leidos Corporation i jeden z organizatorów wyzwania.
Zespół Liu twierdzi, że po naprawieniu problemu ze sposobem, w jaki jego system analizował pytania konkursowe, jest on dokładny w prawie 60 procentach. Morgenstern ostrzega jednak, że nawet gdyby te twierdzenia zostały potwierdzone, dokładność byłaby znacznie gorsza niż u człowieka.
Zdania ze schematu Winograd zostały po raz pierwszy wyróżnione jako sposób oceny zrozumienia maszynowego przez Hectora Levesque, badacza sztucznej inteligencji z University of Toronto. Ich nazwa pochodzi od Terry'ego Winograda, pioniera w tej dziedzinie i profesora na Uniwersytecie Stanforda, który zbudował jeden z pierwszych konwersacyjnych programów komputerowych.
Wyzwanie zostało zaproponowane w 2014 roku jako ulepszenie testu Turinga. Alan Turing, przodek informatyki i sztucznej inteligencji, który w latach pięćdziesiątych zastanawiał się, czy maszyny mogą pewnego dnia myśleć tak, jak ludzie, zasugerował prosty sposób testowania inteligencji maszyny. Jego pomysł polegał na tym, aby maszyna próbowała oszukać osobę, która pomyślała, że rozmawia z prawdziwą osobą w rozmowie tekstowej.
Problem z testem Turinga polega na tym, że program często łatwo oszuka osobę za pomocą prostych sztuczek i uników. Ale program nie może analizować schematu Winograd ani innych niejednoznacznych zdań bez jakiejś formy wiedzy ogólnej.
Konkurs może mieć istotne implikacje praktyczne. Pojawi się, gdy zaczniesz wspierać dialogi, mówi Charliego Ortiza , starszy główny badacz w Nuance, firmie produkującej oprogramowanie do rozpoznawania głosu i interfejsu głosowego, która sponsorowała Winograd Schema Challenge. Ortiz mówi, że nawet proste rozmowy z komputerami będą wymagały zdrowego rozumowania. Na zakupach, jeśli powiem: „Chcę dostać etui na moją gitarę; powinno być mocne”. Czy zatem „to” odnosi się do futerału czy gitary?
Marcus dodaje, że zdroworozsądkowe rozumowanie stanie się ważniejsze, ponieważ urządzenia takie jak inteligentne urządzenia lub gadżety do noszenia staną się bardziej powszechne. Kiedy chcesz zadać pytanie o zegarek, nie możesz przewijać 50 opcji, mówi. Kiedy zaczynasz rozmawiać z samochodem lub zegarkiem i pozbywasz się modalności pisania na klawiaturze i chcesz mieć spójny zestaw zdań — ten dyskurs konwersacyjny — ludzie po prostu naturalnie odwołują się do rzeczy i musisz rozwiązać te problemy, aby działa.