211service.com
Wynik testu IQ: zaawansowana maszyna AI dopasowuje wynik czteroletniego dziecka
Gwałtowny postęp w technologii przetwarzania informacji w ostatnich latach stworzył urządzenia komputerowe o ogromnych mocach. Maszyny te od dawna są lepsze od ludzi w arytmetyce, niektórych grach, takich jak szachy, a ostatnio w zaawansowanych zadaniach rozpoznawania wzorców, takich jak rozpoznawanie twarzy.
Ale nierozstrzygniętym pytaniem jest: w jakim stopniu te zdolności składają się na ekwiwalent ludzkiej inteligencji? Dzisiaj otrzymujemy swego rodzaju odpowiedź dzięki pracy Stellana Ohlssona z University of Illinois i kilku kumpli, którzy przetestowali jedną z najpotężniejszych maszyn sztucznej inteligencji na świecie za pomocą standardowego testu IQ podawanego ludziom.
Wyniki pokazują, że chociaż komputery stały się znacznie potężniejsze w ostatnich latach, muszą nadrobić zaległości, aby dorównać ludzkim poziomom wydajności.
Najpierw trochę tła. Nauka pomiaru ludzkich umiejętności i wydajności jest znana jako psychometria. Jeśli chodzi o ludzką inteligencję, najszerzej akceptowanym testem psychometrycznym jest iloraz inteligencji, czyli test IQ.
Składa się z dwóch części. Pierwszy to zestaw pytań zaprojektowanych do testowania różnych aspektów ludzkiej wydajności. Druga to baza danych wyników testów, z którą można porównać przyszłe wyniki. Tak oceniani są ludzie; na przykład powyżej lub poniżej średniej w porównaniu z bazą danych.
Testy IQ są również przeznaczone do testowania ludzi na różnych etapach ich życia. Tak więc test przeznaczony dla dorosłych raczej nie zapewni dużego wglądu w wyniki 10-latków lub 4-latków. Tak więc proces projektowania testów i tworzenia bazy danych testów-wyników musi być wykonany dla każdej z tych grup.
Przez lata informatycy stworzyli szereg maszyn AI, które próbowały uzyskać racjonalne zrozumienie otaczającego ich świata. Jeden z najbardziej znanych, o nazwie ConceptNet, jest rozwijany w MIT od lat 90. XX wieku.
Aby ocenić jego inteligencję, Ohlsson i spółka wykorzystali werbalny test IQ przeznaczony dla dzieci, aby przetestować ConceptNet 4 (ConceptNet 5 został od tego czasu wydany).
Ten test, znany jako przedszkolna i podstawowa skala inteligencji Wechslera, mierzy wyniki dzieci w pięciu kategoriach: informacje, słownictwo, rozumienie słów, rozumienie i podobieństwa.
Kategoria informacji zawiera pytania typu: Gdzie można znaleźć pingwina?
Kategoria słownictwa zawiera pytania takie jak: Co to jest ___? jak w Czym jest dom?
W rozumowaniu słownym dziecko musi zidentyfikować coś na podstawie trzech wskazówek, takich jak: Możesz to przejrzeć, jest kwadratowe i możesz je otworzyć.
Pytania dotyczące podobieństw mają postać: Dokończ to, co powiem. X i Y są ___ tak jak w Zakończ to, co mówię. Pióro i ołówek to ___. Wymaga to od dziecka zrozumienia dwóch pojęć i znalezienia ich wzajemnego nakładania się.
I wreszcie, pytania dotyczące zrozumienia mają formę: Dlaczego ludzie podają sobie ręce? Wymaga to skonstruowania wyjaśnienia, a więc wykracza poza samo wyszukiwanie informacji.
Ohlsson i spółka przeprowadzili ten test, podając pytania do maszyny AI w zmodyfikowanej formie. Wymagało to pewnego programowania, aby pytania mogły łączyć się ze strukturą wiedzy komputera o świecie.
A wyniki stanowią ciekawą lekturę. ConceptNet radzi sobie dobrze ze słownictwem i podobieństwami, środkowym z informacją, a słabo z rozumowaniem i rozumieniem słów, mówią Ohlsson i spółka.
W szczególności udzielone odpowiedzi były niezwykle wrażliwe na sposób interpretacji pytania. Na przykład, w kategorii rozumienia, maszynie zadano pytanie Dlaczego podamy sobie ręce?
W przypadku ConceptNet 4 sprowadza się to do wyszukiwania związanego z trzema pojęciami, dwoma jednowyrazowymi pojęciami uścisk dłoni i jednym dwuwyrazowym pojęciem uścisk dłoni. Jeśli użyje wszystkich tych pojęć, aby znaleźć odpowiedź, powoduje dopasowanie epileptyczne.
Jednak zmuszenie maszyny do rozważenia tylko pojedynczych koncepcji daje znacznie bardziej satysfakcjonujące odpowiedzi, dzięki, flirtuj i spotykaj się z przyjacielem.
Ale to nie zawsze działa. Na przykład w kategorii informacyjnej zapytano maszynę, gdzie można znaleźć nauczyciela?
Maszyna dzieli to na żądanie trzech różnych pojęć: znajdowania i nauczyciela oraz dwuwyrazowego pojęcia znajdowania nauczyciela. Używając tych wszystkich, daje prawidłową odpowiedź, ale jeśli Ohlsson i jej współpracownicy zmuszają go do rozważenia tylko dwuwyrazowej koncepcji znajdź nauczyciela, daje zagadkowe odpowiedzi zespół lub fortepian.
Nie jest jasne, dlaczego w pewnych okolicznościach ma problemy z tego rodzaju rozumowaniem.
Co więcej, wiele błędnych odpowiedzi jest zupełnie niepodobnych do tych, które udzieliłyby dzieci. Na przykład w kategorii „rozumowanie” ConceptNet 4 otrzymał następujące wskazówki: To zwierzę ma grzywę, jeśli jest samcem, to jest zwierzę żyjące w Afryce, a to duży żółtawobrązowy kot.
Ale pięć najważniejszych odpowiedzi to: pies, farma, stworzenie, dom i kot.
To dziwne. Zdrowy rozsądek powinien przynajmniej ograniczyć odpowiedź do zwierząt, a także powinien wyciągnąć prosty wniosek, że jeśli wskazówki mówią, że jest to kot, to rodzaje kotów są jedynymi alternatywami do rozważenia, powiedzmy Ohlsson i spółka.
Wszystko to doprowadziło firmę Ohlsson i spółka do jasnego wniosku. System ConceptNet uzyskał ocenę VIQ WPPSI-III, która jest średnia dla czteroletniego dziecka, ale poniżej średniej dla dzieci w wieku od pięciu do siedmiu lat.
To ciekawy wynik. Oczywiście istnieje wiele sposobów na ulepszenie testu. Jednym z nich jest zapewnienie komputerowi możliwości przetwarzania języka naturalnego. Zmniejszyłoby to jego zależność od programowania niezbędnego do wprowadzania pytań i jest już możliwe dzięki asystentom online, takim jak Siri, Cortana i Google Now.
Być może najważniejszym punktem jest to, że prace te zostały wykonane na wersji ConceptNet 4, która pochodzi z 2012 roku. Od tego czasu sztuczna inteligencja szybko się zmieniła. Główna zmiana polegała na przejściu od gromadzenia wiedzy do bycia napędzanym uczeniem się. Systemy te przetwarzają teraz ogromne bazy danych informacji, aby uzyskać wgląd w język, obrazy i inne aspekty świata. Doprowadziło to do wykładniczej poprawy wydajności wielu zadań, takich jak rozpoznawanie twarzy.
Biorąc pod uwagę wyniki firmy Ohlsson i spółka, zajęło 60 lat badań nad sztuczną inteligencją, aby w 2012 roku zbudować maszynę, która może zbliżyć się do zdroworozsądkowego rozumowania czterolatka. Jednak natura wykładniczych ulepszeń rodzi perspektywę, że następne sześć lat może przynieść podobnie dramatyczną poprawę.
Tak więc pytanie, które powinniśmy pilnie rozważyć, brzmi: z jaką maszyną AI możemy się zmagać w 2018 roku?
Nr ref.: arxiv.org/abs/1509.03390 : Pomiar wydajności systemu sztucznej inteligencji na podstawie werbalnego testu IQ dla małych dzieci