211service.com
Może to doprowadzić do kolejnego wielkiego przełomu w zdrowym rozsądku AI
Pani Tech | Pexels
Prawdopodobnie słyszałeś, jak mówiliśmy to niezliczoną ilość razy: GPT-3, gigantyczna sztuczna inteligencja, która wyrzuca niesamowicie ludzki język, jest cudem. To także w dużej mierze patrzeć . Możesz to stwierdzić za pomocą prostej sztuczki: Zapytaj kolor owiec i to będzie sugerować czarne tak samo często jak białe — odzwierciedlające wyrażenie „czarna owca” w naszym języku ojczystym.
Na tym polega problem z modelami językowymi: ponieważ są one szkolone tylko na tekście, brakuje im zdrowego rozsądku. Teraz naukowcy z Uniwersytetu Karoliny Północnej w Chapel Hill opracowali nową technikę, aby to zmienić. Nazywają to vokenizacją i daje modelom językowym, takim jak GPT-3, zdolność widzenia.
To nie pierwszy raz, kiedy ludzie próbują połączyć modele językowe z wizją komputerową. W rzeczywistości jest to szybko rozwijający się obszar badań nad sztuczną inteligencją. Chodzi o to, że oba typy sztucznej inteligencji mają różne mocne strony. Modele językowe, takie jak GPT-3, są trenowane poprzez uczenie się bez nadzoru, które nie wymaga ręcznego oznaczania danych, dzięki czemu można je łatwo skalować. Z kolei modele obrazu, takie jak systemy rozpoznawania obiektów, uczą się więcej bezpośrednio z rzeczywistości. Innymi słowy, ich rozumienie nie opiera się na abstrakcji świata, jaką zapewnia tekst. Na zdjęciach owiec widzą, że w rzeczywistości są one białe.
Powiązana historia
Te dziwne, niepokojące zdjęcia pokazują, że sztuczna inteligencja staje się coraz mądrzejsza Modele uczą się, jak generować obrazy z podpisów, co jest znakiem, że coraz lepiej rozumieją nasz świat.Modele AI, które mogą analizować zarówno język, jak i dane wejściowe, mają również bardzo praktyczne zastosowania. Jeśli na przykład chcemy budować robotów-asystentów, potrzebują oni wizji komputerowej do poruszania się po świecie i języka do komunikowania się o nim z ludźmi.
Jednak połączenie obu typów sztucznej inteligencji jest łatwiejsze do powiedzenia niż do zrobienia. Nie jest to tak proste, jak zszycie istniejącego modelu języka z istniejącym systemem rozpoznawania obiektów. Wymaga szkolenia nowego modelu od podstaw z zestawem danych zawierającym tekst i obrazy, inaczej zwanym zestawem danych języka wizualnego.
Najpopularniejszym podejściem do nadzorowania takiego zestawu danych jest kompilacja kolekcji obrazów z opisowymi podpisami. Na przykład zdjęcie takie jak poniżej miałoby podpis. Pomarańczowy kot siedzi w walizce gotowy do spakowania. Różni się to od typowych zestawów danych obrazu, które oznaczałyby to samo zdjęcie tylko jednym rzeczownikiem, na przykład cat. Zbiór danych w języku wizualnym może zatem nauczyć model AI nie tylko rozpoznawania obiektów, ale także ich wzajemnego związku i działania na siebie za pomocą czasowników i przyimków.
Ale możesz zobaczyć, dlaczego ten proces przechowywania danych trwałby wiecznie. To dlatego zestawy danych w języku wizualnym, które istnieją, są tak skąpe. Popularny zestaw danych tekstowych, taki jak angielska Wikipedia (która rzeczywiście zawiera prawie wszystkie anglojęzyczne wpisy Wikipedii) może zawierać prawie 3 miliardy słów. Zbiór danych w języku wizualnym, taki jak Microsoft Common Objects in Context lub MS COCO, zawiera tylko 7 milionów. To po prostu za mało danych, aby wytrenować model AI pod kątem czegokolwiek użytecznego.
Vokenization rozwiązuje ten problem, używając nienadzorowanych metod uczenia się, aby skalować niewielką ilość danych w MS COCO do rozmiaru angielskiej Wikipedii. Powstały model języka wizualnego przewyższa najnowocześniejsze modele w niektórych najtrudniejszych testach używanych obecnie do oceny rozumienia języka AI.
W tych testach nie można pokonać stanu wiedzy, próbując tylko trochę, mówi Thomas Wolf, współzałożyciel i dyrektor ds. Nauki w startupie zajmującym się przetwarzaniem języka naturalnego Hugging Face, który nie brał udziału w badaniach. To nie jest test zabawki. Dlatego jest to bardzo ekscytujące.
Od tokenów do vokenów
Najpierw uporządkujmy trochę terminologii. Czym u licha jest voken?
W mowie AI słowa używane do trenowania modeli językowych są znane jako tokeny. Dlatego badacze UNC postanowili nazwać obraz powiązany z każdym tokenem w ich modelu języka wizualno-językowego vokenem. Vokenizer jest tym, co nazywają algorytmem, który znajduje wokeny dla każdego tokena, i wokenizacja tak nazywają cały proces.
Nie chodzi tu tylko o pokazanie, jak bardzo badacze sztucznej inteligencji uwielbiają wymyślać słowa. (Naprawdę.) Pomaga to również przełamać podstawową ideę stojącą za wokenizacją. Zamiast zaczynać od zestawu danych obrazu i ręcznie pisać zdania, które mają służyć jako podpisy – co jest bardzo powolnym procesem – badacze UNC zaczęli od zestawu danych językowych i wykorzystali nienadzorowaną naukę, aby dopasować każde słowo do odpowiedniego obrazu (więcej na ten temat później). Jest to wysoce skalowalny proces.
Ostatecznym wkładem artykułu jest tutaj technika uczenia się bez nadzoru. Jak właściwie znaleźć odpowiedni obraz dla każdego słowa?
Vokenizacja
Wróćmy na chwilę do GPT-3. GPT-3 jest częścią rodziny modeli językowych znanych jako transformatory, które po wprowadzeniu w 2017 r. stanowiły ważny przełom w stosowaniu nienadzorowanej nauki do przetwarzania języka naturalnego. Transformatory uczą się wzorców ludzkiego języka, obserwując, jak są słowa używane w kontekście, a następnie tworząc matematyczną reprezentację każdego słowa, znaną jako osadzanie słowa, na podstawie tego kontekstu. Umieszczanie słowa kot może na przykład wskazywać, że jest ono często używane wokół słów meow i orange, ale rzadziej wokół słów bark lub blue.
W ten sposób transformatory przybliżają znaczenia słów i jak GPT-3 może pisać takie ludzkie zdania. Opiera się częściowo na tych osadzeniach, aby powiedzieć mu, jak składać słowa w zdania, a zdania w akapity.
Istnieje równoległa technika, której można również użyć do obrazów. Zamiast skanować tekst w poszukiwaniu wzorców użycia słów, skanuje obrazy w poszukiwaniu wzorców wizualnych. Pokazuje, jak często kot, powiedzmy, pojawia się na łóżku, a jak na drzewie, i tworzy kota osadzonego w tych informacjach kontekstowych.
Naukowcy z UNC doszli do wniosku, że powinni stosować obie techniki osadzania na MS COCO. Przekształcili obrazy w osadzenia wizualne, a podpisy w osadzenia słów. To, co jest naprawdę fajne w tych osadzaniach, to to, że można je następnie narysować w trójwymiarowej przestrzeni i dosłownie zobaczyć, jak są ze sobą powiązane. Osadzania wizualne, które są blisko związane z osadzaniami słów, będą pojawiać się bliżej na wykresie. Innymi słowy, wizualne osadzanie kota powinno (teoretycznie) pokrywać się z osadzonym tekstem kota. Całkiem fajne.
Możesz zobaczyć, dokąd to zmierza. Gdy wszystkie osadzania zostaną narysowane, porównane i powiązane ze sobą, łatwo jest rozpocząć dopasowywanie obrazów (vokenów) do słów (tokenów). I pamiętaj, ponieważ obrazy i słowa są dopasowywane na podstawie ich osadzeń, są również dopasowywane na podstawie kontekstu. Jest to przydatne, gdy jedno słowo może mieć zupełnie inne znaczenie. Technika z powodzeniem radzi sobie z tym, znajdując różne wywołania dla każdego wystąpienia słowa.
Na przykład:

Oto ona kontakt.

Niektóre koty kochają człowieka kontakt .
W obu przykładach tokenem jest słowo kontakt. Ale w pierwszym zdaniu kontekst sugeruje, że słowo odnosi się do informacji kontaktowych, więc wywołany jest ikoną kontaktu. W drugim zdaniu kontekst sugeruje, że słowo odnosi się do dotyku, więc voken przedstawia głaskanego kota.
Badacze wykorzystali osadzania wizualne i słowne, które stworzyli za pomocą MS COCO, aby wytrenować algorytm wokenizera. Po przeszkoleniu vokenizer był w stanie znaleźć wokeny dla tokenów w angielskiej Wikipedii. To nie jest idealne. Algorytm znalazł tylko okony dla około 40% tokenów. Ale to wciąż 40% zbioru danych zawierającego prawie 3 miliardy słów.
Dzięki temu nowemu zestawowi danych naukowcy przeszkolili model językowy znany jako BERT, transformator typu open source opracowany przez Google, który jest starszy od GPT-3. Następnie przetestowali nowy i ulepszony BERT na sześciu różnych testach rozumienia języka, w tym SQuAD, zestawie danych dotyczących odpowiedzi na pytania ze Stanford, który prosi modele o udzielenie odpowiedzi na pytania dotyczące czytania ze zrozumieniem dotyczące serii artykułów, oraz SWAG, który próbuje potykać się o modele z subtelnościami język angielski, aby sprawdzić, czy to tylko naśladowanie i zapamiętywanie. Ulepszony BERT działał lepiej na wszystkich z nich, co Wolf mówi, że nie ma na co kichać.
Naukowcy, doktorant Hao Tan i jego doradca Mohit Bansal, za dwa tygodnie zaprezentują swoją nową technikę wokenizacji na konferencji na temat metod empirycznych w przetwarzaniu języka naturalnego. Chociaż prace są wciąż wczesne, Wolf postrzega swoją pracę jako ważny przełom koncepcyjny w uzyskaniu nienadzorowanej nauki pracy dla modeli języka wizualnego. Była to podobna iskra, która pomogła radykalnie przyspieszyć przetwarzanie języka naturalnego w tamtych czasach.
W NLP mieliśmy ten ogromny przełom ponad dwa lata temu, a potem nagle NLP stało się dziedziną, w której działo się wiele rzeczy i która w pewnym sensie wyprzedziła wszystkie inne dziedziny sztucznej inteligencji, mówi. Ale mamy problem z łączeniem tekstu z innymi rzeczami. To jest jak ten robot, który może tylko mówić, ale nie widzi, nie słyszy.
Ten artykuł jest jednym z przykładów, w którym udało im się połączyć go z inną modalnością i to działa lepszy , on mówi. Możesz sobie wyobrazić, że być może niektóre z tych technik mogłyby zostać ponownie użyte, gdy chcesz wykorzystać ten naprawdę potężny model języka w robocie. Może używasz tego samego, aby połączyć zmysły robota z tekstem.