211service.com
Wyjaśniono technologię stojącą za sztuczną inteligencją OpenAI piszącą fikcje i rozsiewającą fałszywe wiadomości
Dymki słowne pokazujące początek opowieści science fiction i komputer kontynuujący narrację Pani Tech
W ubiegły czwartek (14 lutego) organizacja badawcza OpenAI opublikowała: nowy model języka zdolne do generowania przekonujących fragmentów prozy. Więc przekonujący w rzeczywistości naukowcy powstrzymali się od udostępniania kodu w nadziei, że powstrzymają jego potencjalną broń jako środek masowej produkcji fałszywych wiadomości .
Pracownik OpenAI wydrukował tę napisaną przez sztuczną inteligencję próbkę i wysłał ją do kosza: https://t.co/PT8CMSU2AR pic.twitter.com/PuXEzxL7Xd
— Greg Brockman (@gdb) 14 lutego 2019 r.
Chociaż imponujące wyniki są niezwykłym skokiem poza to, co osiągnęły istniejące modele językowe, zastosowana technika nie jest zupełnie nowa. Zamiast tego, przełom nastąpił głównie dzięki dostarczaniu algorytmowi coraz większej ilości danych treningowych — sztuczka, która była również odpowiedzialna za większość innych ostatnich postępów w nauczaniu AI czytania i pisania. To trochę zaskakujące, jeśli chodzi o to, co można zrobić [...] z większą ilością danych i większymi modelami, mówi Percy Liang, profesor informatyki na Stanford.
Fragmenty tekstu, które tworzy model, są wystarczająco dobre, by udawać, że są napisane przez człowieka. Ale tej umiejętności nie należy mylić z prawdziwym zrozumieniem języka — ostatecznym celem poddziedziny sztucznej inteligencji znanej jako przetwarzanie języka naturalnego (NLP). (W widzeniu komputerowym jest odpowiednik: algorytm może syntetyzować bardzo realistyczne obrazy bez prawdziwego rozumienia wizualnego.) W rzeczywistości doprowadzenie maszyn do tego poziomu zrozumienia jest zadaniem, które w dużej mierze umknęło badaczom NLP. Osiągnięcie tego celu może zająć lata, a nawet dziesięciolecia, przypuszcza Liang, i prawdopodobnie będzie wymagało technik, które jeszcze nie istnieją.
Cztery różne filozofie języka obecnie napędzają rozwój technik NLP. Zacznijmy od tego, którego używa OpenAI.
#1. Semantyka dystrybucji
Filozofia językowa. Słowa czerpią znaczenie z tego, jak są używane. Na przykład słowa kot i pies są ze sobą powiązane, ponieważ są używane mniej więcej w ten sam sposób. Możesz nakarmić i pogłaskać kota, a także nakarmić i pogłaskać psa. Nie możesz jednak karmić i głaskać pomarańczy.
Powiązana historia
Powiązana historia Nasycony miliardami słów algorytm tworzy przekonujące artykuły i pokazuje, w jaki sposób sztuczna inteligencja może zostać wykorzystana do oszukiwania ludzi na masową skalę.Jak to przekłada się na NLP. Algorytmy oparte na semantyce dystrybucyjnej były w dużej mierze odpowiedzialne za: ostatnie przełomy w NLP . Wykorzystują uczenie maszynowe do przetwarzania tekstu, znajdując wzorce, zasadniczo licząc, jak często i jak blisko są używane słowa w stosunku do siebie. Powstałe modele mogą następnie wykorzystać te wzorce do konstruowania pełnych zdań lub akapitów, a także zasilać takie funkcje, jak autouzupełnianie lub inne systemy predykcyjne tekstu. W ostatnich latach niektórzy badacze zaczęli również eksperymentować z analizowaniem rozkładów losowych sekwencji znaków, a nie słów, dzięki czemu modele mogą bardziej elastycznie obsługiwać akronimy, interpunkcję, slang i inne rzeczy, które nie pojawiają się w słowniku, a także języki, w których nie ma wyraźnych rozgraniczeń między słowami.
Plusy Algorytmy te są elastyczne i skalowalne, ponieważ można je stosować w dowolnym kontekście i uczyć się na danych nieoznaczonych.
Cons. Modele, które tworzą, w rzeczywistości nie rozumieją konstruowanych przez siebie zdań. W końcu piszą prozę, używając skojarzeń słownych.
#2. Semantyka ramek
Filozofia językowa. Język jest używany do opisywania działań i zdarzeń, więc zdania można dzielić na tematy, czasowniki i modyfikatory — WHO , Co , gdzie , oraz Kiedy .
Jak to przekłada się na NLP. Algorytmy oparte na semantyce ramek wykorzystują zestaw reguł lub wiele oznaczonych danych szkoleniowych, aby nauczyć się dekonstruować zdania. To sprawia, że są one szczególnie dobre w analizowaniu prostych poleceń — a tym samym są przydatne dla chatbotów lub asystentów głosowych. Gdybyś na przykład poprosił Alexę o znalezienie na jutro restauracji z czterema gwiazdkami, taki algorytm wymyśliłby, jak wykonać zdanie, dzieląc je na akcję (znajdź), Co (restauracja z czterema gwiazdkami) oraz Kiedy (jutro).
Plusy W przeciwieństwie do algorytmów dystrybucyjno-semantycznych, które nie rozumieją tekstu, z którego się uczą, algorytmy ramowo-semantyczne potrafią rozróżnić różne fragmenty informacji w zdaniu. Można ich użyć, aby odpowiedzieć na pytania, takie jak Kiedy odbywa się to wydarzenie?
Cons. Algorytmy te mogą obsługiwać tylko bardzo proste zdania i dlatego nie są w stanie wychwycić niuansów. Ponieważ wymagają wielu szkoleń kontekstowych, nie są również elastyczne.
#3. Semantyka modelu teoretyczna
Filozofia językowa. Język służy do przekazywania ludzkiej wiedzy.
Jak to przekłada się na NLP. Semantyka teorii modeli opiera się na starym pomyśle w AI, że cała ludzka wiedza może być zakodowana, lub wymodelowany , w serii reguł logicznych. Więc jeśli wiesz, że ptaki potrafią latać, a orły to ptaki, możesz wywnioskować, że orły potrafią latać. Takie podejście nie jest już modne, ponieważ naukowcy szybko zdali sobie sprawę, że od każdej reguły jest zbyt wiele wyjątków (na przykład pingwiny są ptakami, ale nie potrafią latać). Ale algorytmy oparte na semantyce modelu teoretycznego są nadal przydatne do wydobywania informacji z modeli wiedzy, takich jak bazy danych. Podobnie jak algorytmy semantyki ramowej, analizują zdania, dekonstruując je na części. Ale podczas gdy semantyka ramowa definiuje te części jako WHO , Co , gdzie , oraz Kiedy semantyka modelowo-teoretyczna definiuje je jako reguły logiczne kodujące wiedzę. Zastanówmy się na przykład nad pytaniem Jakie jest największe miasto w Europie pod względem liczby ludności? Algorytm modelowo-teoretyczny podzieliłby to na serię samodzielnych zapytań: Jakie są wszystkie miasta na świecie? Które są w Europie? Jaka jest populacja miast? Która populacja jest największa? Będzie wtedy w stanie prześledzić model wiedzy, aby uzyskać ostateczną odpowiedź.
Plusy Algorytmy te dają maszynom możliwość odpowiadania na złożone i szczegółowe pytania.
Cons. Wymagają modelu wiedzy, którego zbudowanie jest czasochłonne i nie jest elastyczne w różnych kontekstach.
#4. Ugruntowana semantyka
Filozofia językowa. Język czerpie znaczenie z przeżytego doświadczenia. Innymi słowy, ludzie stworzyli język, aby osiągnąć swoje cele, więc musi być rozumiany w kontekście naszego zorientowanego na cel świata.
Jak to przekłada się na NLP. To najnowsze podejście, które według Lianga jest najbardziej obiecujące. Próbuje naśladować sposób, w jaki ludzie odbierają język w ciągu swojego życia: maszyna zaczyna od stanu pustego i uczy się kojarzyć słowa z właściwymi znaczeniami poprzez rozmowę i interakcję. W prostym przykładzie, jeśli chciałbyś nauczyć komputer, jak poruszać obiektami w wirtualnym świecie, dałbyś mu polecenie typu Przesuń czerwony klocek w lewo, a następnie pokaż mu, co miałeś na myśli. Z biegiem czasu maszyna nauczyłaby się rozumieć i wykonywać polecenia bez pomocy.
Plusy Teoretycznie algorytmy te powinny być bardzo elastyczne i jak najbardziej zbliżone do prawdziwego zrozumienia języka.
Cons. Nauczanie jest bardzo czasochłonne — i nie wszystkie słowa i wyrażenia są tak łatwe do zilustrowania, jak Przesuń czerwony klocek.
Liang uważa, że w krótkim okresie w dziedzinie NLP nastąpi znacznie większy postęp w zakresie wykorzystywania istniejących technik, zwłaszcza opartych na semantyce dystrybucyjnej. Uważa jednak, że w dłuższej perspektywie wszystkie one mają swoje granice. Prawdopodobnie istnieje jakościowa przepaść między sposobem, w jaki ludzie rozumieją język i postrzegają świat, a naszymi obecnymi modelami, mówi. Dodaje, że zamknięcie tej luki prawdopodobnie wymagałoby nowego sposobu myślenia, a także znacznie więcej czasu.
Pierwotnie pojawiło się to w naszym biuletynie AI The Algorithm. Aby otrzymać go bezpośrednio do skrzynki odbiorczej, zarejestruj się tutaj za darmo.