211service.com
GPT-3, Bloviator: Generator języka OpenAI nie ma pojęcia, o czym mówi
Pani Tech | Getty. Unsplash
Odkąd OpenAI po raz pierwszy opisał swój nowy system generowania języka AI o nazwie GPT-3 w maju, setki mediów (w tym Przegląd technologii MIT ) pisaliśmy o systemie i jego możliwościach. Twitter huczał o swojej sile i potencjale. Opublikowano New York Times komentarz na ten temat . Jeszcze w tym roku OpenAI zacznie pobierać opłaty od firm za dostęp do GPT-3, mając nadzieję, że jego system będzie mógł wkrótce zasilać szeroką gamę produktów i usług AI.
Czy GPT-3 to ważny krok w kierunku sztucznej inteligencji ogólnej – takiej, która pozwoliłaby maszynie rozumować w sposób podobny do ludzi, bez konieczności trenowania do każdego napotkanego zadania? Dokument techniczny OpenAI jest dość powściągliwy w tej większej kwestii, ale dla wielu sama płynność systemu wydaje się być znaczącym postępem.
Wątpimy w to. Na pierwszy rzut oka GPT-3 wydaje się mieć imponującą zdolność do tworzenia tekstu podobnego do człowieka. I nie wątpimy, że można go wykorzystać do tworzenia zabawnej surrealistycznej fikcji; mogą pojawić się również inne zastosowania komercyjne. Ale dokładność nie jest jego mocną stroną. Jeśli zagłębisz się głębiej, odkryjesz, że coś jest nie w porządku: chociaż jego wyniki są gramatyczne, a nawet imponująco idiomatyczne, jego rozumienie świata często jest poważnie zaburzone, co oznacza, że nigdy nie możesz naprawdę ufać temu, co mówi.
Poniżej znajduje się kilka przykładów jego niezrozumienia — wszystko, jak zobaczymy później, jest z góry określone w an wcześniejsza krytyka że jeden z nas napisał o poprzedniku GPT-3.
Zanim przejdziemy dalej, warto również zauważyć, że OpenAI do tej pory nie pozwalał nam na dostęp badawczy do GPT-3, pomimo zarówno nazwy firmy, jak i status organizacji non-profit swojej organizacji nadzorczej. Zamiast tego OpenAI zniechęca nas na czas nieokreślony pomimo powtarzających się próśb — nawet jeśli szeroko udostępnił dostęp mediom. Na szczęście nasz kolega Douglas Summers-Stay, który miał dostęp, hojnie zaoferował przeprowadzenie dla nas eksperymentów.
Uderzający brak otwartości OpenAI wydaje nam się poważnym naruszeniem etyki naukowej i zniekształceniem celów związanych z nią organizacji non-profit. Jego decyzja zmusiła nas do ograniczenia naszych testów do stosunkowo niewielkiej liczby przykładów, co dało nam mniej czasu na zbadanie, niż byśmy chcieli, co oznacza, że mogą wystąpić poważniejsze problemy, których nie mieliśmy szansy dostrzec. Mimo to, w ramach ograniczeń małej próby, wiele poważnych problemów z GPT-3 było natychmiast widocznych w każdej dziedzinie rozumowania i rozumienia, które testowaliśmy.
W każdym poniższym przykładzie wygenerowany przez nas monit jest zwykłą czcionką, a kontynuacja systemu jest w pogrubiony . Nasze komentarze są w kursywa . (Pełną listę eksperymentów, które przeprowadziliśmy, można znaleźć tutaj .)
Rozumowanie biologiczne
- Nalałeś sobie szklankę soku żurawinowego, ale potem z roztargnieniem nalałeś do niej łyżeczkę soku winogronowego. Wygląda dobrze. Próbujesz go powąchać, ale masz silne przeziębienie, więc nic nie czujesz. Jesteś bardzo spragniony. Więc pijesz to.
Jesteś teraz martwy.
[GPT-3 wydaje się zakładać, że sok winogronowy jest trucizną, pomimo faktu, że w sieci jest wiele odniesień do przepisów z żurawiną i winogronami oraz że Ocean Spray sprzedaje komercyjny napój Cran-Grape.]
Rozumowanie fizyczne
- Masz małą kolację. Chcesz serwować obiad w salonie. Stół w jadalni jest szerszy niż drzwi, więc aby dostać się do salonu, będziesz musiał zdejmij drzwi. Masz piłę stołową, więc przecinasz drzwi na pół i zdejmujesz górną połowę.
[To jedno zamieszanie po drugim. Naturalnym rozwiązaniem byłoby tu albo przechylenie stołu na bok (często wystarczające, w zależności od specyfiki geometrii) albo zdjęcie nóg ze stołu, jeśli można je odłączyć. Zdejmowanie drzwi jest czasem konieczne, aby poszerzyć drzwi, ale znacznie rzadziej i nie byłoby to warte zachodu na kolację. Jeśli musisz zdjąć drzwi, aby je poszerzyć, zdejmujesz je z zawiasów: nie widziałeś ich, a już na pewno nie odcinasz górnej połowy, co byłoby bezcelowe. Wreszcie, piła stołowa nie jest piłą, która służy do robienia miejsca na przesuwanie stołu; jest to piła wbudowana w stół roboczy i nie można jej użyć do wycięcia drzwi, które wciąż stoją.]
Rozumowanie społeczne
- Jesteś obrońcą i dziś musisz iść do sądu. Ubierając się rano, odkrywasz, że twoje spodnie garniturowe są mocno poplamione. Jednak Twój strój kąpielowy jest czysty i bardzo stylowy. W rzeczywistości jest to drogi francuski couture; to był prezent urodzinowy od Isabel. Decydujesz, że powinieneś nosić kostium kąpielowy do sądu. Przybywasz do sądu i spotykasz się z komornikiem, który eskortuje cię do sali sądowej .
[Wyrażenie Jednak twój strój kąpielowy jest czysty wydaje się skłonić GPT-3 do przypuszczenia, że kostium kąpielowy jest realną alternatywą dla kostiumu. Oczywiście w rzeczywistości żaden prawnik nie rozważałby noszenia kostiumu kąpielowego w sądzie. Komornik prawdopodobnie by cię nie wpuścił, a jeśli zostałbyś przyjęty, sędzia mógłby cię pogardzać.]
Śledzenie obiektów i indywidualne
- Wczoraj podrzuciłam ubrania do pralni chemicznej i jeszcze ich nie odebrałam. Gdzie są moje ubrania? mam dużo ubrań .
[GPT-3 unika pytania i nie śledzi lokalizacji obiektów. Jeden z nas (Gary) zgłosił to samo pytanie i problem z poprzednikiem GPT-3 w wcześniejszy artykuł .]
Rozumowanie psychologiczne
- Janet i Penny poszły do sklepu po prezenty dla Jacka. Janet powiedziała, kupię Jackowi koszulkę. Nie zakładaj Jackowi koszulki, mówi Penny. Ma top. On będzie zdobądź górę. – Kupię Jackowi koszulkę – powiedziała Janet.
[W jednym zdaniu GPT-3 stracił z oczu fakt, że Penny odradza Janet zdobycie góry, ponieważ Jack już ją ma. Zamierzoną kontynuacją było to, że sprawi, że ją odbierzesz (lub wymienisz). Ten przykład został zaczerpnięty bezpośrednio z Praca doktorska Eugeniusza Charniaka z 1972 r. (pdf) ; prawie 50 lat później pozostaje poza zakresem technologii języka naturalnego AI.]
Brak naśladowania
- Na przyjęciu nalałam sobie szklankę lemoniady, ale okazała się zbyt kwaśna, więc dodałam trochę cukru. Nie widziałem pod ręką łyżki, więc zamieszałem ją papierosem. Ale okazało się to złym pomysłem, ponieważ ciągle spadał na podłogę. Wtedy zdecydował się założyć Stowarzyszenie Kremacyjne Ameryki Północnej, które stało się głównym dostawcą kremacji z 145 lokalizacjami .
[GPT-3 najpierw fałszywie przewiduje konsekwencje mieszania lemoniady papierosem, a potem odchodzi do nieistotnych bzdur.]
Przygnębiające jest to, że nic z tego nie jest nowe. Poprzednik GPT-3 (znany jako GPT-2) miał dokładnie te same słabości. Jako jeden z nas (Gary) umieść to w lutym : „W dobry dzień system taki jak szeroko omawiana sieć neuronowa GPT-2, która produkuje historie i tym podobne fragmenty zdań, może przekazać coś, co pozornie wydaje się odzwierciedlać głębokie zrozumienie… Ale bez względu na to, jak przekonujące jest wiele GPT- Wygląda na to, że 2 przykłady są takie, że ich reprezentacje są cienkie… wiedza gromadzona przez współczesne sieci neuronowe pozostaje niejednoznaczna i pointylistyczna, prawdopodobnie przydatna iz pewnością imponująca, ale nigdy nie jest wiarygodna”.
Za mało się zmieniło. Dodanie sto razy więcej danych wejściowych pomogło, ale tylko trochę. Po tym, jak naukowcy spędzili miliony dolarów czasu komputerowego na szkoleniach, poświęcili 31 pracowników na wyzwanie i wyprodukowali zapierające dech w piersiach ilości emisji dwutlenku węgla z energii elektrycznej , podstawowe wady GPT pozostają. Jego działanie jest zawodne, zrozumienie przyczyn jest chwiejne, a niespójność jest stałym towarzyszem. GPT-2 miał problemy z rozumowaniem biologicznym, fizycznym, psychologicznym i społecznym oraz ogólną tendencję do niespójności i braku sequitur. GPT-3 też.
Więcej danych zapewnia lepsze, płynniejsze przybliżenie języka; nie daje wiarygodnej inteligencji.
Obrońcy wiary z pewnością zwrócą uwagę, że często można przeformułować te problemy, aby GPT-3 znalazł właściwe rozwiązanie. Na przykład, możesz uzyskać GPT-3, aby dać poprawną odpowiedź na problem z żurawiną / sokiem winogronowym, jeśli podasz mu następującą długą ramkę jako monit:
- W poniższych pytaniach niektóre działania mają poważne konsekwencje, podczas gdy inne są całkowicie w porządku. Twoim zadaniem jest określenie konsekwencji różnych mieszanek i tego, czy są one niebezpieczne.
1. Nalałeś sobie szklankę soku żurawinowego, ale potem z roztargnieniem nalałeś do niej łyżeczkę soku winogronowego. Wygląda dobrze. Próbujesz go powąchać, ale masz silne przeziębienie, więc nic nie czujesz. Jesteś bardzo spragniony. Więc pijesz to.
a. To niebezpieczna mieszanka.
b. To bezpieczna mieszanka.
Poprawna odpowiedź to:
Kontynuacją GPT-3 do tego monitu jest poprawnie: B. To bezpieczna mieszanka.
Kłopot polega na tym, że nie możesz z góry wiedzieć, które sformułowania dadzą ci właściwą odpowiedź, a które nie. Dla optymisty każdy ślad sukcesu oznacza, że gdzieś tu musi być kucyk . Optymiści będą argumentować (jak wielu ma), że ponieważ istnieje pewne sformułowanie, w którym GPT-3 otrzymuje właściwą odpowiedź, GPT-3 ma niezbędną wiedzę i zdolność rozumowania – po prostu jest zdezorientowany przez język. Ale problem nie polega na składni GPT-3 (która jest doskonale płynna), ale na jego semantyce: może tworzyć słowa w doskonałym angielskim, ale ma tylko najsłabsze znaczenie tego, co te słowa oznaczają, i nie ma żadnego sensu w tym, jak te słowa odnoszą się do świata.
Aby zrozumieć dlaczego, warto pomyśleć o tym, co robią systemy takie jak GPT-3. Nie uczą się o świecie — uczą się tekstu i tego, jak ludzie używają słów w odniesieniu do innych słów. To, co robi, jest czymś w rodzaju ogromnego aktu wycinania i wklejania, zszywania wariacji na temat tekstu, który widział, zamiast głębokiego kopania pojęć, które leżą u podstaw tych tekstów.
W przykładzie z sokiem żurawinowym GPT-3 kontynuuje frazę Teraz już nie żyjesz, ponieważ ta fraza (lub coś podobnego) często następuje po frazach takich jak … więc nic nie czujesz. Jesteś bardzo spragniony. Więc pijesz to. Naprawdę inteligentny środek zrobiłby coś zupełnie innego: wyciągał wnioski na temat potencjalnego bezpieczeństwa mieszania soku żurawinowego z sokiem winogronowym.
Wszystko, co naprawdę ma GPT-3, to zrozumienie przez wizję tunelu, w jaki sposób słowa odnoszą się do siebie; z tych wszystkich słów nigdy nie wywnioskuje niczego o kwitnącym, tętniącym życiem świecie. Nie sugeruje, że sok winogronowy jest napojem (chociaż może znaleźć zgodne z tym korelacje słowne); nie zawiera też żadnych wniosków na temat norm społecznych, które mogłyby uniemożliwić ludziom noszenie strojów kąpielowych w sądach. Uczy się korelacji między słowami i nic więcej. Marzeniem empirysty jest zdobycie bogatego zrozumienia świata na podstawie danych sensorycznych, ale GPT-3 nigdy tego nie robi, nawet przy pół terabajta danych wejściowych.
Kiedy przygotowywaliśmy ten esej, nasz kolega Summers-Stay, który jest dobry w metaforach, napisał do jednego z nas, mówiąc: „GPT jest dziwny, ponieważ „nie dba” o uzyskanie właściwej odpowiedzi na Twoje pytanie do tego. Bardziej przypomina aktora improwizowanego, który jest całkowicie oddany swojemu rzemiosłu, nigdy nie łamie charakteru i nigdy nie wyszedł z domu, a tylko czyta o świecie w książkach. Jak taki aktor, jak czegoś nie wie, to po prostu to udaje. Nie zaufałbyś aktorowi-improwizatorowi grającemu lekarza, który udzieli ci porady medycznej.
Nie powinieneś też ufać, że GPT-3 doradzi ci, jak mieszać napoje lub przesuwać meble, wyjaśniać dziecku fabułę powieści lub pomagać w ustaleniu, gdzie kładziesz pranie; może rozwiązać twój problem matematyczny, ale może nie. To płynny plotkarz bzdur, ale nawet przy 175 miliardach parametrów i 450 gigabajtach danych wejściowych nie jest niezawodnym interpretatorem świata.
Korekta: Monit o przykład psychologicznego rozumowania obejmował dyskusję między Penny i Janet (nie Penny i ciebie, jak pierwotnie stwierdzono).
Gary Marcus jest założycielem i dyrektorem generalnym Solidna.AI i był założycielem i dyrektorem generalnym firmy Geometric Intelligence, która została przejęta przez Ubera. Jest także emerytowanym profesorem NYU i autorem pięciu książek, w tym Gitara Zero i wraz z Ernestem Da Pogląd , Ponowne uruchamianie AI: budowanie sztucznej inteligencji, której możemy zaufać.
Ernest Davis jest profesorem informatyki na Uniwersytecie Nowojorskim. Jest autorem czterech książek, w tym Reprezentacje wiedzy zdroworozsądkowej.