Sztuczna inteligencja uzbrojona w wiele zmysłów może zyskać bardziej elastyczną inteligencję

Inteligencja ludzka wyłania się z połączenia naszych zmysłów i zdolności językowych. Może to samo dotyczy sztucznej inteligencji.





multimodalny AI pojedynczy

Selman projekt

24 lutego 2021

  • Dlaczego jest to ważne:

    Sztuczna inteligencja, która potrafi wyczuwać i mówić, znacznie lepiej poradzi sobie z nowymi wyzwaniami i współpracą z ludźmi.


  • Kluczowi gracze:

    • OpenAI



    • AI2

    • Facebook


  • Dostępność:

    Ale już



Pod koniec 2012 roku naukowcy zajmujący się sztuczną inteligencją po raz pierwszy odkryli, jak uzyskać sieci neuronowe do zobaczenia. Udowodnili, że oprogramowanie zaprojektowane do luźnego naśladowania ludzkiego mózgu może radykalnie ulepszyć istniejące komputerowe systemy wizyjne. Od tego czasu dziedzina nauczyła się, jak sprawić, by sieci neuronowe naśladowały sposób, w jaki my: rozum, słuchaj, mów i pisz .

Ale chociaż sztuczna inteligencja stała się niezwykle ludzka — a nawet nadludzka — przy wykonywaniu określonego zadania, nadal nie oddaje elastyczności ludzkiego mózgu. Możemy nauczyć się umiejętności w jednym kontekście i zastosować je w innym. Dla kontrastu, chociaż algorytm gry DeepMind AlphaGo może pokonać najlepszych mistrzów Go na świecie, nie może rozszerzyć tej strategii poza planszę. Innymi słowy, algorytmy głębokiego uczenia są mistrzami w wychwytywaniu wzorców, ale nie potrafią zrozumieć i dostosować się do zmieniającego się świata.

Kwestia postępu

Ta historia była częścią naszego wydania z marca 2021 r.



  • Zobacz resztę numeru
  • Subskrybuj

Naukowcy mają wiele hipotez na temat tego, jak można rozwiązać ten problem, ale jedna w szczególności zyskała popularność. Dzieci poznają świat, wyczuwając go i rozmawiając o nim. Kombinacja wydaje się kluczowa. Gdy dzieci zaczynają kojarzyć słowa z widokami, dźwiękami i innymi zmysłowymi informacjami, są w stanie opisać coraz bardziej skomplikowane zjawiska i dynamikę, oddzielić to, co przyczynowe, od tego, co odzwierciedla jedynie korelację i skonstruować wyrafinowany model świata. Model ten pomaga im następnie poruszać się w nieznanym środowisku i umieszczać nową wiedzę i doświadczenia w kontekście.

Sztuczna inteligencja DeepMind pokonała teraz prawie wszystkich ludzkich graczy w StarCraft II AlphaStar współpracował ze sobą, aby nauczyć się nowych strategii podboju popularnej galaktycznej gry wojennej.

Z drugiej strony systemy sztucznej inteligencji są zbudowane do wykonywania tylko jednej z tych rzeczy na raz. Algorytmy komputerowej wizji i rozpoznawania dźwięku mogą wyczuwać rzeczy, ale nie mogą używać języka do ich opisywania. Model języka naturalnego może manipulować słowami, ale słowa są oderwane od jakiejkolwiek rzeczywistości zmysłowej. Jeśli zmysły i język zostały połączone, aby dać AI bardziej ludzki sposób gromadzenia i przetwarzania nowych informacji , czy może w końcu rozwinąć coś w rodzaju rozumienia świata?

Istnieje nadzieja, że ​​te multimodalne systemy, z dostępem zarówno do zmysłowych, jak i lingwistycznych trybów ludzkiej inteligencji, powinny dać początek silniejszemu rodzajowi sztucznej inteligencji, który będzie mógł łatwiej dostosowywać się do nowych sytuacji lub problemów. Takie algorytmy mogłyby następnie pomóc nam w rozwiązywaniu bardziej złożonych problemów lub zostać przeniesione do robotów, które mogą komunikować się i współpracować z nami w naszym codziennym życiu.



Pomogły nowe postępy w algorytmach przetwarzania języka, takich jak GPT-3 OpenAI. Naukowcy rozumieją teraz, jak na tyle dobrze naśladować manipulację językiem, aby połączenie jej z możliwościami wyczuwania było potencjalnie bardziej owocne. Na początek wykorzystują pierwszą zdolność wykrywania, jaką udało im się osiągnąć w polu: widzenie komputerowe. Wynikiem są proste modele bimodalne lub wizualno-językowa sztuczna inteligencja .

W minionym roku w tej dziedzinie osiągnięto kilka ekscytujących wyników. We wrześniu naukowcy z Allen Institute for Artificial Intelligence, AI2, stworzyli model, który może: wygeneruj obraz z podpisu tekstowego , demonstrując zdolność algorytmu do kojarzenia słów z informacjami wizualnymi. W listopadzie naukowcy z University of North Carolina w Chapel Hill opracowali metodę, która: włącza obrazy do istniejących modeli językowych , co poprawiło umiejętność czytania modeli.

2021

10 przełomowych technologii

OpenAI wykorzystał te pomysły do ​​rozszerzenia GPT-3. Na początku 2021 r. laboratorium udostępniło dwa modele wizualno-językowe. Jeden łączy obiekty na obrazie ze słowami, które opisują je w podpisie. Drugi generuje obrazy w oparciu o kombinację poznanych pojęć. Możesz go podpowiedzieć na przykład do namalowania obrazu kapibary siedzącej na polu o wschodzie słońca. Chociaż może nigdy wcześniej tego nie widział, może mieszać i dopasowywać to, co wie o obrazach, kapibarach, polach i wschodach słońca, aby wymyślić dziesiątki przykładów.

Osiągnięcie bardziej elastycznej inteligencji nie tylko odblokuje nowe aplikacje sztucznej inteligencji, ale także uczyni je bezpieczniejszymi.

Bardziej wyrafinowane systemy multimodalne umożliwią również więcej zaawansowani asystenci robotów (pomyśl o lokajach robota, nie tylko o Alexie). Obecna generacja robotów napędzanych sztuczną inteligencją wykorzystuje przede wszystkim dane wizualne do nawigacji i interakcji z otoczeniem. Jest to dobre do wykonywania prostych zadań w ograniczonych środowiskach, takich jak realizacja zamówień w magazynie. Jednak laboratoria takie jak AI2 pracują nad dodaniem języka i wprowadzeniem większej liczby danych wejściowych sensorycznych, takich jak dane dźwiękowe i dotykowe, aby maszyny mogły rozumieć polecenia i wykonywać bardziej złożone operacje, takie jak otwieranie drzwi, gdy ktoś puka.

Na dłuższą metę przełomowe odkrycia multimodalne mogą pomóc przezwyciężyć niektóre z największych ograniczeń sztucznej inteligencji. Eksperci twierdzą na przykład, że jego niezdolność do zrozumienia świata jest również powodem, dla którego łatwo może zawieść lub zostać oszukanym. (Obraz można zmienić w sposób niezauważalny dla ludzi, ale sprawia, że ​​sztuczna inteligencja identyfikuje go jako coś zupełnie innego.) Osiągnięcie bardziej elastycznej inteligencji nie tylko odblokuje nowe aplikacje AI: sprawi, że będą one również bezpieczniejsze. Algorytmy, które wyświetlają życiorysy, nie traktują nieistotnych cech, takich jak płeć i rasa, jako oznak zdolności. Autonomiczne samochody nie tracą orientacji w nieznanym otoczeniu i nie rozbijają się w ciemności lub przy śnieżnej pogodzie. Systemy multimodalne mogą stać się pierwszą sztuczną inteligencją, której naprawdę możemy zaufać w naszym życiu.