211service.com
Fikcyjna sztuczna inteligencja OpenAI uczy się generować obrazy
Ben Barry / OpenAI
W lutym ubiegłego roku laboratorium badawcze OpenAI z San Francisco ogłoszony że jego system AI może teraz pisać przekonujące fragmenty angielskiego. Wprowadź początek zdania lub akapitu do GPT-2, jak go nazwano, i może kontynuować myśl tak długo, jak esej z niemal ludzką spójnością.
Teraz laboratorium bada, co by się stało, gdyby zamiast tego ten sam algorytm był zasilany częścią obrazu. Wyniki , które otrzymały wyróżnienie za najlepszy artykuł na Międzynarodowej Konferencji na temat Uczenia Maszynowego w tym tygodniu, otwierają nową drogę do generowania obrazów, pełną możliwości i konsekwencji.
W swej istocie GPT-2 jest potężnym silnikiem predykcyjnym. Nauczył się rozumieć strukturę języka angielskiego, przeglądając miliardy przykładów słów, zdań i akapitów, wygrzebanych z zakamarków Internetu. Dzięki tej strukturze może następnie manipulować słowami w nowe zdania, statystycznie przewidując kolejność, w jakiej powinny się pojawić.
Dlatego badacze z OpenAI postanowili zamienić słowa na piksele i wytrenować ten sam algorytm na obrazach w ImageNet, najpopularniejszym banku obrazów do głębokiego uczenia. Ponieważ algorytm został zaprojektowany do pracy z danymi jednowymiarowymi (tj. ciągami tekstu), rozwinęli obrazy w pojedynczą sekwencję pikseli. Odkryli, że nowy model, nazwany iGPT, wciąż był w stanie uchwycić dwuwymiarowe struktury wizualnego świata. Biorąc pod uwagę sekwencję pikseli w pierwszej połowie obrazu, można przewidzieć drugą połowę w sposób, który człowiek uzna za rozsądny.
Poniżej kilka przykładów. Skrajna lewa kolumna to dane wejściowe, skrajna prawa kolumna to oryginał, a środkowe kolumny to przewidywane uzupełnienia iGPT. (Zobacz więcej przykładów tutaj .)
OPENAIWyniki są zaskakująco imponujące i pokazują nową ścieżkę wykorzystania nienadzorowanego uczenia się, które szkoli się na danych nieoznakowanych, w rozwoju komputerowych systemów wizyjnych. Podczas gdy wczesne komputerowe systemy wizyjne w połowie 2000 roku wypróbowywały już takie techniki, wypadły one z łask, ponieważ uczenie nadzorowane, które wykorzystuje dane oznaczone etykietami, okazało się znacznie bardziej skuteczne. Zaletą uczenia się nienadzorowanego jest jednak to, że umożliwia on systemowi sztucznej inteligencji poznawanie świata bez ludzkiego filtra i znacznie ogranicza ręczną pracę związaną z etykietowaniem danych.
Fakt, że iGPT używa tego samego algorytmu co GPT-2, również pokazuje jego obiecującą zdolność adaptacyjną. Jest to zgodne z Ostateczna ambicja OpenAI aby osiągnąć bardziej uogólnioną inteligencję maszyny.
Jednocześnie metoda ta przedstawia niepokojący nowy sposób tworzenia obrazów typu deepfake. Sieci generatywnych przeciwników , najczęstsza kategoria algorytmów używanych w przeszłości do tworzenia deepfake, musi być szkolona na wysoce wyselekcjonowanych danych. Jeśli na przykład chcesz uzyskać GAN do generowania twarzy, jego dane treningowe powinny obejmować tylko twarze. Z kolei iGPT po prostu uczy się wystarczająco dużo struktury wizualnego świata na milionach i miliardach przykładów, aby wypluć obrazy, które mogłyby w nim istnieć. Chociaż uczenie modelu jest nadal kosztowne obliczeniowo, stanowiąc naturalną barierę w jego dostępie, może to nie trwać długo.
OpenAI nie udzieliło prośby o wywiad, ale podczas wewnętrznego spotkania zespołu ds. polityki, w którym MIT Technology Review uczestniczył w zeszłym roku, jej dyrektor ds. polityki, Jack Clark, zastanawiał się nad przyszłymi zagrożeniami związanymi z generowaniem w stylu GPT, w tym o tym, co by się stało, gdyby zostało zastosowane do obrazy. Powiedział, że nadchodzi wideo, które pokazuje, w którym miejscu, według niego, podąża trajektoria badawcza w tej dziedzinie. Za prawdopodobnie pięć lat będziesz mieć warunkowe generowanie wideo w horyzoncie od 5 do 10 sekund”. Następnie przystąpił do opisywania tego, co sobie wyobrażał: nakarmiłbyś zdjęcie polityka i eksplozję obok nich, a to wygenerowałoby prawdopodobną informację o tym, że polityk został zabity.
Aktualizacja: Ten artykuł został zaktualizowany o usunięcie nazwiska polityka w hipotetycznym scenariuszu opisanym na końcu.