AlphaGo Zero pokazuje, że maszyny mogą stać się nadludzkie bez żadnej pomocy

www.alphagomovie.com





AlphaGo przez długi czas nie był najlepszym graczem Go na świecie. Pojawiła się nowa wersja mistrzowskiego programu AI, który jest potworem. W bezpośrednim pojedynku AlphaGo Zero pokonał oryginalny program 100 meczami do zera.

Naprawdę fajne jest to, jak zrobił to AlphaGo Zero. Podczas gdy oryginalna AlphaGo uczyła się, pobierając dane z setek tysięcy gier rozgrywanych przez ekspertów, AlphaGo Zero, również opracowana przez spółkę zależną Alphabet DeepMind , rozpoczął się od czystej planszy i reguł gry. Nauczył się po prostu grając miliony gier przeciwko sobie, wykorzystując to, czego nauczył się w każdej grze, aby poprawić.

Nowy program stanowi krok naprzód w dążeniu do budowy maszyn, które są naprawdę inteligentne. Dzieje się tak, ponieważ maszyny będą musiały znaleźć rozwiązania trudnych problemów, nawet jeśli nie ma dużej ilości danych treningowych, z których można się uczyć.



Powiązana historia

Najbardziej uderzające jest to, że nie potrzebujemy już żadnych danych ludzkich, mówi Demis Hassabis, dyrektor generalny i współzałożyciel DeepMind. Hassabis twierdzi, że techniki użyte do budowy AlphaGo Zero są wystarczająco potężne, aby można je było zastosować w rzeczywistych sytuacjach, w których konieczne jest zbadanie szerokiego krajobrazu możliwości, w tym odkrywania leków i materiałoznawstwa. Badania stojące za AlphaGo Zero zostały dziś opublikowane w czasopiśmie Natura.

Co ciekawe, podczas tego procesu samouczenia AlphaGo Zero odkrył wiele sztuczek i technik opracowanych przez graczy w Go przez ostatnie kilka tysięcy lat. Po kilku dniach ponownie odkrywa znane najlepsze sztuki, a w ostatnich dniach wykracza poza te sztuki, aby znaleźć coś jeszcze lepszego, mówi Hassabis. Fajnie jest to zobaczyć.

Firma DeepMind z siedzibą w Londynie została przejęta przez Google w 2014 roku. Firma koncentruje się na dokonywaniu dużych postępów w sztucznej inteligencji za pomocą gier, symulacji i uczenia maszynowego; w dążeniu do tego celu zatrudniła setki naukowców zajmujących się sztuczną inteligencją. Hassabis mówi, że w opracowanie AlphaGo Zero zaangażowało się około 15 osób i prawdopodobnie zasoby obliczeniowe warte miliony dolarów.



Zarówno AlphaGo, jak i AlphaGo Zero wykorzystują podejście uczenia maszynowego znane jako uczenie wzmacniające (patrz 10 Breakthrough Technologies 2017: Reinforcement Learning ), a także głębokie sieci neuronowe. Uczenie się przez wzmacnianie jest inspirowane sposobem, w jaki zwierzęta uczą się poprzez eksperymenty i informacje zwrotne, a DeepMind wykorzystał tę technikę, aby osiągnąć nadludzką wydajność w prostszych grach na Atari.

Liczba możliwych konfiguracji na planszy Go jest większa niż liczba atomów we wszechświecie. www.alphagomovie.com

Opanowanie gry planszowej Go było jednak szczególnie ważne, ponieważ gra jest tak złożona, a najlepsi gracze wykonują ruchy tak instynktownie. Innymi słowy, zasad dobrej gry nie da się łatwo wytłumaczyć ani napisać kodem.



Uczenie się ze wzmocnieniem daje również nadzieję na automatyzację programowania maszyn w wielu innych kontekstach, w tym w tych, w których ręczne programowanie byłoby niepraktyczne. Jest już testowany jako sposób na nauczenie robotów, na przykład chwytania niewygodnych obiektów, oraz jako sposób na oszczędzanie energii w centrach danych poprzez rekonfigurację sprzętu w locie. Jednak w wielu sytuacjach rzeczywistych liczba przykładów, z których można się uczyć, może nie być zbyt duża, co oznacza, że ​​maszyny będą musiały uczyć się same. To właśnie sprawia, że ​​AlphaGo Zero jest interesująca.

Mówi, że nie wykorzystując ludzkich danych ani ludzkiej wiedzy, w rzeczywistości usunęliśmy ograniczenia ludzkiej wiedzy David Silver , główny badacz w DeepMind i profesor w University College London. Jest w stanie tworzyć dla siebie wiedzę z pierwszych zasad.

Aby osiągnąć przewagę w Go, AlphaGo Zero po prostu grała przeciwko sobie, na początku losowo. Podobnie jak oryginał, używał głębokiej sieci neuronowej i potężnego algorytmu wyszukiwania, aby wybrać następny ruch. Ale w AlphaGo Zero o obie funkcje zadbała jedna sieć neuronowa.



Martina Mullera , profesor na Uniwersytecie Alberta w Kanadzie, który wykonał ważną pracę nad oprogramowaniem do grania w Go, jest pod wrażeniem projektu AlphaGo Zero i twierdzi, że rozwija on uczenie się ze wzmacnianiem. Architektura jest prostsza, ale potężniejsza niż poprzednie wersje, mówi.

DeepMind jest już ulubieńcem branży sztucznej inteligencji, a jego najnowsze osiągnięcie z pewnością przyciągnie nagłówki i wywoła debatę na temat postępu w kierunku znacznie potężniejszych form sztucznej inteligencji.

Istnieją jednak powody, aby ostrożnie podejść do ogłoszenia. Piotr Niedziele , profesor na Uniwersytecie Waszyngtońskim, wskazuje, że program nadal musi rozegrać wiele milionów gier, aby opanować Go — o wiele więcej niż robi to doświadczony człowiek. Sugeruje to, że inteligencja, z której korzysta program, jest w jakiś sposób zasadniczo odmienna.

To ładna ilustracja ostatnich postępów w uczeniu głębokim i uczeniu przez wzmacnianie, ale nie czytałbym w nim zbyt wiele jako znaku tego, czego komputery mogą się uczyć bez ludzkiej wiedzy, mówi Domingos. Naprawdę imponujące byłoby, gdyby AlphaGo pokonał [legendarnego mistrza Korei Południowej] Lee Sedola po rozegraniu mniej więcej tylu meczów, ile rozegrał w swojej karierze, zanim został mistrzem. Nie jesteśmy w pobliżu tego.

Rzeczywiście, zarówno Silver, jak i Hassabis przyznają, że znalezienie sposobów uczenia maszyn na znacznie mniejszej ilości danych będzie ważne w ich ciągłym dążeniu do opanowania inteligencji. Może to obejmować opracowanie nowatorskich podejść, które pozwolą maszynom przenosić to, czego nauczyły się w jednej dziedzinie do drugiej, lub uczyć się z obserwacji innych (zarówno ludzi, jak i innych AI).

Ale pomimo pracy, którą trzeba jeszcze wykonać, Hassabis ma nadzieję, że w ciągu 10 lat sztuczna inteligencja odegra ważną rolę w rozwiązywaniu ważnych problemów w nauce, medycynie i innych dziedzinach. Mam nadzieję, że tego rodzaju algorytmy i przyszłe wersje będą rutynowo współpracować z nami, przesuwając granice nauki i medycyny – mówi. Może wszelkiego rodzaju rzeczy zostaną częściowo zaprojektowane i odkryte przez tego rodzaju algorytmy, współpracujące z bardzo inteligentnymi ludźmi.

ukryć