DeepMind chce nauczyć AI grać w grę karcianą, która jest trudniejsza niż Go





Jeśli kiedykolwiek grałeś w grę karcianą Hanabi, zrozumiesz, kiedy powiem, że jest inna. To gra zespołowa, w której masz pełny widok na ręce wszystkich innych, ale nie na swoje.

Aby wygrać grę, każdy gracz musi udzielać innym wskazówek na temat swoich rąk w ograniczonej liczbie rund, aby ułożyć wszystkie karty w określonej kolejności. To intensywne ćwiczenie w zakresie strategii, wnioskowania i współpracy. Dlatego badacze z Google Brain i DeepMind uważają, że jest to idealna gra dla sztucznej inteligencji, która może zająć się w następnej kolejności.

W nowym artykule twierdzą, że w przeciwieństwie do innych gier, które opanowała sztuczna inteligencja, takich jak szachy, go i poker, Hanabi wymaga teorii umysłu i wyższego poziomu rozumowania. Teoria umysłu polega na zrozumieniu stanów psychicznych innych — i zrozumieniu, że mogą one nie być takie same jak twoje. Jest to podstawowa umiejętność, której ludzie używają do skutecznego działania na świecie i którą zwykle nabywamy, gdy jesteśmy bardzo młodzi.



Informacje w Hanabi są ograniczone zarówno liczbą podpowiedzi udzielanych graczom w każdej grze, jak i tym, co można przekazać w każdej podpowiedzi. W rezultacie agent AI musi również zebrać ukryte informacje z działań innych graczy, aby wygrać grę – wyzwanie, z którym wcześniej nie musiał się mierzyć.

Dodatkowo musi nauczyć się dostarczać jak najwięcej informacji we własnych podpowiedziach i działaniach, aby pomóc innym graczom odnieść sukces. Naukowcy są przekonani, że jeśli agent AI będzie w stanie skutecznie poruszać się w takim środowisku zawierającym niepełne informacje, będzie o krok bliżej do efektywnej współpracy z ludźmi.

To wszystko są nowe wyzwania dla społeczności naukowej i będą wymagały nowych postępów algorytmicznych, które łączą pracę kilku poddziedzin sztucznej inteligencji, w tym uczenie się przez wzmacnianie, teorię gier i komunikację wschodzącą — badanie, w jaki sposób powstaje komunikacja między wieloma agentami AI w warunkach współpracy .



Aby potwierdzić tę hipotezę, zespół Google przetestował wszystkie obecne najnowocześniejsze algorytmy uczenia się przez wzmacnianie i stwierdził, że działają one słabo. W odpowiedzi udostępnili środowisko Hanabi o otwartym kodzie źródłowym, aby pobudzić dalszą pracę w społeczności badawczej.

Jako badacz byłem zafascynowany tym, jak agenci AI mogą nauczyć się komunikować i współpracować ze sobą, a ostatecznie także z ludźmi, mówi Jakob Foerster, jeden ze współautorów artykułu. Hanabi to niepowtarzalna okazja do wielkiego wyzwania w tej dziedzinie.

ukryć