Koniec czasu na zabawę

Na początku zeszłego roku komputer osiągnął światowej klasy wydajność w grze Go — wiele lat wcześniej, zanim większość ludzi uwierzyła, że ​​taki wyczyn będzie możliwy.





To imponujące, ale nasze ambicje powinny być wyższe. Informatyka może pomóc w zapewnieniu tego, czego świat krytycznie potrzebuje: narzędzi, które pozwolą nam wszystkim wyjść poza to, do czego myśleliśmy, że jesteśmy zdolni. Uczenie się przez wzmacnianie — integralna część sukcesu Go — może przyspieszyć ten proces (patrz 10 Przełomowe technologie: uczenie się przez wzmacnianie ).

Uczenie się przez wzmacnianie to sposób, w jaki komputer uczy się poprzez doświadczenie, aby podejmować szereg decyzji, które przynoszą pozytywne wyniki — nawet bez wcześniejszej wiedzy o tym, jak jego działania wpłyną na jego najbliższe otoczenie. Na przykład nauczyciel korzystający z oprogramowania zmieniałby swoje działania w odpowiedzi na to, jak uczniowie wykonują testy po użyciu go.

Emma Brunskill



Jeśli mamy nadzieję stworzyć sztucznych agentów nauczania przy użyciu uczenia ze wzmocnieniem, będziemy potrzebować algorytmów, które są inteligentne w zakresie danych. Możemy zbierać dane z internetowych systemów edukacyjnych i wykorzystywać je, aby pomóc agentowi oszacować skuteczność różnych podejść do nauczania. Kiedy uczeń się loguje, czy system powinien przedstawiać mu problem do rozwiązania? A może lepiej byłoby zacząć od filmu objaśniającego? Dane mogą pomóc w podjęciu decyzji.

Ale w niektórych przypadkach nie ma wystarczającej ilości danych lub nie ma odpowiedniego rodzaju danych, co utrudnia tworzenie systemów, które podejmują dobre decyzje. Byłoby fajnie, gdybyśmy mogli stworzyć system, który w pierwszej kolejności nie potrzebuje tak dużej ilości danych. I właśnie nad tym pracuje moja grupa — opracowujemy algorytmy uczenia się przez wzmacnianie i techniki statystyczne, aby umożliwić komputerom opracowywanie dobrych sugestii przy użyciu mniejszej ilości danych. Przed nami jeszcze dużo pracy, ale zmniejszamy przepaść między teorią a praktyką.

W końcu nie powinniśmy zostawiać tego wszystkiego komputerom. Tak zwane uczenie się ze wzmocnieniem typu „człowiek w pętli” może przyspieszyć ten proces, umożliwiając algorytmom wnioskowanie o własnej ograniczonej wydajności i zwracanie się do ludzi o pomoc, gdy potrzebują, na przykład, rozszerzenia zestawu możliwych decyzji. Moja grupa i nasi współpracownicy z Uniwersytetu Waszyngtońskiego testują teraz algorytmy systemu korepetycji, który może stwierdzić, czy obecny program nauczania nie umożliwia wszystkim uczniom dobrej nauki, a następnie prosi ludzi o dodanie nowych wskazówek do systemu. Taka współpraca człowiek-komputer może pomóc uczniom w nauce przy użyciu podejść, których jeszcze nie potrafimy sobie wyobrazić. Ta wizja uczenia się przez wzmacnianie ma sztucznie inteligentnych agentów na nowo zdefiniować, jak wygląda wybitna ludzka wydajność – i umożliwić nam wszystkim osiągnięcie tego.



Emma Brunskill jest adiunktem w dziedzinie informatyki na Uniwersytecie Stanforda .

ukryć