211service.com
Koniec czasu na zabawę
Na początku zeszłego roku komputer osiągnął światowej klasy wydajność w grze Go — wiele lat wcześniej, zanim większość ludzi uwierzyła, że taki wyczyn będzie możliwy.
To imponujące, ale nasze ambicje powinny być wyższe. Informatyka może pomóc w zapewnieniu tego, czego świat krytycznie potrzebuje: narzędzi, które pozwolą nam wszystkim wyjść poza to, do czego myśleliśmy, że jesteśmy zdolni. Uczenie się przez wzmacnianie — integralna część sukcesu Go — może przyspieszyć ten proces (patrz 10 Przełomowe technologie: uczenie się przez wzmacnianie ).
Uczenie się przez wzmacnianie to sposób, w jaki komputer uczy się poprzez doświadczenie, aby podejmować szereg decyzji, które przynoszą pozytywne wyniki — nawet bez wcześniejszej wiedzy o tym, jak jego działania wpłyną na jego najbliższe otoczenie. Na przykład nauczyciel korzystający z oprogramowania zmieniałby swoje działania w odpowiedzi na to, jak uczniowie wykonują testy po użyciu go.

Emma Brunskill
Jeśli mamy nadzieję stworzyć sztucznych agentów nauczania przy użyciu uczenia ze wzmocnieniem, będziemy potrzebować algorytmów, które są inteligentne w zakresie danych. Możemy zbierać dane z internetowych systemów edukacyjnych i wykorzystywać je, aby pomóc agentowi oszacować skuteczność różnych podejść do nauczania. Kiedy uczeń się loguje, czy system powinien przedstawiać mu problem do rozwiązania? A może lepiej byłoby zacząć od filmu objaśniającego? Dane mogą pomóc w podjęciu decyzji.
Ale w niektórych przypadkach nie ma wystarczającej ilości danych lub nie ma odpowiedniego rodzaju danych, co utrudnia tworzenie systemów, które podejmują dobre decyzje. Byłoby fajnie, gdybyśmy mogli stworzyć system, który w pierwszej kolejności nie potrzebuje tak dużej ilości danych. I właśnie nad tym pracuje moja grupa — opracowujemy algorytmy uczenia się przez wzmacnianie i techniki statystyczne, aby umożliwić komputerom opracowywanie dobrych sugestii przy użyciu mniejszej ilości danych. Przed nami jeszcze dużo pracy, ale zmniejszamy przepaść między teorią a praktyką.
W końcu nie powinniśmy zostawiać tego wszystkiego komputerom. Tak zwane uczenie się ze wzmocnieniem typu „człowiek w pętli” może przyspieszyć ten proces, umożliwiając algorytmom wnioskowanie o własnej ograniczonej wydajności i zwracanie się do ludzi o pomoc, gdy potrzebują, na przykład, rozszerzenia zestawu możliwych decyzji. Moja grupa i nasi współpracownicy z Uniwersytetu Waszyngtońskiego testują teraz algorytmy systemu korepetycji, który może stwierdzić, czy obecny program nauczania nie umożliwia wszystkim uczniom dobrej nauki, a następnie prosi ludzi o dodanie nowych wskazówek do systemu. Taka współpraca człowiek-komputer może pomóc uczniom w nauce przy użyciu podejść, których jeszcze nie potrafimy sobie wyobrazić. Ta wizja uczenia się przez wzmacnianie ma sztucznie inteligentnych agentów na nowo zdefiniować, jak wygląda wybitna ludzka wydajność – i umożliwić nam wszystkim osiągnięcie tego.
Emma Brunskill jest adiunktem w dziedzinie informatyki na Uniwersytecie Stanforda .