Małe modele AI mogą doładować autokorektę i asystentów głosowych w telefonie

Kategoria: Sztuczna inteligencja Opublikowany paź 04 Ilustracja telefonu komórkowego z gadatliwym asystentem głosowym Ilustracja telefonu komórkowego z gadatliwym asystentem głosowym





Naukowcy z powodzeniem zmniejszyli gigantyczny model językowy do wykorzystania w zastosowaniach komercyjnych.

Kto liczy? W ciągu ostatniego roku modele języka naturalnego znacznie się polepszyły kosztem dramatycznego wzrostu . Na przykład w październiku ubiegłego roku Google wypuścił model o nazwie BERT który przeszedł długo utrzymywany benchmark czytania ze zrozumieniem w terenie. Większa wersja modelu miała 340 milionów parametrów danych, a trenowanie jej tylko raz, kosztowało wystarczająco dużo energii elektrycznej, aby zasilić amerykańskie gospodarstwo domowe przez 50 dni.

Cztery miesiące później OpenAI szybko przebił ją swoim modelem GPT-2. Model wykazał się imponującym talentem do konstruowania przekonującej prozy; używał również 1,5 miliarda parametrów. Teraz MegatronLM, najnowszy i największy model Nvidii, ma 8,3 miliarda parametrów . (Tak, sprawy wymykają się spod kontroli.)



Duży, zły, brzydki: Badacze sztucznej inteligencji coraz bardziej martwią się konsekwencjami tego trendu. W czerwcu grupa z University of Massachusetts w Amherst wykazała, jakie żniwo klimatyczne wynika z opracowywania i trenowania modeli na tak dużą skalę. Obliczyli, że szkolenie BERT wyemitowało prawie tyle samo węgla, co lot w obie strony między Nowym Jorkiem a San Francisco; GPT-2 i MegatronLM, przez ekstrapolację, prawdopodobnie emitowałyby znacznie więcej.

Trend ten może również przyspieszyć koncentrację badań nad sztuczną inteligencją w rękach kilku gigantów technologicznych. Niewystarczające zasoby laboratoriów w środowiskach akademickich lub krajach o mniejszych zasobach po prostu nie mają środków na wykorzystanie lub opracowanie takich kosztownych obliczeniowo modeli.

Kochanie, zmniejszyłem AI: W odpowiedzi wielu badaczy koncentruje się na zmniejszanie rozmiaru istniejących modeli bez utraty ich możliwości. Teraz dwa nowe artykuły, opublikowane w ciągu jednego dnia, z powodzeniem zrobiły to z mniejszą wersją BERT, ze 100 milionami parametrów.



ten pierwszy artykuł, od naukowców z Huawei, produkuje model o nazwie TinyBERT, który jest mniej niż jedną siódmą wielkości oryginału i prawie 10 razy szybszy. Działa również prawie tak dobrze w zrozumieniu języka jak oryginał. ten druga, od badaczy z Google, produkuje inny, który jest mniejszy o współczynnik ponad 60, ale jego rozumienie języka jest nieco gorsze niż wersja Huawei.

Jak to zrobili: Oba artykuły wykorzystują odmiany popularnej techniki kompresji znanej jako destylacja wiedzy. Polega na użyciu dużego modelu AI, który chcesz zmniejszyć (nauczyciel), aby wytrenować znacznie mniejszy model (uczeń) na jego obrazie. Aby to zrobić, wprowadzasz te same dane wejściowe do obu, a następnie dostosowujesz ucznia, aż jego wyniki będą pasować do wyników nauczyciela.

Poza laboratorium: Oprócz poprawy dostępu do najnowocześniejszej sztucznej inteligencji, małe modele pomogą wprowadzić najnowsze osiągnięcia sztucznej inteligencji do urządzeń konsumenckich. Unikają konieczności przesyłania danych konsumentów do chmury, co poprawia zarówno szybkość, jak i prywatność. W szczególności w przypadku modeli języka naturalnego wydajniejsze przewidywanie tekstu i generowanie języka może ulepszyć niezliczone aplikacje, takie jak autouzupełnianie w telefonie i asystentów głosowych, takich jak Alexa i Asystent Google.



Aby więcej takich historii trafiało bezpośrednio do Twojej skrzynki odbiorczej, zapisz się do naszego nominowanego przez Webby biuletynu AI The Algorithm. Jest wolne.