Superkomputer Baidu ze sztuczną inteligencją pokonuje Google w Image Recognition

Aktualizacja: 1 czerwca 2015 r. Baidu zmienił swoje papier techniczny w swoim systemie, aby przyznać, że złamała zasady dotyczące ImageNet Challenge, które firma wykorzystała do twierdzenia, że ​​pokonała inne zespoły badawcze. Organizatorzy konkursu dokonali przeglądu zachowania Baidu i wydali oświadczenie mówiąc, że jego wyniki nie powinny być uważane za bezpośrednio porównywalne z wynikami uzyskanymi przez innych.





Chińska firma wyszukiwarka Baidu zbudowała ten komputer, aby przyspieszyć badania nad sztuczną inteligencją.

Chiński gigant wyszukiwania Baidu twierdzi, że wynalazł potężny superkomputer, który dodaje sił do techniki sztucznej inteligencji, dając oprogramowaniu więcej możliwości rozumienia mowy, obrazów i języka pisanego.

Nowy komputer o nazwie Minwa i znajdujący się w Pekinie ma 72 wydajne procesory i 144 procesory graficzne, znane jako GPU. Późny poniedziałek, Baidu wydany papier twierdząc, że komputer był używany do trenowania oprogramowania do uczenia maszynowego, które ustanowiło nowy rekord w rozpoznawaniu obrazów, bijąc poprzedni rekord wyznaczony przez Google.



Nasza firma jest teraz liderem wyścigu w dziedzinie inteligencji komputerowej, powiedział Ren Wu, naukowiec Baidu pracujący nad projektem, przemawiając na Embedded Vision Summit we wtorek. Moc obliczeniowa Minwy prawdopodobnie umieściłaby go wśród 300 najpotężniejszych komputerów na świecie, gdyby nie była wyspecjalizowana w głębokim uczeniu, powiedział Wu. Myślę, że to najszybszy superkomputer przeznaczony do głębokiego uczenia się – powiedział. W naszych rękach mamy wielką władzę — znacznie większą niż nasi konkurenci.

Moc obliczeniowa ma znaczenie w świecie głębokiego uczenia, które przyniosło przełom w rozpoznawaniu mowy, obrazu i twarzy oraz ulepszyło usługi wyszukiwania obrazów i rozpoznawania mowy oferowane przez Google i Baidu.

Technika ta jest ulepszoną wersją podejścia ustalonego kilkadziesiąt lat temu, w którym dane są przetwarzane przez sieć sztucznych neuronów, które zarządzają informacjami w sposób luźno inspirowany biologicznymi mózgami. Głębokie uczenie polega na korzystaniu z większych niż wcześniej sieci neuronowych, ułożonych w warstwy hierarchiczne i trenowaniu ich za pomocą znacznie większych zbiorów danych, takich jak zdjęcia, dokumenty tekstowe czy nagrana mowa.



Jak dotąd większe zbiory danych i sieci wydają się zawsze lepsze dla tej technologii, powiedział Wu. W ten sposób różni się od poprzednich technik uczenia maszynowego, które zaczęły przynosić malejące zwroty przy większych zestawach danych. Po przeskalowaniu danych poza pewien punkt nie widać żadnej poprawy, powiedział Wu. Dzięki głębokiemu uczeniu się po prostu rośnie. Baidu mówi, że Minwa umożliwia tworzenie sztucznej sieci neuronowej z setkami miliardów połączeń — setki razy więcej niż jakakolwiek sieć zbudowana wcześniej.

Artykuł wydany w poniedziałek ma na celu zapewnienie przedsmaku tego, co może zrobić dodatkowa moc Minwy. Opisuje, w jaki sposób superkomputer został wykorzystany do trenowania sieci neuronowej, która ustanowiła nowy rekord w standardowym benchmarku oprogramowania do rozpoznawania obrazów. Wyzwanie klasyfikacji ImageNet, jak to się nazywa, obejmuje szkolenie oprogramowania na kolekcji 1,5 miliona oznaczonych obrazów w 1000 różnych kategoriach, a następnie poproszenie tego oprogramowania o użycie tego, czego się nauczył, do oznaczenia 100 000 obrazów, których wcześniej nie widział.

Oprogramowanie jest porównywane na podstawie tego, jak często jego pięć pierwszych prób dla danego obrazu nie daje poprawnej odpowiedzi. System wyszkolony na nowym komputerze Baidu był błędny tylko w 4,58% przypadków. Poprzedni najlepszy był 4,82 proc., zgłoszone przez Google w marcu. Miesiąc wcześniej Microsoft zgłosił się osiągając 4,94 procent, stając się pierwszym z lepszym średnim wynikiem ludzkim wynoszącym 5,1 procent.



Wu powiedział, że Minwa umożliwiła trenowanie systemu na obrazach o wyższej rozdzielczości. Pozwolił również na użycie techniki, która zmieniła oryginalne 1,2 miliona obrazów treningowych w dwa miliardy poprzez ich zniekształcenie, odwrócenie i zmianę kolorów. Użycie tego większego zestawu treningowego poprawiło dokładność, zapobiegając nadmiernemu skupieniu systemu na dokładnych szczegółach obrazów treningowych, powiedział Wu. Wynikowy system powinien lepiej radzić sobie ze zdjęciami ze świata rzeczywistego, powiedział.

Jak mogą sugerować te niewielkie marginesy zwycięstwa w wyzwaniu ImageNet, uczenie głębokie jest teraz gotowe na trudniejsze wyzwania niż rozpoznawanie obrazów, takie jak interpretowanie wideo lub opisywanie obrazów w zdaniach (zobacz oprogramowanie Google inspirowane mózgiem opisuje to, co widzi w złożonych obrazach). Wu powiedział, że oprócz myślenia o tym, jak powiększyć Minwę i używać jej w wideo i tekście, badacze Baidu pracują nad sposobami zmniejszenia swoich wyszkolonych sieci neuronowych, aby mogły działać na urządzeniach mobilnych.

Pokazał film przedstawiający prototypową aplikację na smartfona, która potrafi rozpoznawać różne rasy psów, używając skondensowanej wersji sieci głębokiego uczenia wyszkolonej na poprzedniku Minwy. Powiedział, że jeśli wiesz, jak wykorzystać moc obliczeniową procesorów graficznych telefonu, możesz rozpoznać je w locie bezpośrednio z czujnika obrazu.



ukryć