211service.com
Algorytm wykrywania twarzy ma zrewolucjonizować wyszukiwanie obrazów
W 2001 roku dwóch informatyków, Paul Viola i Michael Jones, zapoczątkowało rewolucję w dziedzinie komputerowego wykrywania twarzy. Po latach stagnacji przełomem był algorytm, który potrafił rozpoznawać twarze na obrazie w czasie rzeczywistym. Rzeczywiście, tak zwany algorytm Viola-Jonesa był tak szybki i prosty, że wkrótce został wbudowany w standardowe kamery typu point-and-shoot.
Częścią ich sztuczki było zignorowanie znacznie trudniejszego problemu rozpoznawania twarzy i skupienie się tylko na wykrywaniu. Skupiali się również tylko na twarzach widzianych z przodu, ignorując wszystkie widziane pod kątem. Biorąc pod uwagę te granice, zdali sobie sprawę, że grzbiet nosa zwykle tworzy pionową linię, która jest jaśniejsza niż pobliskie oczodoły. Zauważyli również, że oczy często były w cieniu, przez co tworzyły ciemniejszy poziomy pas.
Więc Viola i Jones zbudowali algorytm, który najpierw szuka pionowych jasnych pasów na obrazie, które mogą być nosami, następnie szuka poziomych ciemnych pasów, które mogą być oczami, a następnie szuka innych ogólnych wzorów związanych z twarzami.
Wykryte przez siebie, żadna z tych cech nie sugeruje silnie twarzy. Ale kiedy zostaną wykryte jedna po drugiej w kaskadzie, rezultat jest dobrym wskazaniem twarzy na obrazie. Stąd nazwa tego procesu: kaskada detektorów. A ponieważ wszystkie te testy są proste w obsłudze, powstały algorytm może działać szybko w czasie rzeczywistym.
Ale chociaż algorytm Violi-Jonesa był czymś w rodzaju objawienia dla twarzy widzianych z przodu, nie może dokładnie dostrzec twarzy pod żadnym innym kątem. A to poważnie ogranicza możliwości wykorzystania go w wyszukiwarkach twarzy.
Dlatego Yahoo interesuje się tym problemem. Dzisiaj Sachin Farfade i Mohammad Saberian z Yahoo Labs w Kalifornii oraz Li-Jia Li z pobliskiego Uniwersytetu Stanforda ujawniają nowe podejście do problemu, które pozwala dostrzec twarze pod kątem, nawet jeśli są częściowo przesłonięte. Mówią, że ich nowe podejście jest prostsze niż inne, a jednocześnie zapewnia najwyższą wydajność.
Farfade i spółka stosują zupełnie inne podejście do budowania swojego modelu. Wykorzystują postępy poczynione w ostatnich latach w rodzaju uczenia maszynowego znanego jako głęboka, konwolucyjna sieć neuronowa. Pomysł polega na trenowaniu wielowarstwowej sieci neuronowej przy użyciu ogromnej bazy danych przykładów z adnotacjami, w tym przypadku zdjęć twarzy pod różnymi kątami.
W tym celu Farfade i spółka stworzyli bazę danych 200 000 zdjęć, która obejmowała twarze pod różnymi kątami i orientacjami oraz kolejne 20 milionów zdjęć bez twarzy. Następnie wytrenowali swoją sieć neuronową w partiach 128 obrazów w ciągu 50 000 iteracji.
Rezultatem jest pojedynczy algorytm, który może wykrywać twarze pod różnymi kątami, nawet gdy są częściowo zasłonięte. I może dostrzec wiele twarzy na tym samym obrazie z niezwykłą dokładnością.
Zespół nazywa to podejście Deep Dense Face Detector i twierdzi, że dobrze wypada w porównaniu z innymi algorytmami. Oceniliśmy proponowaną metodę z innymi metodami opartymi na głębokim uczeniu i wykazaliśmy, że nasza metoda daje szybsze i dokładniejsze wyniki, mówią.
Co więcej, ich algorytm jest znacznie lepszy w wykrywaniu twarzy odwróconych do góry nogami, czego inne podejścia nie udoskonaliły. Mówią, że można to ulepszyć dzięki zestawom danych, które zawierają więcej twarzy do góry nogami. Planujemy użyć lepszych strategii próbkowania i bardziej wyrafinowanych technik wzbogacania danych, aby jeszcze bardziej poprawić wydajność proponowanej metody wykrywania zokludowanych i obróconych twarzy.
To ciekawa praca, która pokazuje, jak szybko postępuje wykrywanie twarzy. Technika głębokich, konwolucyjnych sieci neuronowych ma zaledwie kilka lat i już doprowadziła do znacznych postępów w rozpoznawaniu obiektów i twarzy.
Wielką obietnicą tego rodzaju algorytmu jest wyszukiwanie obrazów. W tej chwili łatwo jest polować na zdjęcia zrobione w określonym miejscu lub o określonej godzinie. Ale trudno znaleźć zdjęcia zrobione konkretnym osobom. To krok w tym kierunku. Jest nieuniknione, że ta zdolność będzie z nami w niezbyt odległej przyszłości.
A kiedy nadejdzie, świat stanie się znacznie mniejszy. Nie tylko przyszłe zdjęcia będą dostępne do przeszukiwania, ale cała historia obrazów cyfrowych, w tym ogromne zasoby materiałów wideo i CCTV. To będzie potężna siła, w taki czy inny sposób.
Nr ref.: arxiv.org/abs/1502.02766 : Wielowidokowe wykrywanie twarzy przy użyciu głębokich splotowych sieci neuronowych