211service.com
Widzenie maszynowe może tworzyć zdjęcia w stylu Harry'ego Pottera dla mugoli
Chung-Yi Weng | youtube
W J.K. Powieści Rowling o Harrym Potterze, magiczne zdjęcia są podobne do zwykłych, z wyjątkiem tego, że postacie w nich są animowane; machają, uśmiechają się, a czasem całkowicie znikają, aby zająć się innymi sprawami.
Magiczne zdjęcia to dzieło niezwykłej wyobraźni Rowling. Ale coś takiego może wkrótce być dostępne dla zwykłych mugoli dzięki pracy Chung-Yi Wenga z University of Washington w Seattle i kilku kumplom. Ci ludzie stworzyli oprogramowanie o nazwie Photo Wake-Up, które może animować centralną postać na zdjęciu, pozostawiając resztę obrazu nietkniętą.
Łatwiej powiedzieć to zadanie niż wykonać z powodu ważnego nierozwiązanego problemu w informatyce. To jest problem oceny pozy ciała. Biorąc pod uwagę dwuwymiarowy obraz człowieka, pytanie, na które widzenie maszynowe nie może odpowiedzieć, brzmi: jaką trójwymiarową pozę przyjmuje osoba?
To trudne, ponieważ ciała mogą być częściowo zasłonięte, często przez inne części ciała, na przykład, gdy ktoś stoi z założonymi rękami. Utrudnia to maszynie określenie trójwymiarowej struktury na podstawie obrazu 2D.
Wiele zespołów informatycznych próbowało zmierzyć się z tym problemem. W tej pracy Weng i wsp. używają programu o nazwie SMPL, opracowanego przez zespół w firmie Microsoft oraz w Instytucie Systemów Inteligentnych Maxa Plancka w Niemczech.
Rozpoczyna się to wycięciem 2D ludzkiego ciała i nałożeniem szkieletu 3D na kształt. Szkielet można następnie animować, aby stworzyć wrażenie ruchu. To rozwiązuje problem szacowania pozy, aczkolwiek w ograniczonym zestawie okoliczności.
Kod musi widzieć wycięcie od stóp do głów ciała widoczne z przodu. Może poradzić sobie z niektórymi rodzajami okluzji, takimi jak ramię przed ciałem, ale nie może poradzić sobie z bardziej złożonymi okluzjami, takimi jak osoba siedząca ze skrzyżowanymi nogami. Mimo to mapowanie wycinka ze zdjęcia na szkielet 3D nie daje realistycznych animacji.
W tym momencie wkraczają Weng i spółka. Ich głównym osiągnięciem jest opracowanie sposobu na zakrzywienie wycięcia 2D w sposób, który tworzy realistyczny model 3D ciała. Naszym kluczowym wkładem technicznym jest zatem metoda budowy animowanego modelu 3D, który pasuje do sylwetki na jednym zdjęciu, mówią.
W przeszłości informatycy próbowali rozwiązać ten problem, deformując trójwymiarową siatkę w kształcie ciała, aby odzwierciedlić wycięcie 2D. To nie zawsze działa dobrze, więc Weng i spółka próbują innego podejścia.
Ich pomysł polega na odwzorowaniu siatki w kształcie ciała w przestrzeń 2D, a następnie wyrównaniu jej z wycięciem 2D za pomocą algorytmu wypaczania. Identyfikuje określone części ciała — głowę, prawą rękę, prawą nogę, lewą rękę, lewą nogę i tułów — i wypacza każdą z nich w sposób, który pasuje do wycięcia.
Po wykonaniu wyrównania w 2D przekształcają je z powrotem w 3D. Mówią, że to wypaczanie 2D sprawdza się dobrze w przypadku skomplikowanych sylwetek.
Zespół zwraca szczególną uwagę na głowę, na której skupiają się ludzcy widzowie. Mówią, że dokładność w ułożeniu głowy jest ważna dla dobrej animacji. Dlatego ich algorytm identyfikuje również cechy, takie jak kierunek spojrzenia i kąt głowy, a następnie używa tego, aby uzyskać dokładny kąt dla pozycji głowy z siatką ciała.
Te zautomatyzowane techniki są dobre, ale nie są doskonałe. Dlatego zespół opracował również interfejs użytkownika, który pozwala każdemu zmienić orientację szkieletu względem ciała. Pozwala to użytkownikom na poprawienie wszelkich błędów i dopracowanie animacji.
Efektem końcowym jest imponujący rodzaj animowanego zdjęcia. Algorytm izoluje ludzkie ciało na zdjęciu, wycina je z obrazu i wypełnia lukę algorytmem wypełniania plam. Następnie ożywia to ciało w trzech wymiarach, aby wyszło ze zdjęcia, by biegało, skakało lub machać, podobnie jak magiczne zdjęcia wymyślone przez Rowling. Algorytm działa nawet w rzeczywistości rozszerzonej.
Nasza metoda działa z dużą różnorodnością zdjęć całego ciała, dość frontalnych, od zdjęć sportowych, po sztukę i plakaty, jak mówią. Zespół wyprodukował film pokazujący ich metodę i wyniki tutaj . Warto oglądać!
To interesująca praca, która może dostarczać rozrywki i informować. Jak ujął to Weng i spółka: Wierzymy, że ta metoda nie tylko umożliwia ludziom czerpanie radości i interakcji ze zdjęciami, ale także sugeruje ścieżkę do zrekonstruowania wirtualnego awatara z pojedynczego obrazu, zapewniając jednocześnie wgląd w stan sztuki człowieka. modelowanie z jednego zdjęcia.
Nawet Rowling z pewnością byłaby pod wrażeniem.
Nr ref.: arxiv.org/abs/1812.02246 : Photo Wake-Up: animacja postaci 3D z jednego zdjęcia