211service.com
Wizja komputerowa w AI: dane potrzebne do odniesienia sukcesu
Dostarczone przez Alegium
Rozwijanie zdolności do opisywania ogromnych ilości danych przy zachowaniu jakości jest funkcją cyklu życia rozwoju modelu, którego przedsiębiorstwa często nie doceniają. Wymaga dużej ilości zasobów i specjalistycznej wiedzy.
U podstaw każdej udanej inicjatywy uczenia maszynowego/sztucznej inteligencji (ML/AI) leży zaangażowanie w wysokiej jakości dane szkoleniowe oraz ścieżka do sprawdzonych i dobrze zdefiniowanych danych wysokiej jakości. Bez tego wysokiej jakości potoku danych inicjatywa jest skazana na niepowodzenie.
Zespoły zajmujące się wizją komputerową lub analityką danych często zwracają się do partnerów zewnętrznych w celu opracowania potoku szkolenia danych, a te partnerstwa napędzają wydajność modelu.
Nie ma jednej definicji jakości: jakość danych jest całkowicie uzależniona od konkretnej wizji komputerowej lub projektu uczenia maszynowego. Istnieje jednak ogólny proces, który wszystkie zespoły mogą zastosować podczas pracy z partnerem zewnętrznym, a tę ścieżkę do danych jakościowych można podzielić na cztery fazy o określonym priorytecie.
Kryteria adnotacji i wymagania jakościowe
Jakość danych szkoleniowych to ocena przydatności zbioru danych do spełniania swojego celu w danym przypadku użycia prania pieniędzy lub sztucznej inteligencji.
Zespół ds. wizji komputerowej musi ustalić jednoznaczny zestaw zasad, które opisują, co oznacza jakość w kontekście ich projektu. Kryteria adnotacji to zbiór reguł, które definiują, które obiekty należy opisać, jak je poprawnie opisywać i jakie są cele jakościowe.
Cele dotyczące dokładności lub jakości określają najniższy akceptowalny wynik dla metryk oceny, takich jak dokładność, przypomnienie, precyzja, wynik F1 itp. Zazwyczaj zespół zajmujący się wizją komputerową ma cele jakościowe określające, jak dokładnie obiekty zainteresowania zostały sklasyfikowane, jak dokładnie obiekty zostały zlokalizowane oraz jak dokładnie zidentyfikowano relacje między obiektami.
Szkolenie pracowników i konfiguracja platformy n
Konfiguracja platformy. Projektowanie zadań i konfiguracja przepływu pracy wymagają czasu i wiedzy, a dokładne adnotacje wymagają narzędzi specyficznych dla zadania. Na tym etapie zespoły zajmujące się analizą danych potrzebują partnera z doświadczeniem, który pomoże im określić, jak najlepiej skonfigurować narzędzia do etykietowania, taksonomie klasyfikacji i interfejsy adnotacji w celu zapewnienia dokładności i przepustowości.
Testowanie i punktacja pracowników. Aby dokładnie opisać dane, adnotatorzy potrzebują dobrze zaprojektowanego programu szkoleniowego, aby w pełni zrozumieć kryteria adnotacji i kontekst domeny. Platforma adnotacji lub partner zewnętrzny powinien zapewnić dokładność, aktywnie śledząc biegłość adnotatora w odniesieniu do zadań związanych z danymi złota lub gdy ocena jest modyfikowana przez pracownika lub administratora o wyższych kwalifikacjach.
Ugruntowane dane na temat prawdy lub złota. Na tym etapie procesu kluczowe są dane oparte na faktach, jako podstawa do oceny pracowników i pomiaru jakości wyników. Wiele zespołów zajmujących się wizją komputerową już pracuje z zestawem danych na temat prawdy gruntowej.
Źródła autorytetu i zapewnienia jakości
Nie ma jednego uniwersalnego podejścia do zapewniania jakości (QA), które spełni standardy jakości wszystkich przypadków użycia ML. Konkretne cele biznesowe, a także ryzyko związane z niesprawnym modelem, będą wpływać na wymagania jakościowe. Niektóre projekty osiągają docelową jakość przy użyciu wielu adnotatorów. Inne wymagają złożonych przeglądów w oparciu o dane oparte na faktach podstawowych lub przepływów pracy eskalacji z weryfikacją przez eksperta w danej dziedzinie.
Istnieją dwa główne źródła autorytetu, które można wykorzystać do pomiaru jakości adnotacji i które są wykorzystywane do oceny pracowników: złote dane i ekspertyza.
- Dane dotyczące złota: Dane dotyczące złota lub zestaw rekordów prawdy gruntu mogą być wykorzystywane zarówno jako narzędzie kwalifikacyjne do testowania i oceniania pracowników na początku procesu, jak i jako miara jakości wyjściowej. Kiedy używasz złotych danych do mierzenia jakości, porównujesz adnotacje pracowników z adnotacjami ekspertów dla tego samego zestawu danych, a różnicę między tymi dwoma niezależnymi, ślepymi odpowiedziami można wykorzystać do uzyskania pomiarów ilościowych, takich jak dokładność, przypomnienie, precyzja i wyniki F1 .
- Ekspertyza: ta metoda zapewniania jakości opiera się na eksperckiej ocenie wysoko wykwalifikowanego pracownika, administratora lub eksperta po stronie klienta, czasami wszystkich trzech. Może być używany w połączeniu z kontrolą jakości danych złota. Ekspert sprawdza odpowiedź udzieloną przez wykwalifikowanego pracownika i albo ją zatwierdza, albo w razie potrzeby wprowadza poprawki, tworząc nową poprawną odpowiedź. Początkowo przegląd ekspercki może mieć miejsce dla każdego pojedynczego wystąpienia oznakowanych danych, ale z biegiem czasu, wraz z poprawą jakości pracownika, przegląd ekspercki może wykorzystywać losowe pobieranie próbek do bieżącej kontroli jakości.
Iteracja po sukcesie danych
Gdy zespół ds. wizji komputerowych pomyślnie uruchomi wysokiej jakości potok danych szkoleniowych, może przyspieszyć przejście do modelu gotowego do produkcji. Dzięki stałemu wsparciu, optymalizacji i kontroli jakości, zewnętrzny partner może im pomóc:
- Szybkość śledzenia: Aby skutecznie skalować, dobrze jest zmierzyć przepustowość adnotacji. Ile czasu zajmuje przejście danych przez ten proces? Czy proces przebiega szybciej?
- Dostosuj szkolenie pracowników: Wraz ze skalą projektu wymagania dotyczące etykietowania i jakości mogą ewoluować. Wymaga to ciągłego szkolenia pracowników i zdobywania punktów.
- Trenuj na przypadkach brzegowych: z biegiem czasu dane treningowe powinny zawierać coraz więcej przypadków brzegowych, aby Twój model był jak najbardziej dokładny i niezawodny.
Bez wysokiej jakości danych szkoleniowych, nawet najlepiej finansowane, najbardziej ambitne projekty ML/AI nie mogą się powieść. Zespoły zajmujące się widzeniem komputerowym potrzebują partnerów i platform, którym mogą zaufać, aby zapewnić wymaganą jakość danych i zasilić zmieniające życie modele ML/AI na całym świecie.
Alegion to sprawdzony partner w tworzeniu potoku danych treningowych, który będzie napędzał Twój model przez cały cykl jego życia. Skontaktuj się z Alegionem pod adresem rozwią[email protected] .
Ta treść została wyprodukowana przez Alegion. Nie została napisana przez redakcję MIT Technology Review.
