Mało znana metoda sztucznej inteligencji może trenować na danych dotyczących Twojego zdrowia bez zagrażania Twojej prywatności

John Moore | Getty





W 2017 Google po cichu opublikował post na blogu o nowym podejściu do uczenia maszynowego. W przeciwieństwie do standardowej metody, która wymaga scentralizowania danych w jednym miejscu, nowa może uczyć się z szeregu źródeł danych rozproszonych na wielu urządzeniach. Wynalazek umożliwił Google wytrenowanie swojego predykcyjnego modelu tekstowego na wszystkich wiadomościach wysyłanych i odbieranych przez użytkowników Androida — bez ich czytania lub usuwania z telefonów.

Pomimo swojej sprytności, sfederowane uczenie się, jak nazwali to naukowcy, nie cieszyło się wówczas dużą popularnością w społeczności AI. Teraz może się to zmienić, ponieważ znajdzie zastosowanie w zupełnie nowym obszarze: podejście oparte na prywatności może równie dobrze być odpowiedzią na największą przeszkodę stojącą przed przyjęciem sztucznej inteligencji w dzisiejszej opiece zdrowotnej.

Istnieje fałszywa dychotomia między prywatnością danych pacjentów a użytecznością danych dla społeczeństwa, mówi Ramesh Raskar, profesor informatyki na MIT, którego badania koncentrują się na sztucznej inteligencji w zdrowiu. Ludzie nie zdają sobie sprawy, że piasek przesuwa się pod ich stopami i że możemy teraz w rzeczywistości osiągnąć jednocześnie prywatność i użyteczność.



W ciągu ostatniej dekady dramatyczny rozwój głębokiego uczenia się doprowadził do oszałamiających przemian w dziesiątkach branż. To napędzało nasze dążenie do autonomicznych samochodów , fundamentalnie zmieniło sposób interakcji z naszymi urządzeniami i na nowo wymyśliło nasze podejście do cyberbezpieczeństwa . Jednak w opiece zdrowotnej, pomimo wielu badań, które dają nadzieję na wykrywanie i diagnozowanie chorób, postęp w wykorzystywaniu uczenia głębokiego do pomocy prawdziwym pacjentom jest kusząco powolny.

Obecne, najnowocześniejsze algorytmy do nauki wymagają ogromnych ilości danych — w większości przypadków im więcej danych, tym lepiej. Szpitale i instytucje badawcze muszą połączyć swoje rezerwy danych, jeśli chcą puli danych, która jest wystarczająco duża i różnorodna, aby była użyteczna. Ale zwłaszcza w Stanach Zjednoczonych i Wielkiej Brytanii pomysł centralizacji ryz poufnych informacji medycznych w rękach firm technologicznych wielokrotnie — i co nie dziwi — okazał się niezwykle niepopularny.

W rezultacie badania nad diagnostycznymi zastosowaniami sztucznej inteligencji pozostały wąskim zakresie i stosowalności. Nie można wdrożyć modelu wykrywania raka piersi na całym świecie, jeśli został on przeszkolony tylko na kilku tysiącach pacjentów z tego samego szpitala.



Wszystko to może się zmienić dzięki sfederowanemu uczeniu się. Technika ta może wytrenować model przy użyciu danych przechowywanych w wielu różnych szpitalach bez opuszczenia przez te dane pomieszczeń szpitala lub dotknięcia serwerów firmy technologicznej. W tym celu najpierw trenuje oddzielne modele w każdym szpitalu z dostępnymi danymi lokalnymi, a następnie wysyła te modele na serwer centralny w celu połączenia ich w model główny. Ponieważ każdy szpital z czasem gromadzi więcej danych, może pobrać najnowszy model główny, zaktualizować go o nowe dane i wysłać z powrotem do centralnego serwera. Podczas całego procesu surowe dane nigdy nie są wymieniane — tylko modele, których nie można poddać inżynierii wstecznej w celu ujawnienia tych danych.

Sfederowane uczenie się wiąże się z pewnymi wyzwaniami. Po pierwsze, łączenie oddzielnych modeli grozi stworzeniem modelu głównego, który jest w rzeczywistości gorszy niż każda z jego części. Naukowcy pracują obecnie nad udoskonaleniem istniejących technik, aby upewnić się, że tak się nie stanie, mówi Raskar. Po drugie, uczenie sfederowane wymaga, aby każdy szpital dysponował odpowiednią infrastrukturą i personelem do trenowania modeli uczenia maszynowego. Występują również tarcia w standaryzacji gromadzenia danych we wszystkich szpitalach. Ale te wyzwania nie są nie do pokonania, mówi Raskar: Trzeba wykonać więcej pracy, ale jest to głównie praca z bandażami.

W rzeczywistości inna prywatność przede wszystkim rozproszone techniki uczenia się pojawiły się w odpowiedzi na te wyzwania. Na przykład Raskar i jego uczniowie wynaleźli niedawno metodę o nazwie split learning. Podobnie jak w nauczaniu sfederowanym, każdy szpital zaczyna od trenowania oddzielnych modeli, ale trenuje je tylko w połowie. Niepełne modele są następnie wysyłane na serwer centralny w celu połączenia i ukończenia szkolenia. Główną korzyścią jest zmniejszenie obciążenia obliczeniowego szpitali. Technika ta jest nadal głównie weryfikacją koncepcji, ale we wczesnych testach zespół badawczy Raskara wykazał, że stworzył model główny niemal tak dokładny, jak gdyby był szkolony na scentralizowanej puli danych.



Kilka firm, w tym IBM Research, pracuje obecnie nad wykorzystaniem sfederowanego uczenia się do rozwijania rzeczywistych aplikacji sztucznej inteligencji dla opieki zdrowotnej. Owkin, paryski startup wspierane przez Google Ventures , wykorzystuje go również do przewidywania oporności pacjentów na różne terapie i leki, a także ich przeżywalności w przypadku niektórych chorób. Firma współpracuje z kilkoma ośrodkami badań nad rakiem w USA i Europie, aby wykorzystać ich dane do swoich modeli. Współpraca zaowocowała już mającym się ukazać artykułem badawczym, mówią założyciele, na temat nowego modelu, który przewiduje szanse przeżycia rzadkiej postaci raka na podstawie obrazów patologicznych pacjenta. Artykuł zrobi duży krok w kierunku walidacji korzyści płynących z tej techniki w warunkach rzeczywistych.

Jestem naprawdę podekscytowany, mówi współzałożyciel Owkin, Thomas Clozel, lekarz badań klinicznych. Największą barierą współczesnej onkologii jest wiedza. To naprawdę niesamowite, że teraz mamy moc wydobywania tej wiedzy i dokonywania przełomowych odkryć medycznych.

Raskar uważa, że ​​zastosowania rozproszonego uczenia się mogą wykraczać daleko poza opiekę zdrowotną i obejmować każdą branżę, w której ludzie nie chcą udostępniać swoich danych. W rozproszonych, pozbawionych zaufania środowiskach będzie to bardzo, bardzo skuteczne w przyszłości, mówi.



Ta historia pierwotnie pojawiła się w naszym biuletynie AI The Algorithm. Aby otrzymać go bezpośrednio do skrzynki odbiorczej, zarejestruj się tutaj za darmo.

ukryć