211service.com
Przełamywanie wąskiego gardła genomu
Dane genomowe wygenerowane z maszyn do sekwencjonowania nowej generacji to niewiele więcej niż zupa alfabetyczna, jeśli nie zostaną poddane znaczącemu przetwarzaniu obliczeniowemu i analizie statystycznej. Aby dane były użyteczne, sztuczka polega na przekształceniu tych As, Ts, Gs i Cs w łatwy do opanowania opis ryzyka choroby i innych predyspozycji genetycznych. To wymaga dużej mocy obliczeniowej i czasu — już teraz stanowi poważne wąskie gardło dla niektórych firm zajmujących się analizą genomiczną (patrz Bazy do bajtów, maj/czerwiec 2012) .
Kilka firm szuka w chmurze sposobu, aby pomóc im analizować wszystkie dane. Pomysł polega na tym, że naukowcy mogą wysyłać swoje dane do usługi analitycznej hostowanej w Internecie, która przetwarza surowe dane w profil genetyczny. Jednak pliki danych generowane przez maszyny do sekwencjonowania są tak ogromne (patrz Bazy do bajtów, marzec/kwiecień 2012) że przyziemna kwestia przesyłania dużych plików do chmury staje się osobnym problemem. Strategia Bina Technologies z siedzibą w Redwood City w Kalifornii polega na dzieleniu i podbijaniu: oferowaniu klientom własnej maszyny do przetwarzania danych, która zamieni górę nieprzetworzonych sekwencji w łatwe do udostępnienia profile genetyczne. Profile te można następnie szybko przesłać do Technologie Bina Witryna hostowana w chmurze do zarządzania danymi, udostępniania i agregacji.
Grupa planuje sprzedać tak zwany Bina Box z fabrycznie załadowanym oprogramowaniem, które może zredukować około 300 gigabajtów surowych danych z ludzkiego genomu do kilkuset megabajtów informacji genetycznej. Box prześle skompresowany zestaw danych do usługi w chmurze Bina w celu przechowywania, udostępniania i dalszej analizy. Bina Box może wykonać początkowe ciężkie operacje i sprawić, że dane będą wystarczająco małe, aby można je było wysłać do chmury, mówi Narges Bani Asadi, założyciel Bina.
Bina Technologies twierdzi, że jej system wykonuje wstępne przetwarzanie danych genomowych z prędkościami, które są o rząd wielkości szybsze niż narzędzia udostępnione przez Szeroki Instytut , wspólne centrum genomu MIT-Harvard. To, co zajmuje około tygodnia przy użyciu potoku analizy zmienności genomu Broad na wysokiej klasy ośmiordzeniowej maszynie w chmurze Amazon, można zrobić w około dwie godziny na Bina Box, mówi Asadi. Firma spodziewa się opublikować pełny opis swojego porównania z innymi rurociągami analitycznymi w nadchodzących miesiącach.
Bina Technologies planuje współpracę z kilkoma grupami zajmującymi się genomiką w ramach fazy testów pilotażowych swojego systemu. Jedna grupa we wczesnej rozmowie z Bina Technologies to Fundacja Medycyna , Cambridge, Massachusetts, firma zajmująca się genomiką nowotworów (patrz Foundation Medicine: Personalizing Cancer Drugs, marzec/kwiecień 2012). Chociaż zespół odpowiedzialny za przygotowywanie próbek i generowanie nieprzetworzonych danych sekwencyjnych był w stanie skalować swoje procesy w celu zaspokojenia popytu, to samo nie dotyczy analizy obliczeniowej, mówi Maureen Cronin, starszy wiceprezes ds. współpracy badawczej z Foundation Medicine, oraz doradca Bina Technologies. Mówi, że wszystkie dane przesyłane z maszyn do sekwencjonowania Foundation Medicine stworzyły spory problem obliczeniowy.
Aby mieć pewność co do mutacji, które identyfikują, mówi Cronin, Foundation Medicine sekwencjonuje genom pacjenta średnio 500X – to znaczy, że każda z trzech miliardów par zasad w ludzkim genomie jest replikowana około 500 razy. Te surowe dane, miliardy krótkich fragmentów genomu, każdy o długości kilkudziesięciu par zasad, muszą być następnie przetworzone w dłuższe sekwencje chromosomowe. Po tym procesie składania następuje porównanie genomu osobnika ze standardem odniesienia — wynikiem projektu genomu ludzkiego. Wszystko to musi się wydarzyć, zanim rozpocznie się jakakolwiek kliniczna interpretacja guza lub innego genomu. To niezwykle intensywny obliczeniowo proces, mówi Cronin.