211service.com
System przechowywania „Big Data” radykalnie przyspiesza dostęp do informacji
W miarę jak komputery wkraczają w coraz więcej obszarów naszego codziennego życia, ilość wytwarzanych przez nie danych ogromnie wzrosła.
Jednak aby te duże zbiory danych były użyteczne, należy je najpierw przeanalizować, co oznacza, że muszą być przechowywane w taki sposób, aby w razie potrzeby można było uzyskać do nich szybki dostęp.
Wcześniej wszelkie dane, do których trzeba było szybko uzyskać dostęp, były przechowywane w pamięci głównej komputera lub w dynamicznej pamięci o dostępie swobodnym (DRAM) — ale rozmiar tworzonych obecnie zestawów danych uniemożliwia to.
Dlatego informacje są zwykle przechowywane na wielu dyskach twardych na wielu komputerach w sieci Ethernet. Jednak ta architektura pamięci masowej znacznie wydłuża czas potrzebny na uzyskanie dostępu do informacji, według Sang-Woo Jun, absolwenta Laboratorium Informatyki i Sztucznej Inteligencji ( CSAIL ) w MIT.

Zdjęcie dzięki uprzejmości naukowców
Przechowywanie danych w sieci jest powolne, ponieważ istnieje znaczne dodatkowe opóźnienie w zarządzaniu dostępem do danych na wielu maszynach, zarówno w oprogramowaniu, jak i sprzęcie, mówi Jun. A jeśli dane nie mieszczą się w pamięci DRAM, musisz przejść do dodatkowej pamięci masowej — dysków twardych, prawdopodobnie podłączonych przez sieć — która jest rzeczywiście bardzo wolna.
Teraz Jun, absolwent CSAIL, Ming Liu, oraz Arvind, profesor elektrotechniki i informatyki im. Charlesa W. i Jennifer C. Johnson, opracowali system pamięci masowej do analizy dużych zbiorów danych, który może znacznie skrócić czas potrzebny do dostęp do informacji.
System, który zostanie zaprezentowany w lutym na Międzynarodowym Sympozjum nt. Field-Programmable Gate Arrays w Monterey w Kalifornii, oparty jest na sieci urządzeń pamięci flash.
Systemy pamięci masowej flash lepiej radzą sobie z zadaniami, które obejmują znajdowanie losowych fragmentów informacji w dużym zbiorze danych, niż inne technologie. Zazwyczaj można do nich uzyskać dostęp losowy w ciągu mikrosekund. Porównuje się to z czasem wyszukiwania danych na dyskach twardych, który zwykle wynosi od 4 do 12 milisekund podczas uzyskiwania dostępu do danych z nieprzewidywalnych lokalizacji na żądanie.
Systemy Flash są również nieulotne, co oznacza, że nie tracą żadnych informacji, które przechowują, jeśli komputer jest wyłączony.
W systemie pamięci masowej, znanym jako BlueDBM — lub Blue Database Machine — każde urządzenie flash jest połączone z układem programowalnej macierzy bramek (FPGA) w celu utworzenia indywidualnego węzła. Układy FPGA służą nie tylko do sterowania urządzeniem flash, ale są również zdolne do wykonywania operacji przetwarzania samych danych, mówi Jun.
Oznacza to, że możemy wykonać pewne przetwarzanie w pobliżu miejsca, w którym dane są [przechowywane], więc nie zawsze musimy przenosić wszystkie dane do maszyny, aby nad nimi pracować, mówi.
Co więcej, chipy FPGA można łączyć ze sobą za pomocą wydajnej sieci szeregowej, która ma bardzo małe opóźnienie lub opóźnienie czasowe, co oznacza, że dostęp do informacji z dowolnego węzła można uzyskać w ciągu kilku nanosekund. Więc jeśli połączymy wszystkie nasze maszyny za pomocą tej sieci, oznacza to, że każdy węzeł może uzyskać dostęp do danych z dowolnego innego węzła z bardzo niewielkim spadkiem wydajności, [i] będzie się wydawać, że zdalne dane znajdowały się tutaj lokalnie, mówi Jun.
Dodaje, że korzystanie z wielu węzłów pozwala zespołowi uzyskać taką samą przepustowość i wydajność sieci pamięci masowej, jak znacznie droższe maszyny.
Zespół zbudował już czterowęzłową sieć prototypową. Zostało to jednak zbudowane z 5-letnich części, przez co jest dość powolne.
Dlatego teraz budują znacznie szybszą prototypową sieć z 16 węzłami, w której każdy węzeł będzie działał z prędkością 3 gigabajtów na sekundę. Sieć będzie miała pojemność od 16 do 32 terabajtów.
Korzystając z nowego sprzętu, Liu buduje również system baz danych przeznaczony do wykorzystania w analizie dużych zbiorów danych. Liu mówi, że system będzie wykorzystywał układy FPGA do wykonywania obliczeń na danych, do których uzyskuje dostęp komputer-host, aby przyspieszyć proces analizy informacji.
Jeśli jesteśmy wystarczająco szybcy, jeśli dodamy odpowiednią liczbę węzłów, aby zapewnić nam wystarczającą przepustowość, możemy analizować duże ilości danych naukowych z prędkością około 30 klatek na sekundę, co pozwala nam odpowiadać na zapytania użytkowników z bardzo małymi opóźnieniami, dzięki czemu system wydają się być w czasie rzeczywistym, mówi. To dałoby nam interaktywną bazę danych.
Jako przykład rodzaju informacji, na których system może być używany, zespół pracował z danymi z symulacji wszechświata wygenerowanej przez naukowców z Uniwersytetu Waszyngtońskiego. Symulacja zawiera dane dotyczące wszystkich cząstek we wszechświecie w różnych momentach czasu.
Naukowcy muszą zapytać ten dość ogromny zestaw danych, aby śledzić, które cząstki wchodzą w interakcje z innymi cząstkami, ale przeprowadzanie tego rodzaju zapytań jest czasochłonne, mówi Jun. Mamy nadzieję, że udostępnimy interfejs czasu rzeczywistego, który umożliwi naukowcom łatwiejsze przeglądanie informacji.
Kees Vissers, producent programowalnych chipów Xilinx, z siedzibą w San Jose w Kalifornii, mówi, że pamięć flash zaczyna być postrzegana jako zamiennik zarówno dla DRAM, jak i dysków twardych. Historycznie, architektura komputerowa musiała mieć określoną hierarchię pamięci — pamięć podręczna na procesorach, pamięć DRAM off-chip, a następnie dyski twarde — ale cała ta linia jest teraz zamazana przez nowatorskie mechanizmy technologii flash.
Praca w MIT jest szczególnie interesująca, ponieważ zespół zoptymalizował cały system do pracy z pamięcią flash, w tym opracował nowatorskie interfejsy sprzętowe, mówi Vissers. Oznacza to, że otrzymujesz korzyści na poziomie systemu, mówi.