211service.com
Przygotuj się na potop danych
Od Facebooka po Departament Pojazdów Samochodowych, świat jest skatalogowany w bazach danych. Nikt nie wie tego lepiej niż adiunkt i przedsiębiorca MIT Michael Stonebraker , który spędził ostatnie 25 lat na opracowywaniu technologii, dzięki której tak się stało. Dokonał wielkiego przełomu, wymyślając i komercjalizując technologię, która stanowi podstawę większości baz danych, znanych jako relacyjne bazy danych, które dziś rządzą. Ale Stonebraker teraz szczęśliwie nazywa swoje wcześniejsze wynalazki w dużej mierze przestarzałymi. Pracuje nad nową generacją technologii baz danych, która poradzi sobie z zalewem danych cyfrowych, który zaczyna przytłaczać ustalone metody.
Relacyjne bazy danych są wszechobecne jako rozwiązanie dla danych korporacyjnych. Odniosły bajeczny sukces, mówi Stonebraker. Twierdzi jednak, że najwięksi dostawcy baz danych, w tym Oracle, IBM i Microsoft, nadal sprzedają takie produkty jako odpowiednie dla każdej firmy. Stonebraker ma inny pogląd: nowe technologie baz danych są potrzebne do obsługi wykładniczego wzrostu ilości informacji, z którymi muszą sobie radzić firmy. 67-letni Stonebraker już odnosi sukcesy dzięki kilku swoim nowym podejściom.
Jednym z nich jest system baz danych o nazwie C-Store . W przeciwieństwie do większości obecnie używanych systemów przechowuje dane na dysku kolumna po kolumnie, a nie wiersz po wierszu. Ta prosta modyfikacja wymagała całkowitego przepisania sposobu działania baz danych, ale zgrabnie współgra zarówno ze sposobem działania pamięci komputera, jak i sposobem uzyskiwania dostępu do baz danych. Daje to znacznie większą wydajność i bardziej skompresowane dane.
Ta poprawka i inne wprowadzone przez Stonebrakera i współpracowników z MIT, Brown, Brandeis, Yale i University of Massachusetts umożliwiły uruchomienie Vertica , firma, która skomercjalizowała C-Store i pomogła klientom przeszukiwać duże bazy danych niemal w czasie rzeczywistym. Vertica została przejęta przez Hewlett-Packard w lutym i może pochwalić się klientami, w tym Comcast, który używa go do monitorowania milionów urządzeń tworzących jego sieci telewizyjne i internetowe, oraz Groupon, który używa go do analizowania działań milionów abonentów.
Powiązany system firmy Stonebraker i kilku tych samych kolegów akademickich, H-Sklep , opiera się na tych samych pomysłach z dodatkowymi ulepszeniami, takimi jak działanie w całości w pamięci komputera, a nie na dysku; metoda ta jest szczególnie przydatna w przetwarzaniu transakcji online. Kod H-Store jest open source, ale technologia jest komercjalizowana przez fundusze venture-backed VoltDB , z firmą Stonebraker jako CTO. Twierdzi, że tego rodzaju system baz danych dostosowany do konkretnego zastosowania, zbudowany z myślą o szybkości jest tym, co większość przedsiębiorstw będzie musiała przyjąć prędzej niż później, aby poradzić sobie z zalewem danych cyfrowych.
Niektóre organizacje już zostały złapane w tę powódź. Rozważ Facebooka. Już teraz udostępnia więcej cyfrowych zdjęć niż jakakolwiek inna firma, Facebook buduje nową infrastrukturę przechowywania i przetwarzania tak szybko, jak to możliwe. Stonebraker mówi jednak, że firma wykorzystuje technologię baz danych do granic możliwości, dzieląc swój słynny wykres społecznościowy na 4000 baz danych, które muszą ze sobą współpracować. Po prostu umierają pod obciążeniem warstwy zarządzania potrzebnej do utrzymania tego systemu, mówi. Mają najtrudniejszy problem z bazą danych na świecie i nie ma aktualnego systemu, który zaspokoiłby ich potrzeby.
Rozwiązania, które Stonebraker buduje dla zupełnie innego sektora, który już tonie w danych, mogą w końcu pomóc. Kilka lat temu słyszał o problemach, z jakimi borykają się Duży Teleskop do Badań Synoptycznych w budowie w Chile. Zbierze 100 petabajtów surowych danych i danych pochodnych, mówi Stonebraker, i nie mieli pojęcia, co z tym zrobić.
Stonebraker i współpracownik David DeWitt, związany z University of Wisconsin-Madison, zbudowali unikalny system bazy danych o nazwie SciDB . Projekt open-source ma teraz wsparcie przedsięwzięć i dużą społeczność wolontariuszy z dziedziny nauki. Stonebraker uważa jednak, że funkcje SciDB w końcu znajdą uznanie poza środowiskiem akademickim.
Wszystkie dane naukowe są niepewne i mają słupki błędów, w przeciwieństwie do danych w bazie danych wynagrodzeń, więc SciDB może zwracać uwagę na niepewność. Nie można go również nadpisać, ponieważ naukowcy nigdy nie chcą niczego wyrzucać, mówi. Funkcje te nie różnią się tak bardzo od potrzeb zaawansowanej, opartej na statystykach analityki lub nauki o danych, która w coraz większym stopniu jest podstawą udanych, opartych na technologii firm. Jednym z przykładów jest umieszczanie reklam online: kierowanie do każdej osoby z osobna wymaga intensywnej obliczeniowej analizy, aby zgrupować podobne osoby.
Stonebraker nie twierdzi jednak, że nowe systemy baz danych, takie jak te, nad którymi pracuje, mogą być panaceum dla firm, które nagle poznają ograniczenia bardziej ugruntowanych technologii. Rosnące znaczenie przechowywania i przetwarzania danych dla wszelkiego rodzaju przedsiębiorstw będzie wymagało od nich uczynienia z obu priorytetów biznesowych. Jeśli prowadzisz firmę, musisz od początku projektować na dużą skalę, mówi, ponieważ nie ma wątpliwości, że będziesz jej później potrzebować.