211service.com
Zagadka Big Data: jak ją zdefiniować?
Jednym z największych nowych pomysłów w informatyce są duże zbiory danych. Istnieje jednogłośna zgoda, że big data rewolucjonizuje handel w XXI wieku. Jeśli chodzi o biznes, big data oferuje bezprecedensowy wgląd, lepsze podejmowanie decyzji i niewykorzystane źródła zysku.
A jednak poproś dyrektora ds. technologii o zdefiniowanie big data, a on lub ona będzie patrzył w podłogę. Są szanse, że otrzymasz tyle definicji, ile osób zapytasz. I to jest problem dla każdego, kto próbuje kupić, sprzedać lub skorzystać z usług Big Data — co dokładnie jest w ofercie?
Dziś, Jonathan Stuart Ward oraz Adam Barker na Uniwersytecie St Andrews w Szkocji weź to pod uwagę. Ci faceci badają różne definicje oferowane przez największe i najbardziej wpływowe organizacje high-tech na świecie. Następnie próbują wydestylować z całego tego hałasu definicję, z którą każdy może się zgodzić.
Ward i Barker zarzucają swoją sieć daleko i szeroko, ale wyniki są mieszane. Trudno o formalne definicje, ponieważ wiele organizacji woli podawać anegdotyczne przykłady.
W szczególności pojęcie dużego jest trudne do sprecyzowania, nie tylko dlatego, że zestaw danych, który wydaje się dziś duży, prawie na pewno będzie wydawał się mały w niezbyt odległej przyszłości. Tam, gdzie jedna organizacja podaje twarde dane na temat tego, co stanowi duże, inna podaje względną definicję, sugerując, że duże zbiory danych zawsze będą czymś więcej, niż mogą obsłużyć konwencjonalne techniki.
Niektóre organizacje wskazują, że duże zestawy danych nie zawsze są złożone, a małe zestawy danych są zawsze proste. Chodzi o to, że złożoność zbioru danych jest ważnym czynnikiem decydującym o tym, czy jest duży.
Oto podsumowanie rodzaju opisów, które Ward i Barker odkryli w różnych wpływowych organizacjach:
jeden. Gartner . W 2001 r. raport Meta (obecnie Gartner) odnotował rosnący rozmiar danych, rosnące tempo ich tworzenia oraz rosnący zakres stosowanych formatów i reprezentacji. Raport ten poprzedzał termin dane wykopaliskowe, ale zaproponował potrójną definicję obejmującą trzy V: Objętość, Prędkość i Różnorodność. Od tego czasu pomysł ten stał się popularny i czasami zawiera czwartą V: prawdziwość, aby objąć kwestie zaufania i niepewności.
dwa. Wyrocznia . Big data jest pozyskiwaniem wartości z tradycyjnego podejmowania decyzji biznesowych w oparciu o relacyjne bazy danych, wzbogaconym o nowe źródła danych nieustrukturyzowanych.
3. Intel . Możliwości Big Data pojawiają się w organizacjach generujących medianę 300 terabajtów danych tygodniowo. Najpopularniejszymi formami analizowanych w ten sposób danych są transakcje biznesowe przechowywane w relacyjnych bazach danych, następnie dokumenty, poczta e-mail, dane z czujników, blogi i media społecznościowe.
Cztery. Microsoft . Big data to termin coraz częściej używany do opisania procesu stosowania poważnej mocy obliczeniowej — najnowszych osiągnięć w uczeniu maszynowym i sztucznej inteligencji — do naprawdę ogromnych i często bardzo złożonych zbiorów informacji.
5. Metoda dla zintegrowanego środowiska wiedzy projekt open source. Projekt MIKE argumentuje, że big data nie jest funkcją rozmiaru zbioru danych, ale jego złożoności. W konsekwencji to wysoki stopień permutacji i interakcji w zbiorze danych definiuje duże zbiory danych.
6. Narodowy Instytut Standardów i Technologii . NIST twierdzi, że duże zbiory danych to dane, które przekraczają pojemność lub możliwości obecnych lub konwencjonalnych metod i systemów. Innymi słowy, pojęcie dużego odnosi się do obecnego standardu obliczeń.
Mieszana torba, jeśli kiedykolwiek istniała.
Oprócz wyszukiwania definicji Ward i Barker próbowali lepiej zrozumieć sposób, w jaki ludzie używają wyrażenia big data, przeszukując Trendy Google, aby zobaczyć, jakie słowa są z nim najczęściej kojarzone. Mówią, że są to: analityka danych, Hadoop, NoSQL, Google, IBM i Oracle.
Ci faceci odważnie kończą ankietę własną definicją, w której próbują połączyć te odmienne idee. Oto ich definicja:
Big data to termin opisujący przechowywanie i analizę dużych lub złożonych zbiorów danych przy użyciu szeregu technik, w tym między innymi: NoSQL, MapReduce i uczenia maszynowego.
Próba gry w celu osiągnięcia wartościowego celu — definicji, z którą każdy może się zgodzić, jest z pewnością spóźniona.
Ale czy to załatwi sprawę? Odpowiedzi proszę w sekcji komentarzy poniżej.
Nr ref.: arxiv.org/abs/1309.5821 : Undefined By Data: Ankieta definicji Big Data