211service.com
Umieszczanie sieci w arkuszu kalkulacyjnym
Ogromne ilości danych są swobodnie dostępne w sieci i mogą być potencjalną skarbnicą dla wielu firm – pod warunkiem, że potrafią dowiedzieć się, jak skutecznie z nich korzystać.

Sortowanie i filtrowanie: BigSheets pozwala użytkownikom analizować nieustrukturyzowane dane z sieci przy użyciu narzędzi podobnych do tych, które można znaleźć w oprogramowaniu do arkuszy kalkulacyjnych na komputery stacjonarne.
Firma może na przykład przeszukiwać dane z Urzędu Patentów i Znaków Towarowych Stanów Zjednoczonych oraz rejestry sądowe przed przejęciem innej firmy, aby sprawdzić, czy jakakolwiek jej własność intelektualna jest związana z postępowaniem prawnym. W praktyce jednak przetworzenie tak dużej ilości informacji wymaga czasu i wysiłku, aby je zorkiestrować.
IBM ma nadzieję, że nowe narzędzie o nazwie Duże Arkusze , ułatwi użytkownikom analizowanie danych internetowych. Firma opracowała testową wersję oprogramowania dla Biblioteki Brytyjskiej.
Jak mówi Rod Smith, wiceprezes IBM ds. nowych technologii internetowych, zdolność każdego użytkownika do samodzielnego wykonywania interesujących analiz jest coraz większa.
BigSheets opiera się na innym oprogramowaniu o nazwie Hadoop. Jest to platforma typu open source do przetwarzania bardzo dużych ilości danych internetowych poprzez dzielenie zadań i przekazywanie ich do klastra różnych komputerów. Hadoop jest często używany do analizowania dużych ilości nieustrukturyzowanych danych internetowych.
BigSheets używa Hadoop do przeszukiwania stron internetowych, analizowania ich w celu wyodrębnienia kluczowych terminów i innych przydatnych danych. BigSheets organizuje te informacje w bardzo dużym arkuszu kalkulacyjnym, w którym użytkownicy mogą je analizować za pomocą narzędzi i makr, które można znaleźć w oprogramowaniu do arkuszy kalkulacyjnych na komputery stacjonarne. Jednak w przeciwieństwie do zwykłego oprogramowania do arkuszy kalkulacyjnych, nie ma ograniczeń co do rozmiaru arkusza kalkulacyjnego utworzonego za pomocą BigSheets.
Aby korzystać z BigSheets, użytkownik wskazałby narzędzie na zestaw adresów URL lub repozytorium danych. Listy terminów można wykorzystać do uporządkowania danych w wiersze i tabele, które można później dostosować.
Smith mówi, że IBM wybrał arkusz kalkulacyjny jako model do organizowania danych, ponieważ większość użytkowników zna już takie oprogramowanie. Jeśli użytkownicy chcą reprezentować dane w bardziej złożony sposób, narzędzie będzie współpracować z narzędziem do wizualizacji IBM o nazwie Wiele Oczu , a także inne oprogramowanie do wizualizacji.

Zespół tagów: Narzędzia do wizualizacji mogą być używane z BigSheets do wyszukiwania wzorców w nieustrukturyzowanych danych.
BigSheets ma poziom integracji, którego nie widziałem, mówi jestem Lorica , starszy analityk w grupie badawczej w wydawnictwie technicznym O’Reilly Media. Lorica mówi, że tradycyjnie firmy dzieliły funkcje, które wykonuje BigSheets, na trzy oddzielne zadania — indeksowanie stron internetowych, analizę danych i wizualizacje. Ponieważ BigSheets jest oparty na Hadoop, który jest zasadniczo zaprojektowany do pracy na ogromnych ilościach danych, mówi Lorica, skala nie stanowi problemu dla BigSheets.
Ostrzega jednak, że BigSheets jest na wczesnym etapie i musi zostać przetestowany z innymi danymi. Ponieważ technologia jest rozwijana we współpracy z poszczególnymi partnerami IBM, nie jest jasne, jak łatwo byłoby zacząć z niej korzystać firma – mówi. Skonfigurowanie klastra Hadoop może być wymagającym zadaniem, mówi, a jeśli BigSheets nie jest dobrze zapakowane, firmy mogą potrzebować armii konsultantów, którzy przygotują drogę dla tego narzędzia.
Pierwszy test dla BigSheets pojawił się w British Library, która od 2004 roku pracuje nad stworzeniem archiwum około ośmiu milionów witryn w Wielkiej Brytanii. W regularnych odstępach czasu Biblioteka wykonuje migawki stron WWW, konwertuje je do formatu pliku archiwalnego i przechowuje. Ale wyszukiwanie i analizowanie tych danych to kolejne wyzwanie i tu właśnie pojawił się BigSheets.
Smith mówi, że w niecałe osiem godzin jego zespół zebrał 4,5 terabajta plików archiwalnych i przetworzył je przy użyciu klastra Hadoop składającego się z czterech maszyn. Kierując się wskazówkami badaczy z British Library, zespół wykorzystał BigSheets do wyodrębnienia słów kluczowych, informacji o autorach i innych metadanych z tych nieustrukturyzowanych stron internetowych. Eksperymentowali z analizą częstotliwości terminów i uruchomili chmury tagów oraz inne wizualizacje.
Badacze z Biblioteki Brytyjskiej byli w stanie dostosować rodzaje metadanych, którymi byli zainteresowani w ciągu pierwszego dnia, skupiając się bardziej na autorach stron, niż pierwotnie zamierzali. Wizualizacje dostarczyły nowych spostrzeżeń. Na przykład, używając chmury tagów, naukowcy odkryli, że nazwisko brytyjskiego polityka i pisarza Alastair Campbell był często błędnie napisany jako Alistair, ujawniając dużą liczbę istotnych zapisów, które można łatwo przeoczyć.
Eytan Adar , adiunkt informatyki i informatyki na Uniwersytecie Michigan, który bada systemy w skali internetowej, eksplorację tekstu i wizualizację, mówi, że narzędzie może mieć duży wpływ. Chociaż zawartość Biblioteki Brytyjskiej wydaje się ograniczać do kilku migawek dla każdej strony, nadal przekłada się to na mnóstwo danych, a zwykłe zrzucanie wyników wyszukiwania w odpowiedzi na zapytanie nie jest przydatne, mówi Adar.
Adar zaprojektował własne narzędzie o nazwie Zoetrop , do analizy zmian stron internetowych w czasie. BigSheets zapewnia nowe spostrzeżenia, jak mówi, porównując dane z wielu różnych stron, a także na przestrzeni czasu. Adar twierdzi, że skuteczne wizualizacje mają kluczowe znaczenie dla umożliwienia użytkownikom szybkiego zrozumienia dużych zbiorów danych.
Po dalszych testach IBM ma nadzieję włączyć BigSheets do swoich istniejących usług i produktów.