Pająk sieciowy dla każdego

Wraz ze wzrostem ilości informacji w Internecie rośnie pytanie, jak to wszystko przetwarzać i czynić użytecznymi. Startup o nazwie 80nogi , z siedzibą w Houston w Teksasie, ma nadzieję, że niedroga, rozproszona usługa przeszukiwania sieci Web może pomóc start-upom w wyszukiwaniu informacji w sieci bez konieczności budowania gigantycznych farm serwerów używanych przez największe wyszukiwarki. Firma wystartowała w tym tygodniu na DEMO, konferencji w San Diego, która prezentuje nowe firmy.





Przeszukiwacze sieci Web (pająki) to oprogramowanie, które automatycznie odwiedza strony w Internecie i może być używane do ich indeksowania i zbierania fragmentów informacji z różnych stron. Roboty indeksujące są wykorzystywane przez wyszukiwarki na przykład do monitorowania lokalizacji informacji w sieci. Jednak skala sieci oznacza, że ​​kompleksowe indeksowanie zużywa dużo mocy obliczeniowej, co zazwyczaj oznacza budowanie ogromnych centrów danych w celu zasilania oprogramowania.

80legs ma nadzieję, że ta technologia stanie się bardziej dostępna dla małych firm i osób prywatnych, umożliwiając dzierżawę dostępu i pozwalając klientom płacić tylko za to, co przemierzają.

Technologia przeszukiwania sieci ma również kluczowe znaczenie dla witryn semantycznych i usług zaprojektowanych do przetwarzania zapytań w języku naturalnym. Podczas gdy 80legs spodziewa się, że użytkownicy będą zainteresowani wyszukiwaniem i aplikacjami semantycznymi, dyrektor generalny Shion Deysarkar mówi, że testujący usługę obejmował również klientów o mniejszych zainteresowaniach technicznych. Na przykład niektórzy badacze rynku używają 80legs do odkrywania wzmianek o konkretnych firmach lub tematach w Internecie.



Użytkownik może rozpocząć indeksowanie sieci przez interfejs sieciowy 80legs. Formularz na stronie firmy pozwala im ustawić parametry projektu i przesłać niestandardowy kod potrzebny do kontrolowania, jak robot indeksujący wykonuje swoją pracę. Na przykład użytkownik może chcieć, aby robot indeksujący znalazł obrazy i sprawdził je w bazie danych chronionych prawami autorskimi. Deysarkar twierdzi, że roboty indeksujące jego firmy są w stanie przetwarzać do dwóch miliardów stron dziennie. Firma pobiera 2 dolary za każdy milion przeszukanych stron plus opłatę w wysokości trzech centów za godzinę wykorzystanego przetwarzania.

Wiele startupów ma trudności ze znalezieniem funduszy potrzebnych do budowy dużych centrów danych, ale nie jest to podejście, które 80legs zastosowało do budowy infrastruktury indeksowania sieci. Zamiast tego firma uruchamia swoje oprogramowanie w rozproszonej sieci komputerów osobistych, podobnie jak te używane w projektach takich jak:SETI @ home. Sieć przetwarzania rozproszonego jest tworzona przez firmę Plura Processing, która wynajmuje ją do 80 nóg. Plura zachęca użytkowników komputerów do dostarczania niewykorzystanej mocy obliczeniowej w zamian za dostęp do gier, darowizny na cele charytatywne i inne nagrody.

Deysarkar twierdzi, że podejście to znacznie obniża koszty dla 80legs, pozwalając firmie oferować swoje usługi za znacznie mniej, niż byłoby to możliwe, gdyby korzystała z centrum danych, a nawet usługi przetwarzania w chmurze, takiej jak Amazon Web Services.



Daniel Tunkelang, współzałożyciel firmy wyszukiwania Endeca , z siedzibą w Cambridge w stanie Massachusetts, twierdzi, że dobra usługa indeksowania sieci może być przydatna dla startupów, które chcą skupić się na budowaniu doświadczenia wyszukiwania, a nie na zbieraniu danych. Jednak Tunkelang twierdzi, że sukces 80legs może zależeć od tego, jak łatwo użytkownicy mogą dostosować indeksowanie. Najważniejsze pytanie brzmi: na ile adaptacyjne i programowalne jest indeksowanie? on mówi.

Tunkelang zauważa również, że dla robota indeksującego ważne jest przechwycenie jak największej ilości informacji. Na przykład ścieżka, jaką przemierzył robot, aby dotrzeć do określonej strony, może dostarczyć firmie zajmującej się wyszukiwaniem przydatnych informacji o zawartości tej strony.

Usługa taka jak 80legs może być również przydatna dla badaczy uniwersyteckich. Indeksowanie na dużą skalę jest rzeczywiście kosztowną przeszkodą do pokonania dla eksperymentalnych projektów wyszukiwania w środowisku akademickim, w którym często brakuje infrastruktury na dużą skalę, mówi Kevin Chang , profesor nadzwyczajny informatyki na Uniwersytecie Illinois w Urbana-Champaign.

Chang uważa, że ​​rozproszona natura 80nóg jest interesującym kierunkiem i brzmi obiecująco [dla obniżenia] kosztów raczkowania. Jednocześnie zgadza się, że wiele zależy od tego, jak wydajnie działa system i jak skutecznie użytkownicy mogą dostosować, jakie dane chcą przetwarzać.

80legs planuje wprowadzić rynek, na którym nietechniczni użytkownicy będą mogli kupować aplikacje kontrolujące działanie robota indeksującego. Firmy partnerskie będą również mogły sprzedawać dostęp do aplikacji kontrolujących roboty indeksujące 80legs.

ukryć