Wikipedia, aby dodać znaczenie do swoich stron

Jako globalny zasób zbudowany z wolnego czasu milionów wolontariuszy, Wikipedia może być uosobieniem Web 2.0. Ale Fundacja Wikimedia , organizacja non-profit, która prowadzi między innymi Wikipedię, myśli teraz o tym, jak uczynić z niej podporę sieci Web 3.0, czyli sieci semantycznej.





Oznacza to, że niektóre dane z 15 milionów (i wciąż rosnących) artykułów Wikipedii będą zrozumiałe zarówno dla komputerów, jak i dla ludzi. Dzięki temu oprogramowanie będzie wiedziało, na przykład, że liczby pokazane w jednej z kolumn w ta tabela zawierająca listę prezydentów USA są daty. To z kolei może pozwolić aplikacjom czerpiącym z Wikipedii na automatyczne generowanie historycznych osi czasu lub odpowiadanie na pytania dotyczące wiedzy ogólnej, które zwykle wiązałyby się z odnalezieniem i przeczytaniem odpowiedniego wpisu w witrynie.

Na 2010 Technologia semantyczna konferencja w San Francisco w zeszłym miesiącu, wicedyrektor fundacji, Erik Möller i kolega Trevor Parscal , twórca doświadczeń użytkowników dla Wikimedia, pokazał kilka pierwszych kroków podjętych przez fundację w celu zbadania, jak można dodać więcej struktury semantycznej do Wikipedii. Zaapelowali również do społeczności sieci semantycznej o pomoc w opracowaniu sposobów na zwiększenie dostępności wiedzy Wikipedii dla komputerów i oprogramowania.

Informacje semantyczne już istnieją w Wikipedii i ludzie już na nich budują, mówi Möller. Niestety tak naprawdę nie pomagamy, a oni muszą w tym celu użyć rozległego przetwarzania.



Jednym z przykładów jest DBPedia , semantyczna baza danych zbudowana przy użyciu oprogramowania zbierającego dane ze stron witryny i utrzymywana przez Wolny Uniwersytet w Berlinie i Uniwersytet w Lipsku, oba w Niemczech. Innym jest Wolna baza , komercyjną bazę wiedzy, z której wiele pochodziło również ze skrobania Wikipedii. Freebase jest źródłem danych używanym przez wyszukiwarkę odpowiedzi na pytania Zestaw zasilający , który został nabyty przez Microsoft jako część jego wyszukiwarki Bing.

Pierwszymi celami dla Möllera i Parscala są infoboksy które pojawiają się jako podsumowania na wielu stronach Wikipedii oraz tabele we wpisach, takich jak ten pokazujący produkt narodowy brutto wszystkich krajów świata .

Sama możliwość ponownego wykorzystania tych danych w Wikipedii byłaby wielką rzeczą, mówi Yaron Koren , który prowadzi firmę doradczą specjalizującą się w: Semantic MediaWiki , rozszerzenie oprogramowania MediaWiki używanego do tworzenia Wikipedii. Dodaje, że można by wyeliminować ręczną pracę, jaką trzeba dziś włożyć w utrzymywanie wielu tabel i list. Zamiast tego listy mogą być generowane automatycznie z infoboksów innych stron. Möller mówi, że byłoby również możliwe generowanie map, wykorzystując współrzędne lokalizacji, które znajdują się na niektórych stronach, lub automatyczne generowanie osi czasu w celu podsumowania okresów w historii, które obejmują wiele innych stron.



Möller mówi, że przykładem rodzaju usług, które można włączyć, jest: WikiPics , opracowany przez Daniela Kinzlera w niemieckiej fundacji Wikimedia. Kinzler przeszukał bazę danych wszystkich linków łączących różne strony Wikipedii dostępne w wielu językach i zbudował w pełni wielojęzyczną wyszukiwarkę obrazów. Gdy użytkownik wpisze na przykład termin koń, serwis wie, że musi znaleźć również obrazy przedstawiające cheval (francuski) i Pferd (niemiecki). Szukacie pojęć zamiast terminów, mówi Möller. Jednak na razie witryna opiera się na powolnym procesie przeszukiwania całej Wikipedii w celu aktualizacji swojej wiedzy. Semantyczna Wikipedia utrzymywałaby żywą bazę danych, do której można by w dowolnym momencie przejrzeć zapytania.

Wikipedia stoi przed dwoma dużymi wyzwaniami, jeśli chodzi o przyjmowanie pojęć semantycznych, mówi Möller. Jednym z nich jest to, że nikt jeszcze nie zbudował semantycznej usługi sieciowej na skalę witryny takiej jak Wikipedia i nie jest jasne, czy istniejące oprogramowanie, takie jak Semantic MediaWiki, podoła temu zadaniu, mówi.

Drugim wyzwaniem jest cecha Wikipedii najbardziej odpowiedzialna za jej dotychczasowy sukces: jej społeczność. Myślenie o dodaniu struktury semantycznej jest naturalnym rozszerzeniem tego, co musi zrobić Wikipedia, biorąc pod uwagę panujące trendy Andrzej Lih z University of Southern California i autorka książki z 2009 roku Rewolucja Wikipedii . Ale martwię się trochę o aspekt bazy danych, który się z tym wiąże - atrakcyjność wiki polega przede wszystkim na tym, że zostały one ręcznie edytowane przez ludzi.

Parscal prowadzi działania mające na celu ułatwienie każdemu dodawania lub edytowania danych dużego sklepu semantycznego. Pracowaliśmy nad edytorem wizualnym, który sugeruje, w jaki sposób możemy pomóc użytkownikom w dostarczaniu uporządkowanych danych, a to również ułatwia proces edycji, mówi Parscal.

Dzisiejsze edytowanie Wikipedii jest już zniechęcającym procesem, który wymaga poprawy, przyznaje Parscal. Wyjaśnia, że ​​jeśli wszedłeś w interakcję z naszym interfejsem, zostałeś spoliczkowany przez wikitekst (język znaczników, który wykorzystuje specjalny kod wokół tekstu do formatowania takich elementów, jak linki, odnośniki i nagłówki sekcji). Wikitekst dla tabel lub infoboksów – informacje, które najlepiej nadają się do semantyki – jest szczególnie gęsty i trudny do zrozumienia, mówi Parscal. Niedawno przeprowadziliśmy kilka badań doświadczeń użytkowników z osobami, które wcześniej z niego nie korzystały; szybko byli sfrustrowani.

W przyszłości być może uda się całkowicie wyeliminować potrzebę zaludniania niektórych części Wikipedii przez człowieka, mówi Möller. Zasadniczo wiele z tych danych prawdopodobnie nie powinno być wprowadzanych przez ludzi, powinni oni po prostu raz w roku sondować źródło wielkości takiej jak PKB. Jest to funkcja, którą Koren już dodał do Semantic MediaWiki za pomocą rozszerzenia o nazwie ExternalData.

ukryć