Jak mechanicy turcy zebrali ogromny leksykon powiązań między słowami a emocjami?

Jednym z modnych fraz związanych z portalem społecznościowym jest analiza sentymentu. Jest to umiejętność określenia opinii lub stanu umysłu danej osoby poprzez analizę słów, które publikuje na Twitterze, Facebooku lub innym medium.





Dzięki tej metodzie wiele obiecano — możliwość mierzenia zadowolenia z polityków, filmów i produktów; umiejętność lepszego zarządzania relacjami z klientami; umiejętność tworzenia dialogów do gier opartych na emocjach; umiejętność pomiaru przepływu emocji w powieściach; i tak dalej.

Chodzi o to, aby całkowicie zautomatyzować ten proces — aby przeanalizować strumień słów generowanych przez serwisy społecznościowe przy użyciu zaawansowanych technik eksploracji danych, aby ocenić nastroje na ogromną skalę.

Ale wszystko to zależy od tego, jak dobrze rozumiemy emocje i biegunowość (negatywną lub pozytywną), które ludzie kojarzą z każdym słowem lub kombinacjami słów.



Dzisiaj Saif Mohammad i Peter Turney z National Research Council Canada w Ottawie ujawniają ogromną bazę danych słów i związanych z nimi emocji i polaryzacji, które zebrali szybko i niedrogo, korzystając z crowdsourcingowej strony internetowej Mechanical Turk firmy Amazon. Mówią, że ten mechanizm crowdsourcingowy umożliwia szybkie i łatwe zwiększenie rozmiaru i jakości bazy danych.

Większość psychologów uważa, że ​​istnieje zasadniczo sześć podstawowych emocji – radość, smutek, gniew, strach, wstręt i zaskoczenie – lub co najwyżej osiem, jeśli uwzględnimy zaufanie i oczekiwanie. Zatem zadaniem każdego leksykonu słów-emocji jest określenie, jak silnie dane słowo jest powiązane z każdą z tych emocji.

Jednym ze sposobów, aby to zrobić, jest skorzystanie z małej grupy ekspertów, aby powiązać emocje z zestawem słów. Jedna z najsłynniejszych baz danych, stworzona w latach 60. XX wieku i znana jako baza danych General Inquirer, zawiera ponad 11 000 słów oznaczonych 182 różnymi tagami, w tym niektóre z emocji, które obecnie psychologowie uważają za najbardziej podstawowe.



Bardziej nowoczesną bazą danych jest WordNet Affect Lexicon, w którym otagowano w ten sposób kilkaset słów. Wykorzystano małą grupę ekspertów, aby ręcznie oznaczyć zestaw początkowych słów podstawowymi emocjami. Rozmiar tej bazy danych został następnie dramatycznie zwiększony dzięki automatycznemu kojarzeniu tych samych emocji ze wszystkimi synonimami tych słów.

Jednym z problemów związanych z tymi podejściami jest sam czas potrzebny na skompilowanie dużej bazy danych, więc Mohammad i Turney spróbowali innego podejścia.

Ci faceci wybrali około 10 000 słów z istniejącego tezaurusa i leksykonów opisanych powyżej, a następnie stworzyli zestaw pięciu pytań, aby zadać każde słowo, które ujawniłoby związane z nim emocje i biegunowość. To łącznie ponad 50 000 pytań.



Następnie zadali te pytania ponad 2000 osobom, czyli Turkom, na stronie internetowej Amazon Mechanical Turk, płacąc 4 centy za każdy zestaw prawidłowo odpowiedzianych pytań.

Rezultatem jest obszerny leksykon słów-emocji dla ponad 10 000 słów lub dwuwyrazowych fraz, które nazywają EmoLex.

Jednym z ważnych czynników w tym badaniu jest jakość odpowiedzi udzielanych przez crowdsourcing. Na przykład niektórzy Turcy mogą odpowiadać losowo lub nawet celowo wprowadzać błędne odpowiedzi.



Mohammad i Turney zajęli się tym, dodając pytania testowe, których używają do oceny, czy Turker odpowiada dobrze. Jeśli nie, wszystkie dane od tej osoby są ignorowane.

Przetestowali jakość swojej bazy danych, porównując ją z wcześniejszymi, stworzonymi przez ekspertów i twierdzą, że wypada dobrze. Porównaliśmy podzbiór naszego leksykonu z istniejącymi danymi dotyczącymi złotego standardu, aby pokazać, że otrzymane adnotacje są rzeczywiście wysokiej jakości.

Takie podejście ma duży potencjał na przyszłość. Mohammad i Turney twierdzą, że zwiększenie rozmiaru bazy danych dat powinno być proste, a przy tym ta sama technika może być łatwo dostosowana do tworzenia podobnych leksykonów w innych językach. A wszystko to można zrobić bardzo tanio – w tej pracy wydali 2100 dolarów na Mechanical Turk.

Najważniejsze jest to, że analiza sentymentu może być tylko tak dobra, jak baza danych, na której się opiera. Dzięki EmoLex analitycy mają nowe narzędzie do swojego zestawu sztuczek.

Nr ref.: arxiv.org/abs/1308.6297 : Crowdsourcing Stowarzyszenia Słowa-Emocji Leksykon

ukryć