Eksploracja danych ujawnia fundamentalny schemat ludzkiego myślenia

W 1935 roku amerykański językoznawca George Zipf dokonał niezwykłego odkrycia. Zipf był ciekaw relacji między popularnymi słowami a mniej popularnymi. Policzył więc, jak często słowa występują w języku potocznym, a następnie uporządkował je według częstotliwości.





Ujawniło to niezwykłą prawidłowość. Zipf odkrył, że częstotliwość słowa jest odwrotnie proporcjonalna do jego miejsca w rankingu. Tak więc słowo, które zajmuje drugie miejsce w rankingu, pojawia się o połowę rzadziej niż słowo najczęściej używane. Trzecie słowo pojawia się o jedną trzecią częściej i tak dalej.

W języku angielskim najpopularniejszym słowem jest ten, co stanowi około 7 procent wszystkich słów, a następnie oraz , który występuje w 3,5 procentach przypadków i tak dalej. Rzeczywiście, około 135 słów odpowiada za połowę wszystkich wystąpień słów. Tak więc kilka słów pojawia się często, podczas gdy większość rzadko się pojawia.

Ale dlaczego? Jedną z intrygujących możliwości jest to, że mózg inaczej przetwarza popularne słowa i że badanie rozkładu Zipfa powinno ujawnić ważne informacje na temat tego procesu mózgowego.



Jest jednak problem. Nie wszyscy lingwiści zgadzają się, że rozkład statystyczny częstotliwości słów jest wynikiem procesów poznawczych. Zamiast tego niektórzy twierdzą, że rozkład jest wynikiem błędów statystycznych związanych ze słowami o niskiej częstotliwości, które mogą dawać podobne rozkłady.

Potrzebne jest oczywiście większe badanie obejmujące szeroki zakres języków. Takie badanie na dużą skalę byłoby bardziej wydajne statystycznie i przez to zdolne do oddzielenia tych możliwości.

Dziś takie badanie otrzymujemy dzięki pracy Shuiyuan Yu i współpracowników z Communication University of China w Pekinie. Ci ludzie znaleźli prawo Zipfa w 50 językach zaczerpniętych z różnych klas językowych, w tym indoeuropejskiego, uralskiego, ałtajskiego, kaukaskiego, chińsko-tybetańskiego, drawidyjskiego, afroazjatyckiego i tak dalej.



Yu i współpracownicy twierdzą, że częstości słów w tych językach mają wspólną strukturę, która różni się od tej, którą powodowałyby błędy statystyczne. Co więcej, mówią, że ta struktura sugeruje, że mózg przetwarza pospolite słowa inaczej niż rzadkie, co ma ważne konsekwencje dla przetwarzania języka naturalnego i automatycznego generowania tekstu.

Metoda Yu i co jest prosta. Rozpoczynają się od dwóch dużych zbiorów tekstów zwanych Brytyjskim Korpusem Narodowym i Korpusem Lipskim. Obejmują one próbki z 50 różnych języków, z których każda zawiera co najmniej 30 000 zdań i do 43 milionów słów.

Naukowcy odkryli, że częstotliwości słów we wszystkich językach są zgodne ze zmodyfikowanym prawem Zipfa, w którym rozkład można podzielić na trzy segmenty. Wyniki statystyczne pokazują, że wszystkie prawa Zipfa w 50 językach mają trzysegmentowy wzór strukturalny, przy czym każdy segment wykazuje charakterystyczne właściwości językowe, jak mówią Yu.



Ta struktura jest interesująca. Yu i spółka próbowali to zasymulować, używając wielu modeli do tworzenia słów. Jednym z modeli jest model małpy na maszynie do pisania, który generuje losowe litery, które tworzą słowa, gdy pojawia się spacja.

Ten proces generuje rozkład mocy, taki jak prawo Zipfa. Jednak nie może wygenerować trzysegmentowej struktury, którą znaleźli Yu i spółka. Ta struktura nie może być również generowana przez błędy związane ze słowami o niskiej częstotliwości.

Jednak Yu i spółka są w stanie odtworzyć tę strukturę za pomocą modelu działania mózgu, zwanego teorią podwójnego procesu. To jest idea, że ​​mózg działa na dwa różne sposoby.



Pierwszym z nich jest szybkie intuicyjne myślenie, które wymaga niewielkiego lub żadnego rozumowania. Uważa się, że ten rodzaj myślenia ewoluował, aby umożliwić ludziom szybkie reagowanie w sytuacjach zagrożenia. Na ogół zapewnia dobre rozwiązania trudnych problemów, takich jak rozpoznawanie wzorców, ale można go łatwo oszukać w nieintuicyjnych sytuacjach.

Jednak ludzie są zdolni do znacznie bardziej racjonalnego myślenia. Ten drugi rodzaj myślenia jest wolniejszy, bardziej wyrachowany i celowy. To właśnie ten rodzaj myślenia pozwala nam rozwiązywać złożone problemy, takie jak łamigłówki matematyczne i tak dalej.

Teoria podwójnego procesu sugeruje, że popularne słowa, takie jak i, jeśli i tak dalej są przetwarzane przez szybkie, intuicyjne myślenie i dlatego są częściej używane. Te słowa tworzą rodzaj szkieletu zdań.

Jednak mniej popularne słowa i wyrażenia, takie jak hipoteza oraz Prawo Zipfa wymagają znacznie dokładniejszego przemyślenia. I z tego powodu występują rzadziej.

Rzeczywiście, kiedy Yu i spółka symulują ten podwójny proces, prowadzi to do tej samej trzysegmentowej struktury w rozkładzie częstotliwości słów, którą zmierzyli w 50 różnych językach.

Pierwszy segment odzwierciedla rozkład popularnych słów, ostatni segment odzwierciedla rozkład rzadkich słów, a środkowy segment jest wynikiem skrzyżowania tych dwóch reżimów. Wyniki te pokazują, że prawo Zipfa w językach jest motywowane mechanizmami poznawczymi, takimi jak podwójne przetwarzanie, które rządzą ludzkimi zachowaniami werbalnymi, powiedzmy Yu i współpracownicy.

To interesująca praca. Pomysł, że ludzki mózg przetwarza informacje na dwa różne sposoby, nabrał w ostatnich latach znacznego rozpędu, nie tylko z powodu książki Myślenie, szybkie i wolne przez laureata Nagrody Nobla Daniela Kahnemana, psychologa, który szczegółowo przestudiował ten pomysł.

Dobrze znanym problemem używanym do wyzwalania szybkiego i wolnego myślenia jest to:

Kij i piłka kosztują łącznie 1,10 dolara. Kij kosztuje o 1 $ więcej niż piłka. Ile kosztuje piłka?

Odpowiedź to oczywiście 5 centów. Ale prawie każdy ma początkową skłonność do myślenia o 10 centach. To dlatego, że 10 centów wydaje się słuszne. Jest to właściwy rząd wielkości i jest sugerowany przez sformułowanie problemu. Ta odpowiedź pochodzi z szybkiej, intuicyjnej części mózgu.

Ale to jest złe. Właściwa odpowiedź wymaga wolniejszej, bardziej kalkulującej części mózgu.

Yu i co mówią, że te same dwa procesy są zaangażowane w generowanie zdań. ten część szybko myśląca z Twój mózg tworzy ten podstawowa struktura z zdanie ( ten słowa tutaj wyraźny w pogrubiony). ten inne słowa wymagają ten wolniej, jeszcze część obliczeniowa Twojego mózg.

To właśnie ten podwójny proces prowadzi do trójsegmentowego prawa Zipfa.

Powinno to mieć ciekawe konsekwencje dla informatyków pracujących nad przetwarzaniem języka naturalnego. Ta dziedzina skorzystała z ogromnych postępów w ostatnich latach. Pochodzą one z algorytmów uczenia maszynowego, ale także z dużych baz danych tekstowych gromadzonych przez firmy takie jak Google.

Ale generowanie języka naturalnego jest nadal trudne. Nie musisz długo rozmawiać z Siri, Cortaną lub Asystentem Google, aby zmierzyć się z ich ograniczeniami konwersacyjnymi.

Lepsze zrozumienie tego, w jaki sposób ludzie generują zdania, może znacznie pomóc. Zipf z pewnością byłby zafascynowany.

Nr ref.: arxiv.org/abs/1807.01855 : Prawo Zipfa w 50 językach: jego strukturalna struktura, interpretacja językowa i motywacja poznawcza

ukryć