Aller au contenu

Loi de Zipf

Un article de Wikipédia, l'encyclopédie libre.

Loi de Zipf
Image illustrative de l’article Loi de Zipf
Fonction de masse
pour N = 10 dans un repère log-log. L'axe horizontal est l'indice k (la fonction est discrète, les droites de couleur n'indiquent pas de continuité).
Image illustrative de l’article Loi de Zipf
Fonction de répartition
pour N = 10. L'axe horizontal est l'indice k (la fonction est discrète, les courbes de couleur n'indiquent pas de continuité).

Paramètres
Support
Fonction de masse
Fonction de répartition
Espérance
Mode
Entropie
Fonction génératrice des moments
Fonction caractéristique

La loi de Zipf est une observation empirique concernant la fréquence des mots dans un texte. Elle a été formulée en 1932[1] par le linguiste George Kingsley Zipf (1902-1950), mais plusieurs auteurs ont contribué à sa mise en forme, dont Jean-Baptiste Estoup en 1912[2],[3]. Elle a été par la suite démontrée à partir de formules de Shannon par Benoît Mandelbrot. Elle est parfois utilisée en dehors de ce contexte, par exemple au sujet de la taille et du nombre des villes dans chaque pays, lorsque cette loi semble mieux répondre aux chiffres que la distribution de Pareto[4].

Fréquence des mots en fonction du rang dans la version originale d'Ulysse de James Joyce.

Zipf avait entrepris d'analyser une œuvre monumentale de James Joyce, Ulysse, d'en compter les mots distincts et de les présenter par ordre décroissant du nombre d'occurrences. La légende dit que :

  • le mot le plus courant revenait 8 000 fois ;
  • le dixième mot 800 fois ;
  • le centième, 80 fois ;
  • et le millième, 8 fois.

Toutefois ces résultats semblent un peu trop précis pour être parfaitement exacts : le dixième mot dans une étude de ce genre devrait apparaître environ 1 000 fois, en raison d'un effet de coude observé dans ce type de distribution. Il reste que la loi de Zipf prévoit que dans un texte donné, la fréquence d'occurrence d'un mot est liée à son rang n dans l'ordre des fréquences par une loi de la forme où est une constante.

Point de vue théorique

[modifier | modifier le code]

Mathématiquement, il est impossible pour la version classique de la loi de Zipf d'affirmer exactement qu'il existe une infinité de mots dans une langue puisque, pour toute constante de proportionnalité , la somme de toutes les fréquences relatives est proportionnelle à la série harmonique et doit être

Des observations citées par Léon Brillouin dans son livre Science et théorie de l'information suggérèrent qu'en anglais, les fréquences parmi les mille mots les plus fréquemment utilisés étaient approximativement proportionnelles à avec s juste légèrement plus grand que 1. On sait toutefois que le nombre de mots d'une langue est limité. Le vocabulaire (passif) d'un enfant de 10 ans tourne autour de 5 000 mots