Heaps' law and vocabulary size of Croatian texts. Documentation.
Miroslav Tuđman, Damir Boras, Nives Mikelić · 2004
Postojeca formula /Vr(n) = Knβ / Heapsova zakona o velicini vokabulara teksta nije univerzalna te je zakon potrebno redefinirati, kako bi se mogao koristiti za analizu korpusa na razlicitim jezicima. Analiza korpusa tekstova na hrvatskom jeziku potvrđuje hipotezu da je broj funkcionalnih pojavnica (F) u tekstu konstantan te iznosi 21% velicine teksta n (funkcionalnih pojavnica u engleskim je tekstovima 26%). Autor dokazuje da se postotak funkcionalnih pojavnica u tekstu može koristiti kao vrijednost za parametar K, te da je parametar K konstantna vrijednost za svaki jezicni korpus. Empirijska istraživanja potvrđuju autorovu tezu da se broj funkcionalnih pojavnica u tekstu može izracunati po formuli F = nK/100, a da za velicinu najfrekventnije pojavnice (MF) vrijedi formula M F = n (K/100) 2. Vrijednost drugog parametra Heapsovog zakona također se može precizno odrediti: β = log K/100. Zato autor predlaže novi oblik zakona o velicini vokabulara teksta: Vr(n) = (Kn)β . Broj rijeci koje se javljaju samo jedanput (HL) u tekstu može se izracunati po formuli: HL = ((Kn)/2)β . Istraživanja potvrđuju da je vrlo visoka korelacija između izracunatih i stvarnih vrijednosti velicine vokabulara, odnosno između stvarnih i izracunatih vrijednosti jednokratnih rijeci u tekstu. Ovako interpretiran i definiran zakon o velicini vokabulara teksta omogucava izracun velicine vokabulara teksta na svakom jeziku, kada se zna postotak funkcionalnih rijeci koji je konstantan za svaki jezik. No, ova interpretacija zakona omogucava osim izracuna velicine vokabulara teksta, i određivanje broja funkcionalnih pojavnica u tekstu, velicine najfrekventnije rijeci u tekstu, te broja jednokratnih pojavnica koje tvore vokabular teksta.