Segmental Analysis-Based Authorship Discrimination between the Holy Quran and Prophet’s Statements

Halim Sayoud · Digital Studies / Le champ numérique · 2015

Stylometry has got a lot of interest during these recent years because it solved many authorship problems and disputes that were difficult to handle. Author discrimination consists in checking whether two texts are written by the same author or not. In this investigation, we try to make an author discrimination between the Quran (The holy words and statements of God in the Islamic religion) and the Hadith (statements said by the prophet Muhammad) in a segmental form. In fact, 14 text segments are extracted from the Quran book and 11 text segments are extracted from the Bukhari Hadith. These segments have more or less the same size in terms of words and the medium size is about 2080 words per text segment. The Quran is taken in its entirety, whereas for the Prophet’s statements, we chose only the certified texts of the Bukhari book. That is, four series of experiments are done and commented. The first series of experiments concerns several experiments of authorship attribution using different state of the art features and classifiers, the second series of experiments analyses the different texts by using a new parameter called COST, the third series of experiments consists in an authorship discrimination using the frequency of a particular word (“الذين ” meaning those/who in English) and the fourth series of experiments performs a hierarchical clustering on the 25 text segments, in order to assess the real number of clusters (author styles) and to see if the hypothesis of a unique author is possible. This investigation, which represents the continuation of a previous research work on the same topic [Sayoud 2012-a], has further clarified an old enigma, which was impossible to solve for fourteen centuries: all the results of this investigation show unanimously that the two books should have two different authors. La stylométrie a montré beaucoup d'intérêts durant ces dernières années car elle a résolu beaucoup de problèmes et disputes qui étaient difficiles à manipuler. La discrimination d'auteur consiste à vérifier si deux textes sont écrits par le même auteur ou non. Dans cette étude, nous essayons d'exécuter une discrimination d'auteur entre le Coran (Les mots saints et déclarations de Dieu dans la religion Islamique) et le Hadith (déclarations prononcées par le Prophète Muhammad) sous une forme segmentale. En fait, 14 segments de texte sont extraits du Coran et 11 segments sont extraits du Hadith de Bukhari. Ces segments ont plus ou moins la même taille en terme de mots et la taille moyenne est d'environ 2080 mots par segment. Le Coran est pris entièrement, tandis que pour les déclarations du Prophète, nous avons choisi seulement les textes certifiés du livre de Bukhari. Ainsi, quatre séries d'expériences sont faites et commentées. La première série d'expériences concerne plusieurs expériences d'identification d'auteur utilisant différents classifieurs et caractéristiques de l'état de l'art ; la seconde série d'expériences analyse les différents textes en utilisant un nouveau paramètre appelé COST; la troisième série d'expériences consiste en une discrimination d'auteurs utilisant la fréquence d'un mot particulier ("الذين " signifiant Ceux/ Qui en Français) et la quatrième série d'expériences exécute un regroupement hiérarchique sur les 25 segments de texte, dans le but d'estimer le nombre réel de clusters (Styles d'auteurs) et de voir si l'hypothèse d'un auteur unique est possible. Cette étude, qui représente la suite d'un travail de recherche précédent sur le même sujet (Sayoud 2012a), a clarifié d'avantages une ancienne énigme, qui était impossible de résoudre durant quatorze siècles : en fait, tous les résultats de cette étude montrent que les deux livres devraient avoir deux auteurs différents.

Read the paper · More papers on PaperTik