Adaptation of Acoustic and Language Model for Improving Arabic Automatic Speech Recognition

Oussama S. Enshassi · 2016

إن التعرف التلقائي على الكلام (ASR) عبارة عن ترجمة الكلمات المنطوقة إلى نص من خلال الحاسوب. فقد تم دمج هذه التقنية في العديد من النظم؛ ومع ذلك، فإن تطبيقات التعرف على الكلام باللغة العربية ما زال يشوبها نسبة عالية من الخطأ؛ الأمر الذي يعزى أساسا إلى الاختلاف في نطق الكلمة الواحدة. فالاختلاف في نطق الكلمة الواحدة يؤدي إلى عدم التوافق بين الخطاب العربي والنماذج المدربة لذلك الغرض. إن التباين في نطق الكلمة الواحدة لهو مشكلة رئيسه في تطوير دقة تطبيقات التعرف التلقائي على الخطاب المستمر باللغة العربية. فقد يحدث التباين على مستوى اللفظ، أو الكلمة، أو الجملة. ففي هذه الأطروحة يقترح الباحث أسلوبا لتكييف نموذجا صوتيا و نموذجا لغويا في ظل موارد محدودة للناطقين باللغة العربية. كما تم اجراء عمل مبدئي على القاموس الصوتي. وتم اقتراح النمذجة الصوتية العربية للتغلب على التباين في نطق الكلمة الواحدة في ظل موارد محدودة للناطقين باللغة العربية، فإذا كان هناك العديد من النماذج الصوتية العربية المتاحة يمكننا اقتراح نهجا هجينا يعمل على استيفاء نموذج صوتي او دمجه لتكييف النموذج الصوتي المرجو الوصول إليه. وقد أثبت الأسلوب المقترح أنه فعال جدا للتعامل مع التباين الحاصل في الخطاب العربي. وقد تم قياس معدل الخطأ في الكلمات (WER) لكلا النظامين. وقد تبين أن نظام الخط الأساسي لديه نسبة خطأ في الكلمات تساوي 13.28% التى انخفضت بشكل ملحوظ إلى 11.04% في النظام المحسن. وبالإضافة إلى ذلك، اقترح الباحث أسلوبا لتكييف النموذج اللغوي، وتوصلت النتائج إلى أن نظام الخط الأساسي لديه نسبة خطأ في الكلمات تساوي 12.4% والتي انخفضت بشكل ملحوظ إلى 8.4% في النظام المحسن. وأظهرت النتائج أيضا أن تطبيق الأسلوب الصوتي الهجين يليه أسلوب استيفاء النموذج اللغوي الذى حقق تطورا ملحوظا بنسبة 5.32% في نسبة الخطأ في الكلمات. وأن نظام الخط الأساسي لديه نسبة خطأ في الكلمات تساوي 13.28%، والتي انخفضت بشكل ملحوظ إلى 7.96% في النظام المحسن. ومع ذلك، فإن القواعد الصوتية المقترحة في القاموس الصوتي لم تؤد إلى تطور كبير.

Read the paper · More papers on PaperTik