Schoobrary رجوع
العودة إلى البحث
رسائل دكتوراة الفرنسية 2017 00f9017a-a421-4a34-8a37-f43067cc71f3

Développement d’un système de reconnaissance distribuée de la parole GSM à base des modèles de Markov cachés

Azzedine Touazi, Mohamed Debyeche

كلية المعلوماتية والالكترونيات-جامعة العلوم والتكنولوجيا هواري بومدين - الجزائر · الجزائر

الموضوعات

علوم تطبيقية وتكنولوجية

الملخص

L’objectif de ce travail consiste à proposer des solutions contribuant à la résolution de certains problèmes liés à la performance et à la qualité de service des systèmes DSR (Distributed Speech Recognition- DSR). Nous nous sommes, dans la majeure partie de cette thèse, intéressés au problème de la limitation de la bande passante pour la transmission de données DSR. C'est ainsi que des nouvelles méthodes de compression, à bas débit, des coefficients MFCCs (Mel Frequency Cepstral Coefficients) ont été proposées. Il a été introduit dans ces méthodes un bloc de réduction de dimension, en exploitant la corrélation inter et/ou intra trames des MFCCs. La base de données Aurora-2 est utilisée dans l’évaluation de la performance du système de reconnaissance en environnements calme et bruités. Les meilleurs résultats de reconnaissance ont été obtenus par la méthode basée sur la technique d’approximation polynomiale avec une pondération dans le sens des moindres carrés, suivie d’une quantification vectorielle arborescente. Cette méthode exige un choix pertinent des paramètres d’ajustement tels que le degré du polynôme et les tailles des fenêtres d’interpolation et de pondération. Une amélioration des performances est obtenue pour des débits réduits autour de bps, en comparaison au codeur source du standard ETSI-AFE à bps. Dans le but de contribuer à l’ingénierie de la langue Arabe, nous avons dirigé notre recherche dans la deuxième partie vers le développement d’applications DSR en langue Arabe. L’intégration de ces applications permettra aux opérateurs dans les pays arabophones d’améliorer la qualité de leurs services. Pour cela, nous avons développé une base de données normalisée des chiffres Arabes isolés de 0 à 9 que nous avons nommé Aradigits-2. Les ressources orales ont été collectées à partir de la base de données Aradigits développée par le laboratoire LCPTS de l’USTHB. Le système de reconnaissance est conçu en mode indépendant du locuteur. Cependant, la méthodologie suivie, dans la construction du système de reconnaissance sous la plate-forme HTK (Hidden Markov Models Toolkit), est inspirée de la base de données Aurora-2. Nous avons pu aboutir à des résultats prometteurs ; ceci par l’ajustement de certains paramètres tels que le nombre de composantes du mélange Gaussien, le nombre d’états et la taille de la fenêtre de calcul des paramètres dynamiques.

التعريف والنوع

رقم الوثيقة
00f9017a-a421-4a34-8a37-f43067cc71f3
رقم العقد
0
نوع الوسائط
Crawler
نوع المحتوى
الرسائل العلمية
صيغة المصدر
رسائل دكتوراة
نوع الملف
pdf text
أسماء الملفات
1373219_1.pdf, 1373219_2.pdf

بيانات النشر

ألقاب المؤلفين
[{"name_ar":" Azzedine Touazi","title_ar":"اعداد","title_en":"Preparation"},{"name_ar":"Mohamed Debyeche ","title_ar":"اشراف","title_en":"Supervision"}]
اللغة
French

المصدر والدورية

اسم المصدر
Développement d’un système de reconnaissance distribuée de la parole GSM à base des modèles de Markov cachés

المحتوى والصفحات

عدد الصفحات
0
ترجمة الملخص
The integration of complex multimedia applications for voice recognition has raised the need to adoptnew client-server architectures, also known under the name of Distributed Speech Recognition(DSR). The objective of this work is to proposesolutions whichmay contribute to solving a number ofDSR problems related to the system performance and the quality of service. Due to the limited network bandwidth, a noise robust low bit-rate compression scheme of Mel Frequency Cepstral Coefficients (MFCCs) is desired for DSR services. A major part of the research reported in this thesis is devoted toproposingnew low bit-rate compression methodsof MFCCparameters. Principally, in all proposed methods,we exploit inter and/or intra-frame correlation across MFCC components. The performance evaluation isconducted on the noisy Aurora-2 database, under both clean and multi-condition training modes. The best recognition results are achievedby employing the method based on weighted least squares polynomial approximation,followed by a tree structured vector quantization based scheme. This method requires an appropriate choice of fitting or smoothing parameters, such as the polynomial degree and the size of the interpolation and weighting windows. Furthermore, improved performance is obtained for bit-rates around bps, compared to the ETSI-AFE source encoder at bps.Withthe aimof contributing to the engineering of Arabic language, we have focused our research and development effortson buildingDSR applications which useArabicas input data. The integration of Arabic languagewill enable operators in Arabic-speaking countries to improve the quality of the providedservices. For this, we have developed an isolated Arabic spoken digits database named Aradigits-2. This database contains a set of utterances of pronounced digits from to , with a recognition system designed in a speaker independent mode. Speech resources are collected from the Aradigits database developed by the LCPTS laboratory team at the USTHB. However, the design of the recognition system is implemented, using the Hidden Markov Models Toolkit(HTK), by following a similar methodology to that used in Aurora-2 database. We obtained promising results by carrying out an optimal fitting on some recognition parameters, such as the number of Gaussian mixtures and thenumber of states, as well as the size of the derivative window of dynamic features.
كلمات الباحثين
, approximation polynomiale, Arabic language, Aurora-2 database, Aurora-2, compression de données, data compression, Distributed speech recognition, ETSI-AFE standard, ETSI-AFE, HTK, la langue Arabe, MFCC parameters, paramètres MFCC, polynomial approximation, Reconnaissance distribuée de la parole

إشراف وإعداد

الإشراف
Mohamed Debyeche
الإعداد
Azzedine Touazi

الاقتباسات الببليوغرافية

APA

Azzedine Touazi و Mohamed Debyeche . (2017). Développement d’un système de reconnaissance distribuée de la parole GSM à base des modèles de Markov cachés. أطروحة(رسائل دكتوراة). كلية المعلوماتية والالكترونيات-جامعة العلوم والتكنولوجيا هواري بومدين - الجزائر. الجزائر.

MLA

Azzedine Touazi و Mohamed Debyeche . Développement d’un système de reconnaissance distribuée de la parole GSM à base des modèles de Markov cachés. 2017. كلية المعلوماتية والالكترونيات-جامعة العلوم والتكنولوجيا هواري بومدين - الجزائر، رسائل دكتوراة.