التحسس المضعوط الموجه بالمهام: النظرية والتطبيق
أميمة الدكاك, ديمة شاهين, محي الدين وايناخ
المعهد العالي للعلوم التطبيقية والتكنولوجيا · سوريا
يهدف بحث الدكتوراه "التّحسّس الضغوط الموجه بالمهام: النظرية والتطبيق"إلى دراسة تطبيق التحسّس الضغوط Compressive sensing والترميز المخلخل sparse coding في عدة مهام مختلفة من معالجة إشارة الكلامية، مع استكشاف التكيفات الممكنة لهذه التقنية لكل مهمة بهدف تحسين الأداء. درسنا في هذا البحث تطبيق الترميز المخلخل (والذي هو حالة خاصة من التحسّس الضغوط) في مهمتين من معالجة إشارة الكلامية: (1) تصنيف الصوتيمات باللغة العربية (تعرّف الصوتيمات)، و(2) تعزيز الكلام (إزالة الضجيج). خلال العشر سنوات الماضية، ازدادت الأبحاث المتعلقة بتطبيقات الترميز المخلخل في مجال معالجة الإشارات مثل "تعرّف الوجوه"، وإزالة الضجيج من الصور. يتطلب الترميز المخلخل حل مسألتين جزئيتين: (1) إيجاد مجموعة "كاملة" من الإشارات الأساسية (القاموس) التي تمثل إشارات الاختبار بشكل خلخلي (باستخدام عدد قليل منها)، و(2) إيجاد "الرمز المخلخل" الذي يمثل معاملات التكوين المخلخل (مع العديد من القيم الصفرية) للإشارات الأساسية، بحيث يشكل هذا التكوين أقرب تقريب للإشارة المستهدفة بأصغر خطأ ممكن. قدمنا في هذا البحث مساهمتين جديدتين في مجال تطبيق الترميز المخلخل في معالجة إشارة الكلامية: أولاً، لتصنيف الصوتيمات، اقترحنا نظام تصنيف جديد يعتمد على الترميز المخلخل كميزات تمييزية وSparse Representation Classifier (SRC). يتكوّن التصنيف من مرحلتين: (1) مرحلة تدريب حيث يتم بناء/تعلم القاموس، و(2) مرحلة تعرّف حيث يتم حساب الترميز المخلخل لإشارة الصوتيم الاختبارية على القاموس المختار، ثم يُستخدم لتحديد الفئة الصوتيمية لإشارة الاختبار. في مرحلة التدريب، درسنا ثلاثة أنواع مختلفة من القواميس: (a) قاموس الأمثلة exemplars dictionary من متجهات ميزات الصوتيمات التدريبية، (b) قاموس K-Singular Value Decomposition (K-SVD)، و(c) قاموس Fisher Discriminative Dictionary Learning (FDDL). لتقييم أداء نظام تصنيف الصوتيمات المقترح، استخدمنا مجموعتين من بيانات الصوتيمات العربية، تحتويان على 33 صوتيمًا. أظهرت التجارب أن "قاموس الأمثلة" يعطي أفضل أداء من حيث خطأ التصنيف، بينما القواميس المتعلمة تتميز بزمن تصنيف أقل. نظام التصنيف المقترح يتفوق على أداء نظام الشبكات العصبية Echo State Neural Networks الذي تم تطبيقه على نفس مجموعتي بيانات الصوتيم العربية. ثانيًا، لتعزيز الكلام، اقترحنا خوارزمية جديدة لتعلم القاموس Incoherent Discriminative Dictionary Learning (IDDL) لنمذجة كل من الكلام والضجيج. صياغة مسألة تعلم القاموس المقترحة تحتوي على دالة تكلفة تأخذ بعين الاعتبار كلًا من أخطاء "التشويش على المصدر" و"تشويه المصدر"، مع مصطلح تنظيم يعاقب التماسك بين القواميس الفرعية للكلام والضجيج. استخدمنا خوارزمية IDDL المقترحة في نظام تعزيز الكلام المشرف الذي يحتوي على مرحلتين: (1) مرحلة تدريب حيث نتعلم قاموس IDDL المكوّن من قاموسين فرعيين لنمذجة طيف السعة لكل من الكلام النظيف والضجيج، و(2) مرحلة تعزيز حيث يتم حساب الرموز المخلخلة لطيف السعة للإشارة الملوثة على القاموس المتعلم، ثم تُضرب الرموز المخلخلة بالقواميس الفرعية لإيجاد تقدير أولي لكل من طيف سعة الكلام النظيف والضجيج. أخيرًا، يُستخدم مرشح Wiener لتنقية تقدير الكلام النظيف. أظهرت التجارب على مجموعة بيانات NOIZUES (التي تحتوي على إشارات كلامية ملوثة بثمانية أنواع مختلفة من الضجيج)، باستخدام مقياسين موضوعيين لتعزيز الكلام: frequency-weighted segmental SNR (FwSegSNR) وPerceptual Evaluation of Speech Quality (PESQ)، أن خوارزمية IDDL المقترحة تتفوق على خوارزميات تعلم القاموس الأخرى المختبرة (K-SVD، GDL، وFDDL) في معظم حالات أنواع الضجيج المدروسة