تلخيص النصوص العربية المعتمد على التعلم العميق والمعطيات الكبيرة
Arabic Text Summarization Based on Deep Learning and Big Data
محمد سعيد الدسوقي, ملهم محمد منير المالح
المعهد العالي للعلوم التطبيقية والتكنولوجيا · سوريا
الموضوعات
علوم تطبيقية وتكنولوجية
الملخص
شهدت معالجة اللغات الطبيعية تقدم ملحوظا مع ظهور تقنيات التعلم العميق وتأتي مهمة تلخيص النصوص مع ظهور تقنيات التعلم العميق، وتأتي مهمة تلخيص النصوص إلى جوار غيرها من المهمات، كترجمة النصوص وتحليل المشاعر في النص، كأحد هذه المهمات التي تم توظيف نماذج الشبكات العصبونية العميقة لتطوير نتائجها. تخضع الطرق الجديدة في تلخيص النصوص إلى إطار عمل سلسلة لسلسلة (sequence-to-sequence) من نوع مرمز-مفكك ترميز (encoder-decoder) المكون من شبكات عصبية عميقة والتي تستفيد من البيانات الضخمة في تحسين نتائجها. تم تدعيم هذه الشبكات بآلية الانتباه (attention mechanism)، والتي تستطيع التعامل مع النصوص الطويلة بكفاءة أعلى من خلال تحديدها لمواضع التركيز في النص. نستعرض في هذا البحث التطورات المختلفة التي طرأت على إطار العمل السابق، ونقوم بتجربتها على اللغة العربية التي لم تشهد تطبيق هذا الإطار في التلخيص من قبل، وذلك بعد بنائنا لمجموعة بيانات مناسبة لهذا الغرض، ثم نبين التقدم الحاصل على النموذج الأولي بعد دمجه مع آلية جديدة هي آلية النسخ (copy mechanism) من المصدر إلى التلخيص مباشرة، وذلك بمقارنة نتائج التلخيص للنموذجين باستخدام المقياس ROUGE، حيث وجدنا أن إضافة هذه الآلية أدت إلى تحسن ملحوظ في النتائج.
روابط وملفات
التعريف والنوع
- رقم الوثيقة
- fae0cc60-6516-455a-a4e2-a258612abdc0
- رقم العقد
- 0
- نوع الوسائط
- Crawler
- نوع المحتوى
- الرسائل العلمية
- صيغة المصدر
- رسائل ماجيستير
- نوع الملف
- pdf text
- أسماء الملفات
- 841085_1.pdf
بيانات النشر
- ترجمة العنوان
- Arabic Text Summarization Based on Deep Learning and Big Data
- ألقاب المؤلفين
- [{"name_ar":"محمد سعيد الدسوقي","title_ar":"اشراف","title_en":"Supervision"},{"name_ar":"ملهم محمد منير المالح","title_ar":"اعداد","title_en":"Preparation"}]
- اللغة
- Arabic
المصدر والدورية
- اسم المصدر
- تلخيص النصوص العربية المعتمد على التعلم العميق والمعطيات الكبيرة
المحتوى والصفحات
- عدد الصفحات
- 0
- ترجمة الملخص
- Natural language processing has witnessed remarkable progress with the advent of deep learning techniques. Text summarization task, along with others like text translation and sentiment analysis for text, is one of those tasks that used deep neural network models to enhance their results. The new methods of text summarization are subject to a sequence-to-sequence framework of encoder-decoder model, which is composed of neural networks trained jointly on both input and output. Deep neural networks take advantage of big datasets to improve their results. Attention mechanism, which can handle long texts more efficiently by identifying positions of focus in the text, among others, are used to improve these networks. In this study, we reviewed the different techniques and mechanisms implemented with the sequence-to-sequence framework on text summarization, and we re-implemented these mechanisms on the Arabic language, which has not seen the applications of this framework in this domain before. After building a suitable dataset for this study, we built two models: the base one that consists of attention and coverage mechanisms, and an enhanced one that adds a copy mechanism to the base model. By comparing the summarization results of these two models using the ROUGE scale, we found that the addition of the copy mechanism led to a remarkable improvement in the results.
- كلمات الباحثين
- تلخيص النصوص، التعلم العميق، الشبكات العصبونية، آلية الانتباه، آلية النسخ، اللغة العربية، المرمز المفكك، مقياس ROUGE
إشراف وإعداد
- الإشراف
- محمد سعيد الدسوقي
- الإعداد
- ملهم محمد منير المالح
الاقتباسات الببليوغرافية
APA
MLA