Corpus Construction for Arabic Question Answering Subjectivity Classification
Bellaouar Slimane, Mounia Bouameur, Nehar Attia , Soumia Souffi
كلية العلوم والتكنولوجيا-جامعة غرداية · الجزائر
الموضوعات
علوم تطبيقية وتكنولوجية
الملخص
Subjectivity and sentiment analysis, have gained significant attention in the field of Natural Language Processing (NLP) due to their ability to extract and classify subjective information expressed in textual data. Although, extensive research has been conducted on major languages such as English, Arabic with its dialectal variations lacks sufficient resources and research in this domain. This study aims to overcome the scarcity of resources in Arabic subjectivity analysis by constructing an extensive Arabic Question-Answering (QA) corpus specifically designed for subjectivity analysis. The corpus construction involves the following steps: data collection through web scraping, and data cleaning to ensure quality, followed by the annotation process by affecting subjectivity labels using two models that we developed utilizing the fine-tuning technique with two pre-trained models, XLM-RoBERTa and AraBERT. The availability of this corpus stimulates further research, drives advancements in Arabic NLP, and contributes to various applications in sentiment analysis and opinion mining.
روابط وملفات
التعريف والنوع
- رقم الوثيقة
- 02c6ba96-6731-40b4-ac19-0e479dca442b
- رقم العقد
- 0
- نوع الوسائط
- Crawler
- نوع المحتوى
- الرسائل العلمية
- صيغة المصدر
- ماستر (LMD)
- نوع الملف
- pdf text
- أسماء الملفات
- 956356_1.pdf
بيانات النشر
- ألقاب المؤلفين
- [{"name_ar":" Bellaouar Slimane","title_ar":"اشراف","title_en":"Supervision"},{"name_ar":"Mounia Bouameur","title_ar":"اعداد","title_en":"Preparation"},{"name_ar":"Nehar Attia ","title_ar":"اشراف","title_en":"Supervision"},{"name_ar":"Soumia Souffi ","title_ar":"اعداد","title_en":"Preparation"}]
- اللغة
- English
المصدر والدورية
- اسم المصدر
- Corpus Construction for Arabic Question Answering Subjectivity Classification
المحتوى والصفحات
- عدد الصفحات
- 0
- ترجمة الملخص
- L’analyse de la subjectivité et des sentiments a suscité une attention considérable dans le domaine du traitement automatique du langage naturel (TAL) en raison de leur capacité à extraire et classifier les informations subjectives exprimées dans les données textuelles. Bien que des recherches approfondies aient été menées pour les langues principales telles que l’anglais, l’arabe, avec ses variations dialectales, manque de ressources et de recherches suffisantes dans ce domaine. Cette étude vise à surmonter le manque de ressources dans l’analyse de la subjectivité en arabe en construisant un vaste corpus de questions-réponses arabes spécifique-ment conçu pour l’analyse de la subjectivité. La construction du corpus implique l’utilisation des étapes suivantes : la collecte de données via le web scraping et le nettoyage des données pour garantir leur qualité, suivi du processus d’annotation en affectant des étiquettes de subjectivité à l’aide de deux modèles qu’on a développés en utilisant la technique de fine-tuning avec deux modèles pré-entraînés, AraBERTet XLM-RoBERTa. La disponibilité de ce corpus stimule de nouvelles recherches,favorise les avancées dans le TAL en arabe et contribue à diverses applications dans l’analyse des sentiments et l’extraction d’opinions
- كلمات الباحثين
- Subjectivity analysis, sentiment analysis, fine-tuning, AraBERT, XLMRoBERTa.
إشراف وإعداد
- الإشراف
- Bellaouar Slimane, Nehar Attia
- الإعداد
- Mounia Bouameur, Soumia Souffi
الاقتباسات الببليوغرافية
APA
MLA