|
所在平台: Udemy |
课程主页: https://www.udemy.com/course/ihwpcrwb/
课程评论:没有评论
课程名称:ihwpcrwb 课程概述: 本课程将介绍信息检索(Information Retrieval, IR)的概念,将其定义为根据用户特定查询检索相关信息的过程。信息检索需要从非结构化数据(如文本、音频或图像)中提取相关信息。 与文本信息检索特别相关的问题是,检索到的文件通常仅基于查询词与文档中词语的精确匹配。这常常导致丢失那些包含与查询词同义词或关联词的文件,而这些文件可能对用户更有价值。这种困境在许多数据检索系统中普遍存在,尤其是在处理阿拉伯语文本时。 本课程将教授如何使用词频-逆文档频率(TF-IDF)算法,并将其应用于阿拉伯语文本。TF-IDF 算法通过确定词语在所有文档中的重要性来工作,词语的出现频率决定了其在特定文档中的重要性。课程还将强调该算法在机器学习中的重要性,尤其是在数据分析和决策制定方面。该算法易于应用于阿拉伯语语料库,无论数据量大小如何。 学完本课程后,学员将能够处理阿拉伯语文本,并将 TF-IDF 算法应用于任何其他文本语料库。
في هذه الدورة سوف نتعرف علي ماهو استرجاع المعلومات على أنّه عمليّة استرجاع المعلومات ذاتِ العلاقة، بناءً على استعلامٍ معيّن من قِبل مستخدمٍ ما، و إنّ ذلك يتطلّب استخلاص هذه المعلومات ذاتِ الصّلة من بياناتٍ غيرِ مُهيكلة قد تكون نصوصاً أو صوتاً أو صوراً.وفي هذا السّياق فإنّ من أهمّ المشاكل التي تواجهها استرجاع المعلومات وبصورة خاصّة النصّيّة منها، هو أنّ الملفّاتِ المُسترجعة تعتمد صيغةَ التّطابق الفعليّ للكلمة أو الكلمات الموجودة في الاستعلام، والبحث عن نفس الكلمات في الملفّات المعيّنة، وذلك يؤدّي في أغلب الحالات إلى فقدان تلك الملفّات التي تحتوي على مصطلحاتٍ مرادفة لتلك الموجودة في الاستعلام المعيّن، والتي قد تكون أكثر فائدةً للمستخدم، ومن المُلاحظ أنّ هذه المُعضلة تظهر في أغلب أنظمة استرجاع البيانات بأغلب اللّغات وخاصّة اللّغة العربيّة.سوف نتعلم في هذه الدورة على طريقة استخدام خوارزميّة تردّد الكلمة-تردّد المستند العكسيّ وتطبيقها على النّصوص العربيّة، والتي تعتمد على تحديد أهميّة الكلمات في كلّ النّصوص، هذا وإنّ نسبةَ ظهور تلك الكلمة هو ما يحدّد أهميّة الكلمة في النّص المعيّن، بالإضافة إلى أهميّة هذه الخوارزميّة في برامج تعلّم الآلة وذلک في عمليّات تحليل البيانات واتّخاذ القرارات، ومن السّهل تطبيقها على الدّيوان النّصيّ العربيّ مهما كبرت حجم البيانات.سوف يكون الدارس قادرا علي التعامل مع النصوص باللغة العربية وتطبيق خوارزمية تردد المستند-تردد المستند العكسي علي أي ديوان نصي اخر.