|
所在平台: Udemy |
课程主页: https://www.udemy.com/course/reconnaissance-image-documents-et-ocr-avec-csharp-ml-dotnet/
课程评论:没有评论
课程名称:使用C#进行文档识别和数据提取 课程概述:本课程将教您如何创建一个智能应用程序,能够识别各种类型的文档。您将逐步学习如何训练文档分类器,并设置图像分类器和文本分类器。课程内容包括如何使用OCR文本识别库从每种文档中提取信息。具体学习内容包括: - 使用ML NET库的深度学习模块进行图像分类 - 使用ML NET库的自然语言处理模块进行文本分类 - 定义“二元”和“多类”分类器,并制定策略提高图像分类的准确性,以应对边界案例 - 集成OCR库以实现数据提取,示例使用Tesseract库,确保应用程序设计便于更换OCR库 - 开发可复用的分类Web服务,这些服务可以被任何类型的应用程序(桌面、移动、Web等)所消费 - 最后使用WPF开发完整的Windows应用程序,能够处理文档,从分类到数据提取全过程 该课程适合希望深入了解文档识别和数据提取的开发者。
Au cours de cette formation, vous apprendrez comment créer une application intelligente capable de reconnaître tout type de documents. Nous verrons dans les détails comment entraîner ce classificateur de documents pas à pas. Et pour cela nous mettrons en place un classificateur d'images ainsi qu'un classificateur de textes.Nous verrons ensuite comment extraire les informations de chaque type de documents grâce à une libraire OCR de reconnaissance de texte. Nous étudierons dans les détails:- La classification d'images avec le module de deep learning Tensorflow de la bibliothèque ML NET.- La classification textuelle avec le module de traitement de langage naturel (Natural Language Processing) de la bibliothèque ML NET.- La défintion des classificateurs "Binaires" et "Multiclasses". Nous mettrons en place une stratégie pour améliorer davantage la classification d'images pour gérer les cas limites.- L'intégration d'une bibliothèque d'OCR pour l'extraction de données. Nous prendrons l'exemple de la bibliothèque Tesseract. Nous concevrons l'application de sorte qu'il soit simple de changer de bibliothèque d'OCR.- Le développement de services Web de classifications qui seront réutilisables et consommables par n'importe quel type d'application (bureau, mobile, web etc..)- Enfin à l'aide de de windows la stack WPF, nous développerons de bout en bout une application Windows capable de gérer des documents , depuis la classification jusqu'à l'extraction de données.