|
所在平台: Coursera |
课程主页: https://www.coursera.org/learn/limpieza-de-datos-para-el-procesamiento-de-lenguaje-natural
课程评论:没有评论
课程名称:针对自然语言处理的数据清理 概述:本课程将为您提供从多种数据源中提取、清理和准备数据的必要知识,以便在自然语言处理(NLP)过程中使用。参与本课程需要具备基础到中级的编程知识,最好具备Python的基础知识,同时建议您了解Anaconda环境中的Jupyter Notebook。 在开发应用程序时,将使用Python 3.6或更高版本。您也可以选择在Anaconda环境中使用相同版本的Python。课程中的代码示例将主要在Anaconda Notebook中编辑,但学生也可以使用其他能够识别Anaconda Notebook的文本编辑器。为顺利完成课程,需安装以下库:NLTK、Pandas、Scikit-learn及数据提取相关库。 课程大纲: 1. **网页抓取与自然语言处理**:本模块将使您了解如何构建一个从HTML网页提取数据的程序。 2. **HTML解析与自然语言处理**:本模块描述了一系列预处理HTML页面和提取信息的步骤,并详细介绍了不同的处理方法。 3. **高级抓取技术**:本模块介绍从构建使用多种JavaScript库的HTML页面中提取数据的高级抓取技术。 4. **文本处理技术**:在提取了HTML页面的文本后,本模块将展示如何整合来自PDF、DOC、XLS和图像等不同类型数据源的信息,并统一为一个文档集合。 通过本课程,您将掌握多种数据清理和预处理技术,为自然语言处理项目奠定基础。
Name:Web Scraping para Procesamiento de Lenguaje Natural
Description:Este módulo te permitirá obtener los conocimientos necesarios para la construcción de un programa de extracción de datos de páginas Web basadas en HTML.
Name:HTML Parsing para Procesamiento de Lenguaje Natural
Description:En este módulo se describen un conjunto de pasos necesarios para el pre procesar páginas HTML y extraer información de ellas. Además, se detallarán distintos tipos de aproximación al mismo.
Name:Técnicas avanzadas de Scraping
Description:En este módulo se presentarán las técnicas avanzadas de scraping para extracción de datos de páginas HTML que utilizan diversas librerías de JavaScript para su construcción
Name:Técnicas de Manipulación de texto
Description:Una vez estriado el texto de las paginas HTML que es una fuente habitual de extracción de información, se pueden sumar distintas fuentes de tipos de datos, como ser PDF, DOC, XLS e imágenes. En este módulo se verán diversas técnicas que pueden servir para recolectar la información de ellas y unificarlas en un mismo conjunto de documentos.
Este curso te brindará los conocimientos necesarios para la extracción, limpieza y preparación de distintas fuentes de datos para ser incluidos en un proceso de NLP. Para realizar este curso es necesario contar con conocimientos de programación de nivel básico a medio, deseablemente conocimiento básico del lenguaje Python y es recomendable conocer el entorno de Jupyter Notebooks del entorno Anaconda. Para desarrollar aplicaciones se va a utilizar Python 3.6 o superior. Alternativamente se puede utilizar el entorno de Anaconda con la misma versión de Python. Como editor de código, los ejemplos van a ser editados en el Notebook de Anaconda, pero el alumno puede utilizar cualquier editor de texto que reconozca notebooks de Anaconda. Librerías que es necesario tener instaladas para realizar el curso: NLTK, Pandas, Scikit-learn y librerías de extracción de datos.