|
所在平台: Udemy |
课程主页: https://www.udemy.com/course/natural-language-processing-pratico/
课程评论:没有评论
课程名称:Python自然语言处理:完整课程 课程概述: 自然语言处理(NLP)是Google搜索和Google翻译的核心技术,也是Siri、Alexa、Google助手等虚拟助手的语音基础。在本课程中,我们将学习自然语言处理的秘诀,并将其应用于实际问题,如: - 使用scikit-learn进行电影评论情感分析 - 使用Gensim自动将新闻文章按主题进行分组 - 使用Keras和TensorFlow创建客户服务聊天机器人 - 使用Keras和TensorFlow的循环神经网络生成类似但丁·阿利基埃里的新文本 课程的第一部分将介绍如何从TXT、CSV、PDF和Word等不同类型的文件中提取文本。同时,我们将学习如何使用BeautifulSoup进行网页抓取。课程将简要介绍正则表达式的工作原理及其在自然语言处理中的应用。 第三部分主要集中在预处理技术上:包括提取tokens、去除停用词、词干提取和词形还原,以减少词典的大小。在此部分中,我们将使用两种流行的Python自然语言处理库:NLTK(自然语言工具包)和Spacy(为工业应用开发的较新库)。 接下来的部分将探讨文本文档编码的两种主要模型:词袋模型和TF*IDF,我们将用Numpy从零实现它们。在第五部分,学习如何使用NLTK和Spacy对文本文件进行分析,包括词性标注和命名实体识别。此外,我们将介绍情感分析和机器学习,学习如何使用VADER模型从Alexa技能的真实评论中提取情感,并从头开始预处理IMDB影评数据集,通过回归模型建立情感分析。 第六部分专注于主题建模,介绍潜在狄利克雷分配(LDA)算法,并进行两个练习。我们将利用包含9000篇纽约时报文章的数据集提取主题,并实现LDA算法。接下来,我们将使用Gensim和一个包含一百万篇新闻标题的数据集进行主题建模。 随后将深入探讨深度学习和人工神经网络,了解其工作原理及如何创建Miao Mobile的客户服务聊天机器人,采用Keras和TensorFlow这两个流行的深度学习框架。 最后一部分将探讨循环神经网络及其在NLP中的应用,重点介绍Vanilla RNN、长短期记忆(LSTM)和门控循环单元(GRU)。我们将使用LSTM架构生成具有但丁·阿利基埃里风格的新文本,以《神曲》作为文本语料库。 课程结束时,将提供一系列建议、阅读材料和练习,以帮助继续在自然语言处理领域的探索。
Il Natural Language Processing è il cuore di Google Search e Google Translate ed è la tecnologia che da la voce a Siri, Alexa, Google Assistant e tutti gli altri assistenti virtualiIn questo corso apprenderemo i segreti Natural Language Processing e impareremo ad utilizzarlo su problemi reali come:Eseguire l'analisi del sentiment su recensioni di film usando scikit-learnRaggruppare automaticamente articoli di giornale in base all'argomento usando GensimCreare un Chatbot per la customer care usando Keras e TensorflowGenerare del nuovo testo in stile Dante Alighieri usando le Reti Neurali Ricorrenti con Keras e Tensorflow.Nella prima sezione del corso vedremo come estrarre il testo da diverse tipologie di file come file TXT, CSV, PDF e file Word, in seguito impareremo come eseguire lo scraping di una pagina web usando BeautifulSoup.Vedremo in sintesi il funzionamento delle espressioni regolari e come possiamo sfruttarle nel Natural Language Processing.La terza sezione è interamente dedicata alle tecniche di preprocessing del corso: estrazione dei tokens, rimozione dello stopwords e stemming e lemmatizzazione, che ci permettono di ottenere la radice di una parola in modo da ridurre la dimensione del nostro dizionario, in questa sezione useremo le due più popolari librerie Python per il Natural Language Processing: NLTK (Natural Language Toolkit): storica libreria Python con moltissime funzioni.Spacy: una libreria più recente sviluppata per essere utilizzata a livello industriale.Continueremo il corso con i due principali modelli per l'encoding di documenti di testo, il modello Bag of Words e il TF*IDF, impareremo ad implementarli da zero, usando soltanto Numpy, una libreria Python per il calcolo scientifico.Nella quinta sezione osserveremo come eseguire l'analisi del testo di un documento di testo usando sempre NLTK e Spacy, evidenziando:La parte del discorso (Part of Speech Tagging) Il tipo di entità (Named Entity Recognition)Nella quinta sezione introdurremmo la sentiment analysis e parleremo di machine learning, il campo dell'intelligenza artificiale che ha rivoluzionato l'intero settore. Vedremo come estrarre il sentiment da un elenco di recensioni reali di una skill Alexa usando il modello VADER ed impareremo a preprocessare da zero l'IMDB Movie Reviews Dataset per poi eseguire la sentiment analysis creando un modello di regressione logistica con scikit-learn, la più popolare libreria python per il machine learning, e un modello bayesiano usando NLTK.La sesta sezione è dedicata al Topic Modelling, dopo aver introdotto l'argomento insieme all'algoritmo Latent Dirichlet Allocation svolgeremo due esericizi:Sfrutteremo un dataset con circa 9000 articoli del New York Times per estrarre i topic e raggruppare insieme articoli che trattano di un'argomento comune, a questo scopo implementeremo l'algoritmo Latent Dirichlet Allocation usando scikit-learn.Eseguiremo il Topic Modelling usando un dataset di un milione di titoli di giornale dell'ABC, usando sempre l'algoritmo Latent Dirichlet Allocation ma questa volta con Gensim, una libreria Python specifica per il Topic Modelling.Nella sezione che segue ci butteremo su Deep Learning e Reti Neurali Artificiali, studiando come queste funzionano e come possono essere applicate per la creazione di un Chatbot per l'assistenza clienti di un fantomatico operatore telefonico chiamato Miao Mobile, usando i due più popolari framework Python per il deep learning: Keras e Tensorflow.Nell'ultima sezione parleremo di Reti Neurali Ricorrenti e di come vengono applicate a problemi di NLP, vedremo insieme le principali architetture: Vanilla RNNLong short-term memory (LSTM)Gated Recurrent Unit (GRU)Come esercizio pratico utilizzeremo l'architettura LSTM per generare nuove testo con lo stile di scrittura di Dante Alighieri, usando come corpus di testo l'intera Divina Commedia.Concluderemo il corso con una serie di consigli, letture ed esercizi per poter continuare la nostra avventura nel Natural Language Processing.