|
所在平台: Udemy |
课程主页: https://www.udemy.com/course/web-scraping-scraper-nimporte-quel-site-web-avec-node-js/
课程评论:没有评论
课程名称:网络爬虫:使用 Node.js 爬取任何网站 课程概述: 欢迎来到本课程,本课程将向您介绍网络爬虫的基本概念。网络爬虫是一种从网站中提取内容(数据)的技术,通常通过脚本或程序来实现,以便将提取的数据转换并用于其他环境。课程中将介绍一些实际应用示例,例如搜索引擎优化(SEO),您可以利用数据创建 API,并将数据展示在其他网站上。 在本课程中,您将学习如何使用 Node.js 和 Puppeteer 库来爬取任何网站。Puppeteer 是一个 Node.js 库,允许您以无头模式控制 Chrome 浏览器。该库可以用于多种操作,包括: - 生成截图和 PDF - 爬取网站内容 - 自动填写表单 - 创建自动化测试 - 自动化测试用户界面 课程将由基础内容开始,您首先将学习如何从单个网页中提取信息,然后逐步扩展至如何从多个页面中提取数据。您将能够处理不同网站的分页问题,以提取所有相关数据。最后,您将学习如何将提取的数据以不同格式保存。 课程结束时,您将掌握以下技能: - 从任何网页中提取信息 - 从同一网站的多个页面中提取信息 - 管理网站的分页,以便能够完整提取信息,采用两种方法 - 将信息以不同格式存储,例如 Xls 和 Json。
Bienvenue dans ce cours sur le web scraping. web scraping c'est quoi ? - technique d'extraction du contenu (des données) de sites Web, Comment ? - via un script ou un programme Pourquoi ? - dans le but de le transformer pour permettre son utilisation dans un autre contexte.Exemples:- par exemple le référencement- on peut utiliser ces données pour créer une api, et les afficher sur un autre site par exemple. Dans ce cours vous allez apprendre à scraper n'importe quel site web grâce à node js et la librairie puppeteer.Puppeteer est une librairie Node Js qui permet de controller un navigateur chrome en headless. Cette librairie peut être utilisée pour différentes actions comme: - Générer des screen shots et des pdf- Scraper le contenu de sites web- Automatiser le remplissage de formulaire- Créer des tests automatisés- Tester des interface UI de manière automatiséDans un premier temps vous saurez récupérer les informations sur une seule page web, puis nous verrons comment récupérer les données sur plusieurs pages. Vous serez en mesure de gérer la pagination de différents sites web afin de récupérer toutes les données. Vous serez enfin en mesure d'enregistrer ces données sous différents formats. A la fin de ce cours vous saurez: - Récupérer les informations de n'importe quel page web- Récupérer les informations de plusieurs pages web d'un même site - Gérer la pagination des sites afin de pouvoir récupérer l'intégralité des informations sur le site via deux méthodes - Stockez les informations sous différents formats à savoir ici Xls et Json.