|
所在平台: Udemy |
课程主页: https://www.udemy.com/course/c-sharp-dot-net-web-scraping/
课程评论:没有评论
课程名称:C# .NET - Web Scraping dla każdego 课程概述: 在本课程中,我将向您介绍使用C#语言及HtmlAgilityPack库进行网页爬取(Web Scraping)的技术。网页爬取是一种从网站提取数据的技术,替代了手动重复输入或复制粘贴的数据处理方式。此外,所获取的数据通常以结构化格式存储。如今,网页爬取得到了广泛应用,主要用途包括: - 比较价格以找到最便宜的优惠(如Ceneo网站); - 企业可获取竞争对手的产品信息; - 收集潜在客户的信息(无论是个人还是其他公司); - 招聘网站可以从其他来源获取新的职位信息; - 房地产网站可以提取关于新投资项目的数据。 网页爬取是如何工作的? 进行网页爬取时,实际上是在编写代码,该代码向所指定的网站所在的服务器发送请求。我们的代码会获取页面的源代码,类似于浏览器的操作。不同的是,它不会显示页面,而是过滤页面中的HTML元素,并提取我们指定的内容。例如,假设我们希望提取所有在H3标签中的标题(例如“所以网页爬取是如何工作的”这个标题),我们可以编写相应的代码,向服务器请求该网站的内容并进行下载。然后,代码会在HTML代码中搜索H3标签。每当找到一个H3标签时,它会复制标签内的文本并以我们指定的格式显示出来。 重要的是需要记住,从服务器的角度来看,通过爬虫发送请求和在浏览器中加载页面是相同的。当我们使用代码发送这些请求时,通常会比普通用户更快地打开网页,这样就能快速消耗网站拥有者的服务器资源。
W tym kursie, przedstawię Ci technikę Web scrapingu, wykorzystując język C# i bibliotekę HtmlAgilityPackCzym jest web scraping?Web Scraping to technika wyodrębniania danych ze stron internetowych, która zastępuje ręczne, powtarzalne wpisywanie lub kopiowanie i wklejanie. Dodatkowo pozyskane dane często są przechowywane w ustrukturyzowanym formacie. Obecnie skrobanie stron internetowych jest szeroko stosowane i ma wiele zastosowań, między innymi:porównywanie cen w celu znalezienia najtańszej oferty (portal ceneo),firmy mogą pobierać informacje odnoście produktów swojej konkurencji,można pobierać informacje o potencjalnych klientach (osoby fizyczne lub inne firmy),portale agregujące oferty o prace mogą pobierać informacje o nowych ofertach pracy z innych źródeł,portale o nieruchomościach mogą pobierać dane o nowo powstałych projektach inwestycyjnych,Jak działa web scraping?Skrobiąc (scraping) stronę internetową, tak naprawdę piszemy kod, który wysyła żądanie do serwera, na którym znajduje się wskazana przez nas strona. Ogólnie nasz kod co napisaliśmy pobiera kod źródłowy strony, dokładnie tak samo jak robiłaby to przeglądarka. Zamiast jednak wyświetlać stronę, filtruje ją w poszukiwaniu elementów HTML, które określiliśmy, i wyodrębnia zawartość, którą poleciliśmy wyodrębnić.Na przykład, gdybyśmy chcieli pobrać wszystkie tytuły zawarte w tagach H3 (np. ten tytuł „Więc jak działa web scraping" ma taką wielkość) z tej strony z artykułem, moglibyśmy napisać odpowiedni kod. Nasz kod zażądałby zawartości witryny z serwera i ją pobrał. Następnie przeszukiwał kod HTML strony w poszukiwaniu tagów H3. Za każdym razem, gdy znalazł tag H3, kopiował tekst znajdujący się wewnątrz tagu i wyświetlał go w dowolnym określonym przez nas formacie.Pamiętaj o tym, że z punktu widzenia serwera żądanie strony za pomocą scrapingu jest tym samym, co załadowanie jej w przeglądarce internetowej. Kiedy używamy kodu do przesyłania tych żądań, najczęściej otwieramy strony znacznie szybciej niż zwykły użytkownik, a tym samym szybko możemy pochłaniać zasoby serwera właściciela witryny.