Python爬虫知识点——爬虫的基本原理-白红宇

Python爬虫知识点——爬虫的基本原理

阅读量：6000 次

发布时间：2019-06-20

本文共 418 字，大约阅读时间需要 1 分钟。

爬虫的基本原理

爬虫就是获取网页并提取和保存信息的自动化程序

获取网页：

获取网页就是获取网页的源码，只要把源码获取下来，就可以从中提取想要的消息

爬虫的流程：想网站的服务器发送一个请求，返回的响应体就是网页的源代码。

==>1,构造请求发送给服务器===>2.接受响应并解析

提取信息：

通过分析网页结构，提取网页信息。通常使用的解析库有:BeautifulSoup、lxml、pyquery，也可以使用正则，但是构造正则表达式比较复杂且易错

保存数据：

将提取的数据保存到某处以便后续利用。保存形式有：TXT、Json、数据库：MySQL、MongoDB、或远程服务器SFTP...

自动化程序

替人完成完成爬取工作的自动化程序，可以在抓取过程中进行异常处理……保证爬取的高效运行

文章摘自崔庆才的《Python3网络爬虫开发实战》

转载于:https://www.cnblogs.com/nymrli/p/9387727.html

你可能感兴趣的文章

Springboot2 之 Spring Data Redis 实现消息队列——发布/订阅模式

查看>>

基于注解的Spring AOP的配置和使用

jquery取select中选中的option值

使用XMLHttpRequest执行Ajax请求

angularjs Service vs provider vs factory