博客
关于我
强烈建议你试试无所不能的chatGPT,快点击我
Python爬虫知识点——爬虫的基本原理
阅读量:6000 次
发布时间:2019-06-20

本文共 418 字,大约阅读时间需要 1 分钟。

爬虫的基本原理

爬虫就是获取网页提取保存信息自动化程序

获取网页:

获取网页就是获取网页的源码,只要把源码获取下来,就可以从中提取想要的消息

爬虫的流程:想网站的服务器发送一个请求,返回的响应体就是网页的源代码。

​ ==>1,构造请求发送给服务器===>2.接受响应并解析

提取信息:

通过分析网页结构,提取网页信息。通常使用的解析库有:BeautifulSoup、lxml、pyquery,也可以使用正则,但是构造正则表达式比较复杂且易错

保存数据:

将提取的数据保存到某处以便后续利用。保存形式有:TXT、Json、数据库:MySQL、MongoDB、或远程服务器SFTP...

自动化程序

替人完成完成爬取工作的自动化程序,可以在抓取过程中进行异常处理……保证爬取的高效运行

文章摘自崔庆才的《Python3网络爬虫开发实战》

转载于:https://www.cnblogs.com/nymrli/p/9387727.html

你可能感兴趣的文章
Springboot2 之 Spring Data Redis 实现消息队列——发布/订阅模式
查看>>
基于注解的Spring AOP的配置和使用
查看>>
怎样摆脱Linux系统菜鸟头衔
查看>>
linux如何查看文件和目录大小
查看>>
jquery取select中选中的option值
查看>>
oracle 12c 创建用户
查看>>
新生活,新起点,新希望
查看>>
spring-boot 改变自动扫描的包
查看>>
使用XMLHttpRequest执行Ajax请求
查看>>
Oracle11g使用exp导出空表
查看>>
kubernetes 学习问题记录
查看>>
Extjs甘特图的高级应用
查看>>
VML绘制WebGis地理信息
查看>>
MySQL常用命令一览
查看>>
云报表XDOC发布了
查看>>
替换war包中的文件
查看>>
angularjs Service vs provider vs factory
查看>>
每日一模式之代理模式
查看>>
PostgreSQL分页
查看>>
Hugepages
查看>>