首页 > 资讯 > 后端开发 > Python >使用 Python 爬取网页数据

808

分享到

使用 Python 爬取网页数据

网页数据 Python 2023-01-31 00:01:05 808人浏览八月长安

Python 官方文档：入门教程 => 点击学习

摘要

1. 使用 urllib.request 获取网页 urllib 是 python 內建的 Http 库, 使用 urllib 可以只需要很简单的步骤就能高效采集数据; 配合 Beautiful 等 html 解析库, 可以编写出用于采集

1. 使用 urllib.request 获取网页

urllib 是 python 內建的 Http 库, 使用 urllib 可以只需要很简单的步骤就能高效采集数据; 配合 Beautiful 等 html 解析库, 可以编写出用于采集网络数据的大型爬虫;

注: 示例代码使用python3编写; urllib 是 Python2 中 urllib 和 urllib2 两个库合并而来, Python2 中的 urllib2 对应 Python3中的 urllib.request

简单的示例:

2. 伪造请求头信息

有时爬虫发起的请求会被服务器拒绝, 这时就需要将爬虫伪装成人类用户的浏览器, 这通常通过伪造请求头信息实现, 如:

3. 伪造请求主体

在爬取某一些网站时, 需要向服务器 POST 数据, 这时就需要伪造请求主体;

为了实现有道词典在线翻译脚本, 在 Chrome 中打开开发工具, 在 Network 下找到方法为 POST 的请求, 观察数据可以发现请求主体中的 ‘ i ‘ 为经过 URL 编码的需要翻译的内容, 因此可以伪造请求主体, 如:

也可以使用 add_header() 方法伪造请求头, 如:

4. 使用代理IP

为了避免爬虫采集过于频繁导致的IP被封的问题, 可以使用代理IP, 如:

注: 使用爬虫过于频繁的访问目标站点会占用服务器大量资源, 大规模分布式爬虫集中爬取某一站点甚至相当于对该站点发起DDOS攻击; 因此, 使用爬虫爬取数据时应该合理安排爬取频率和时间; 如: 在服务器相对空闲的时间 ( 如: 凌晨 ) 进行爬取, 完成一次爬取任务后暂停一段时间等;

5. 检测网页的编码方式

尽管大多数网页都是用 UTF-8 编码, 但有时候会遇到使用其他编码方式的网页, 因此必须知道网页的编码方式才能正确的对爬取的页面进行解码;

chardet 是 python 的一个第三方模块, 使用 chardet 可以自动检测网页的编码方式;

安装 chardet : pip install charest

使用:

6. 获得跳转链接

有时网页一个页面需要在原始 URL 的基础上进行一次甚至多次跳转才能最终到达目的页面, 因此需要正确的处理跳转;

通过 requests 模块的 head() 函数获得跳转链接的 URL , 如

您可能感兴趣的文档:

点击免费下载>>软考高级考试备考技巧/历年真题/备考精华资料

--结束END--

本文标题: 使用 Python 爬取网页数据

本文链接: https://www.lsjlt.com/news/181904.html(转载时请注明来源链接)

有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

本篇文章演示代码以及资料文档资料下载

下载Word文档到电脑，方便收藏和打印～

下载Word文档

去做题

回答

如何调试操作系统的错误？
操作系统

2023-11-15发布

回答

操作系统中的I/O系统是如何实现的？
操作系统

2023-11-15发布

回答

如何实现操作系统的内存管理？
操作系统

2023-11-15发布

回答

什么是虚拟内存，它对操作系统有什么影响？
操作系统

2023-11-15发布

回答

ASP中的MVC架构和WebForms架构有什么区别和使用场景？
ASP.NET

2023-11-15发布

回答

ASP中的数据验证和数据校验有什么不同？
ASP.NET

2023-11-15发布

回答

ASP中的ADO对象和DAO对象有什么区别和使用方法？
ASP.NET

2023-11-15发布

回答

Node.js中的包管理器NPM是什么？如何使用它进行依赖管理？
node.js

2023-11-15发布

回答

Vue.js中的动态组件是什么？如何使用它来动态渲染组件？
VUE

2023-11-15发布

回答

如何使用Vue.js实现懒加载和预加载？
VUE

2023-11-15发布

使用 Python 爬取网页数据

本篇文章演示代码以及资料文档资料下载

使用 Python 爬取网页数据

Python实战使用Selenium爬取网页数据

如何用python爬取网页数据

Python 爬虫：如何用 BeautifulSoup 爬取网页数据

python爬虫爬取网页数据并解析数据

Python爬虫之使用BeautifulSoup和Requests抓取网页数据

python爬取网页数据到保存到csv

python爬虫爬取赶集网数据

Python爬虫之怎么使用BeautifulSoup和Requests抓取网页数据

Python 爬取网页中JavaScri

怎么使用python爬取网页图片

使用python爬取网页版QQ空间

怎么用python爬取网站数据

怎么使用python爬虫爬取数据

走好这六步，python爬虫爬取网页数据手到擒来~

Python怎么爬虫网页数据

使用python怎么爬取数据

python爬虫爬取bilibili网页基本内容

python如何爬取网页图片

python动态网页批量爬取

python分析数据的方法是什么

如何使用Python实现抽奖小程序

python copy函数的作用是什么

python进程池创建队列的方法是什么

python字符串处理与应用的方法有哪些

python全局变量如何定义

python如何读取文件夹下所有文件

python keyerror错误怎么解决

python如何提取字符串的数字

python中怎么将回车作为输入内容