Python爬虫入门教程 54-100

爬虫入门教程 Python 2023-01-31 00:01:39 288人浏览独家记忆

Python 官方文档：入门教程 => 点击学习

摘要

爬虫背景爬虫最核心的问题就是解决重复操作，当一件事情可以重复的进行的时候，就可以用爬虫来解决这个问题，今天要实现的一个基本需求是完成“博客园“ 博客的自动评论，其实原理是非常简单的，提炼一下需求基本需求登录博客园<不实现，登

爬虫背景

爬虫最核心的问题就是解决重复操作，当一件事情可以重复的进行的时候，就可以用爬虫来解决这个问题，今天要实现的一个基本需求是完成“博客园“ 博客的自动评论，其实原理是非常简单的，提炼一下需求

基本需求

登录博客园<不实现，登录单独编写博客>
调用评论接口
返回请求结果

确定流程之后，基本就是找突破口的环节了

实际的去评论一下，然后不管你用什么抓包工具都可以，只要抓取到你想要的数据，即可

评论api如下

Request URL: https://www.cnblogs.com/mvc/PostComment/Add.aspx
Request Method: POST

POST URL 有了，下面就是参数的问题

我随便找了一个请求的参数

{"blogApp":"wuxiaobin","postId":10510784,"body":"继续研究","parentCommentId":0}

分析参数

blogApp 是博主的用户昵称
postid 是博文的ID
body 评论主体
parentCommentid 看参数命名知道应该是指的回复的那条ID

分析到这里，你就可以开始模拟请求了，一般情况下是不成功的，因为我们没有登录，不过，代码先写起来

观察请求头参数

请求头基本包含一些用户信息，必备部分如下，剩下的就是cookies部分了

origin: Https://www.cnblogs.com
referer: https://www.cnblogs.com/
user-agent: Mozilla/5.0 (windows NT 10.0; WOW64) 
x-requested-with: XMLHttpRequest

编写代码

import requests
import JSON

class CnBlogs(object):

    def __init__(self):
        self._url = "https://www.cnblogs.com/mvc/PostComment/Add.aspx"


    def run(self):
        params = {
            "blogApp":"wuxiaobin",  # 博主ID
            "postId":10510784, # 评论博文的ID
            "body":"继续研究b",  # 评论内容
            "parentCommentId":0}
        headers = {
            "origin": "https://www.cnblogs.com",
            "referer": "https://www.cnblogs.com/",
            "user-agent": "浏览器UA",
            "x-requested-with": "XMLHttpRequest",
            "cookie":".CNBlogsCookie=重要参数;"
        }
        res = requests.post("https://www.cnblogs.com/mvc/PostComment/Add.aspx",data=params,headers=headers)
        print(json.loads(res.text))


if __name__ == '__main__':
    cnblogs = CnBlogs()
    cnblogs.run()

重要提示

经过我的测试，发现判断博客园用户是否登录，关键的是cookie 这个在我之前的博客有涉及，2种写法，重点是你如何去获取，一般情况下，手动获取即可

登录采用的是人机识别验证，这个我单独写一篇博文去研究，目前阶段，你手动获取即可

博客园验证码
其他的参数，在加载博客的时候，就可以用网页解析相关的知识解析出来，没有难度

如何你想要做成全自动化的，也可以，只需要控制发帖时间随机，发帖内容随机即可，加上一个时间戳也是一个非常不错的解决方案

发帖成功

测试中一定要解析返回的JSON字符串，确定里面的成功和异常信息

{
  'IsSuccess': True,
  'Message': '<div class="comment_my_posted">... ...</div>',
  'Duration': '171'
}

博客园自动评价Over

所有网站的评论原理是相通的，你可以自行研究掘金，CSDN，简书等各种文章类平台，自动评论需要的是大量的用户，动态的IP，其余都不是问题~ 本文章仅供学习，切勿用于恶意用途。

您可能感兴趣的文档:

点击免费下载>>软考高级考试备考技巧/历年真题/备考精华资料

--结束END--

本文标题: Python爬虫入门教程 54-100

本文链接: https://www.lsjlt.com/news/181592.html(转载时请注明来源链接)

有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

本篇文章演示代码以及资料文档资料下载

下载Word文档到电脑，方便收藏和打印～

下载Word文档

去做题

猜你喜欢

Python爬虫入门教程 54-100

爬虫背景爬虫最核心的问题就是解决重复操作，当一件事情可以重复的进行的时候，就可以用爬虫来解决这个问题，今天要实现的一个基本需求是完成“博客园“ 博客的自动评论，其实原理是非常简单的，提炼一下需求基本需求登录博客园<不实现，登...

99+

2023-01-31

爬虫入门教程 Python
Python爬虫入门教程 37-100

爬前叨叨 2019年开始了，今年计划写一整年的博客呢~，第一篇博客写一下一个外包网站的爬虫，万一你从这个外包网站弄点外快呢，呵呵哒数据分析官方网址为 https://www.clouderwork.com/ 进入全部项目列表页面...

99+

2023-01-30

爬虫入门教程 Python
Python爬虫入门教程 10-100

图虫网-写在前面经历了一顿噼里啪啦的操作之后，终于我把博客写到了第10篇，后面，慢慢的会涉及到更多的爬虫模块，有人问scrapy 啥时候开始用，这个我预计要在30篇以后了吧，后面的套路依旧慢节奏的，所以莫着急了，100篇呢，预计4~5个...

99+

2023-01-30

爬虫入门教程 Python
Python爬虫入门教程 18-100

很高兴我这系列的文章写道第18篇了，今天写一个爬虫爱好者特别喜欢的网站煎蛋网http://jandan.net/ooxx，这个网站其实还是有点意思的，网站很多人写了N多的教程了，各种方式的都有，当然网站本身在爬虫爱好者的不断进攻下，也在...

99+

2023-01-30

爬虫入门教程 Python
Python爬虫入门教程 20-100

美好的一天又开始了，今天咱继续爬取IT在线教育类网站，慕课网，这个平台的数据量并不是很多，所以爬取起来还是比较简单的打开我们要爬取的页面，寻找分页点和查看是否是异步加载的数据。进行了一些相应的分析，发现并没有异步数据，只需要模...

99+

2023-01-30

爬虫入门教程 Python
Python爬虫入门教程 47-100

1. 准备下载软件介绍一款爬虫辅助工具mitmproxy ，mitmproxy 就是用于MITM的proxy,MITM中间人攻击。说白了就是服务器和客户机中间通讯多增加了一层。跟Fiddler和Charles最大的不同就是，mitmpr...

99+

2023-01-30

爬虫入门教程 Python
Python爬虫入门教程 59-100

图片比对昨天的博客已经将图片存储到了本地，今天要做的第一件事情，就是需要在两张图片中进行比对，将图片缺口定位出来缺口图片完整图片计算缺口坐标对比两张图片的所有RBG像素点，得到不一样像素点的x值，即要移动的距离 de...

99+

2023-01-31

爬虫入门教程 Python
Python爬虫入门教程 62-100

学术搜索学习理论的知识少不了去检索文献，好多文献为你的实操提供了合理的支撑，我所在的大学内网默认是有知网账户的，非常NICE 今天要完成的网站是 http://ac.scmor.com/ Google学术搜索是一个文献检索服务，目前主...

99+

2023-01-31

爬虫入门教程 Python
Python爬虫入门教程 41-100

爬前叨叨从40篇博客开始，我将逐步讲解一下手机APP的爬虫，关于这部分，我们尽量简化博客内容，在这部分中可能涉及到一些逆向，破解的内容，这部分尽量跳过，毕竟它涉及的东西有点复杂，并且偏离了爬虫体系太远，有兴趣的博友，可以一起研究下。之...

99+

2023-01-30

爬虫入门教程 Python
Python爬虫入门教程 40-100

爬前叨叨第40篇博客吹响号角，爬取博客园博客~本文最终抓取到了从2010年1月1日到2019年1月7日的37W+文章，后面可以分析好多东西了呢经常看博客的同志知道，博客园每个栏目下面有200页，多了的数据他就不显示了，最多显示4000...

99+

2023-01-30

爬虫入门教程 Python
Python爬虫入门教程 19-100

从今天开始的几篇文章，我将就国内目前比较主流的一些在线学习平台数据进行抓取，如果时间充足的情况下，会对他们进行一些简单的分析，好了，平台大概有51CTO学院，CSDN学院，网易云课堂，慕课网等平台，数据统一抓取到mongodb里面，如果...

99+

2023-01-30

爬虫入门教程 Python
Python爬虫入门教程 21-100

今天咱们抓取一下网易云课堂的课程数据，这个网站的数据量并不是很大，我们只需要使用requests就可以快速的抓取到这部分数据了。你第一步要做的是打开全部课程的地址，找出爬虫规律，地址如下： https://study.163.com...

99+

2023-01-30

爬虫入门教程 Python
Python爬虫入门教程 45-100

1. Charles抓取兔儿故事背景介绍之前已经安装了Charles，接下来我将用两篇博客简单写一下关于Charles的使用，今天抓取一下兔儿故事里面关于小猪佩奇的故事。爬虫编写起来核心的重点是分析到链接，只要把链接分析到，剩下的就好...

99+

2023-01-30

爬虫入门教程 Python
Python爬虫入门教程 52-100

写在前面关于获取文章自动发送到邮箱，这类需求其实可以写好几个网站，弄完博客园，弄CSDN，弄掘金，弄其他的，网站多的是呢~哈哈先从博客园开始，基本需求，获取python板块下面的新文章，间隔60分钟发送一次，时间太短估摸着没有多少新博...

99+

2023-01-30

爬虫入门教程 Python
Python爬虫入门教程 15-100

石家庄政民互动数据爬取-写在前面今天，咱抓取一个网站，这个网站呢，涉及的内容就是网友留言和回复，特别简单，但是网站是gov的。网址为 http://www.sjz.gov.cn/col/1490066682000/index.html...

99+

2023-01-30

爬虫入门教程 Python
Python爬虫入门教程 25-100

1. 知乎文章图片写在前面今天开始尝试爬取一下知乎，看一下这个网站都有什么好玩的内容可以爬取到，可能断断续续会写几篇文章，今天首先爬取最简单的，单一文章的所有回答，爬取这个没有什么难度。找到我们要爬取的页面，我随便选了一个 https...

99+

2023-01-30

爬虫入门教程 Python
Python爬虫入门教程 32-100

1. B站博人传评论数据爬取简介今天想了半天不知道抓啥，去B站看跳舞的小姐姐，忽然看到了评论，那就抓取一下B站的评论数据，视频动画那么多，也不知道抓取哪个，选了一个博人传跟火影相关的，抓取看看。网址： https://www.bilib...

99+

2023-01-30

爬虫入门教程 Python
Python爬虫入门教程 36-100

爬前叨叨 2018年就要结束了，还有4天，就要开始写2019年的教程了，没啥感动的，一年就这么过去了，今天要爬取一个网站叫做酷安，是一个应用商店，大家可以尝试从手机APP爬取，不过爬取APP的博客，我打算在50篇博客之后在写，所以现在就放...

99+

2023-01-30

爬虫入门教程 Python
Python爬虫入门教程 44-100

1. 第二款抓包工具Charles安装与使用 Charles和Fiddler一样，也是一款抓包工具，比Fiddler界面更加清晰，支持多平台 1.1 官方网址 https://www.charlesproxy.com/ 1.2 下载地址...

99+

2023-01-30

爬虫入门教程 Python
Python爬虫入门教程 46-100

1. 手机收音机-爬前叨叨今天选了一下，咱盘哪个APP呢，原计划是弄荔枝APP，结果发现竟然没有抓到数据，很遗憾，只能找个没那么圆润的了。搜了一下，找到一个手机收音机下载量也是不错的。 2. 爬虫套路爬虫基本套路抓包获取链接 ...

99+

2023-01-30

爬虫入门教程 Python