iis服务器助手广告广告
返回顶部
首页 > 资讯 > 后端开发 > Python >Python爬虫实例爬取网站搞笑段子
  • 212
分享到

Python爬虫实例爬取网站搞笑段子

爬虫段子实例 2022-06-04 19:06:01 212人浏览 泡泡鱼

Python 官方文档:入门教程 => 点击学习

摘要

众所周知,python是写爬虫的利器,今天作者用Python写一个小爬虫爬下一个段子网站的众多段子。 目标段子网站为“Http://ishuo.cn/”,我们先分析其下段子的所在子页的url特点,可以轻易发

众所周知,python是写爬虫的利器,今天作者用Python写一个小爬虫爬下一个段子网站的众多段子。

目标段子网站为“Http://ishuo.cn/”,我们先分析其下段子的所在子页的url特点,可以轻易发现发现为“http://ishuo.cn/subject/”+数字,

经过测试发现,该网站的反扒机制薄弱,可以轻易地爬遍其所有站点。

现在利用python的re及urllib库将其所有段子扒下


import sys
import re
import urllib
#返回html格式
def gethtml(url):
  page=urllib.urlopen(url)
  html=page.read()
  return html
def getmessage(html):
  p=re.compile(r'<div class="content">(.*)</div><script type="text/javascript">')
  #对段子内容进行正则匹配
  message=re.findall(p,html)#返回正则匹配的结果
  return message
fp=open('data.txt','w+')
#实际范围比1~7000要大,因为时间原因这里暂定为1~7000
for i in range(1,7000):
  i=str(i)
  WEB=gethtml('http://ishuo.cn/subject/'+i)
  #该网站段子的链接特点
  message=getmessage(web)
  message2=''.join(message)#将结果转换为字符串类型
  #message2=message2.decode('utf8','strict')
  message2=str(message2)
  print message2
  fp.writelines(message2+'n')
  #将爬下的众多段子写入文件中
fp.close()

 data.txt收录了其中爬下段子的结果:

收录的部分结果如下:


【韩寒】明明下流的人,凑一起就叫上流社会? 
日子过不下去的时候,我就得向钱看!只有当日子过滋润了,我才能够向前看!
某公司一群基层员工年底聚会,没有加薪没有升职连年终奖金都被取消了,打算借酒浇愁一回。有人带了瓶酒来,大家一看那酒的名字,眼泪就都扑簌簌地往下掉开了,还有人顿时抱头痛哭了一场。那酒的名字叫老白干。
【段子】群里听到的段子,太乐了:路上听到一大叔情绪激动地打电话:对!国足进3个球了!没错!是男足!没错没错!是和韩国比赛!什么?对方?对对对!对方也是男足!
 
一女士向闺蜜诉说,他结婚原因:他向我求婚,我说跟我结婚,没门!我还没发昏到那程度!后来,他就用石头把我碰昏了!我就傻了,死心塌地跟他结婚了!闺蜜说:你不告他,反而跟他结婚,真是发昏了!他用什么石头碰的你呀?女士说:他用钻石!
【冷笑话】一男子提着一个皮包,挤上了公共汽车,车上人拥挤,一小偷用刀片割其皮包,窃其财物。一勇敢女子见状偷偷的提醒身边的男士,但由于紧张,说道:“先生,有人要割你的包皮”……
【段子】外交部工作:周一表示不满;周二抗议;周三强烈谴责;周四严正交涉;周五深表遗憾。周六、周日休息。
经考证孔子是经济学家,有其语为证: 三十而立--三十两银子只能站着听课; 四十不惑--四十两就能一直问到没疑问为止; 五十知天命--五十两就能知道明天考试命题; 六十耳顺--六十两老师会说你喜欢听的话,七十而从心所欲-七十两你来不来、学习的怎么样都随便了。
班车上,坐在身边的一位美女同事睡着了,竟然打起呼噜,觉得这样很丢脸,就用手轻推她,只见她喃喃的说:不要了老公,明天吧。
【太尖锐】蒙古国是个纯内陆国,却有个海军部。中国老大哥很好奇地问:”你们连海都没有,搞什么海军部!?”蒙古人回答道:”你们不也有文化部么?!”
一女程序员征婚:SELECT * FROM 男人 WHERE 未婚=true and 有房=true and 有车=true and 条件 in (‘大方','绅士','会做家务','帅气','最好还能带孩子') 一资深的程序员回复:(0 row(s) affected)
【小笑话】孔子,孟子,老子三人同时在猪圈睡了一夜之后,发现母猪怀孕了,经DNA检验证明,肯定不是孔子干的,也不是孟子干的,请问,那是谁干的?
【冷笑话】一妓深夜应召,路遇巡警,巡警大喝:谁?干什么的?女回应:妓者!巡警肃然起敬,柔和问道:那个报社的?女答:“和男晚抱”!大笑而去!
无聊的最高境界是什么?摆渡结果如下: 1、对着镜子,数自己的头发; 2、拿着剃刀等胡子长出来; 3、跟正吸你血的蚊子聊天; 4、看着天花板上的污渍,把它想成山水画; 5、给N年以前的报纸校对错别字; 6、喝一大杯水,然后坐到马桶上去等着。
【经典语录】当我要找我崇拜的人的时候,我就照镜子。 —— 李敖
看过冬奥会冰壶比赛后,一大妈逢人便说:“你看这外国奥运会的志愿者就是不一般啊,擦地每一个都擦得那么认真……”
【胡歌】我眼中的世界从未如此纯净 我的左手边是一面雪白的墙 我的右手边是一面和左手边一样的墙 我的前边有一扇门 从那里出去可以看到更多白花花的墙 虽然已是午夜时分 窗外却分外敞亮 我后边的万家灯火足以照亮此时白白的墙 我是不是疯了?
【冷笑话】:单位有个同事,蒙古人,属于常魂游天外的大神级人物。一年休假回家,假期过了好几天还不回来,领导给打电话,丫在电话里说:领导,我还在呼伦贝尔草原上骑马找我家呢,我家是游牧民族,现在不知道搬到哪里了。#搞笑#
【地名简述】一次历史考试,有一道题是让同学们任选十个国家或地区,并加以简述。 一个学生是这样答的:从前有个柬埔寨,里面有个阿拉伯。一天,他带着墨西哥去爬山,爬到新加坡时,突然来了只头上长着好望角的巴拿马,吓出一身阿富汗,拔腿跑进名古屋急忙关也门,结果碰掉了一颗葡萄牙。
【幽默说婆媳】为什么天底下最难搞的关系是婆媳关系?1.媳妇的别称是“新娘”,一个新的娘突然来到家里,旧的娘心里能好受吗?2.婆婆用了五年的时间教会儿子穿衣服,媳妇用不到五秒钟就能让儿子把衣服脱光,这是一种怎样的心理落差?
在一个泼水节上,大家都开心疯狂的相互泼水,突然有一个人破口大骂:“他妈的,谁在泼我”。旁边的人说他,你干嘛骂人啊,人泼你是对你的祝福啊!这个人气急败坏的说:你知道什么?哪个王八蛋是用开水在泼我!
1、一定要把多余的房子卖掉,#地震#来了才知道,原来不动产也是会动的,而且动起来吓死人。 2、余震就象打麻将,如果半天没什么动静,就绝对是在整大的! 3、看余震的心情就象初恋少女看情人,既怕他不来又怕他乱来!
【冷笑话】1.一居室,求合租,面议。2.小事招魂,大事挖坟。3.我觉得我还可以抢救一下!4.提供鞭尸服务,一次100!5.基因重组中,请稍候二十年6.单挑冥王哈迪斯中,征求组队!7.当你看清这行字的时候:朋友,你踩到我了。8.老子终于不用怕鬼了!9.给爷笑一个,要不爷给你笑一个?
局长发短信给女秘书:想死你了,在国际酒店1203号房,快来!却不小心按了群发键。片刻,回复分至。女秘书:德性,干嘛猴急!女科长:领导,今天不方便,改天吧!男副局长:不知道你也是同志啊?女部下:马上到!对门王姐:今天老公在家,明天行吗?女副局长:你才想起我呀?老婆:回来啊!还浪费那钱!
爱情和婚姻就像老黑熊掰玉米棒子,不要指望你能掰到最大和最好的,要挑自己最喜欢最满意的掰一个,掰到了就不要在去在掰了。要不然就会掰来掰去掰了个最小的最不喜欢的回来。
【小偷也幽默】相对两户人家,一户防盗门,一户普通木门。一天,防盗门这家失窃,发现#小偷#在普通木门门口留下了纸条:你相信我,我也相信你。
[强人语录]:世界上最远的距离.不是生与死.而是我在电信你在网通
世界上最远的距离,不是树与树的距离,而是同根生长的树枝,却无法在风中相依。(~ o ~)~zZ
世界上最远的距离是啥?是两个人到了边境,你过去了,我护照忘带了。。
温总理语录:“一个人不管有多聪明,多能干,背景条件有多好,如果不懂得如何去做人、做事,那么他最终的结局肯定是失败。做人做事是一门艺术,更是一门学问。很多人之所以一辈子都碌碌无为,那是因为他活了一辈子都没有弄明白该怎样去做人做事。”
【极品冷笑话】:刘若英向周杰伦求婚,居然遭拒!!!周董深情地说:“奶茶,我更喜欢优乐美!”
你知道哪两种水果居然有手机?--“萝卜青菜,各有索爱。”
糗事百科:“我站起身来给一孕妇让座,她疑惑地看了看我,忽然明白过来,哭笑不得道:同学,我这是胖!”
有些事,我们总是弄不懂;有些人,我们总是猜不透;有些道,我们总是悟不尽;有些理,我们总是想不通;有些坎,我们总是跨不过;有些伤,我们总是治不好;有些天,我们总是睡不着;有些地,我们总是去不了;有些情,我们总是说不出;有些爱,我们总是得不到。------人生十大困惑
六岁的小孩第一次观赏电视里的芭蕾舞,看到台上演员们踮著脚尖急转时,他禁不住问他的父亲:「他们为什麽不选些高个的女孩来跳呢?」
爱情就像白米饭,浪漫过程就像菜。人饿时,会想着吃饭。但吃完后,更多人喜欢去评论菜好不好吃,而忽略白米饭。
用别人的智慧充实自己,不用别人的智慧贬低自己;用别人的成功激励自己,不用别人的成功折磨自己;用别人的错误提醒自己,不用别人的错误娱乐自己。
【老婆和情人的差别】老婆会告诉男人青菜多少钱一斤,情人会告诉男人夜空有多少颗星星。
【我可以等】狱吏问一个即将被处死的罪犯早餐想吃什么?罪犯说:我想吃桃子。狱吏:你知道,现在是冬天,哪有桃子!罪犯说:没关系,我可以等。

  爬下的段子为编写如聊天机器人、公众号、段子发布点提供了丰富素材。

总结

以上就是本文关于python爬虫实例爬取网站搞笑段子的全部内容,希望对大家有所帮助,感兴趣的朋友可以继续参阅本站:Python入门之三角函数全解【收藏】、python好玩的项目—色情图片识别代码分享、Python实现一个简单的验证码程序等,有什么问题可以随时留言,小编会及时回复大家的。

感谢朋友们对本站的支持!

--结束END--

本文标题: Python爬虫实例爬取网站搞笑段子

本文链接: https://www.lsjlt.com/news/16155.html(转载时请注明来源链接)

有问题或投稿请发送至: 邮箱/279061341@qq.com    QQ/279061341

本篇文章演示代码以及资料文档资料下载

下载Word文档到电脑,方便收藏和打印~

下载Word文档
猜你喜欢
  • Python爬虫爬取网站图片
    此次python3主要用requests,解析图片网址主要用beautiful soup,可以基本完成爬取图片功能, 爬虫这个当然大多数人入门都是爬美女图片,我当然也不落俗套,首先也...
    99+
    2024-04-02
  • python爬虫:爬取网站视频
    python爬取百思不得姐网站视频:http://www.budejie.com/video/新建一个py文件,代码如下:#!/usr/bin/python # -*- coding: UTF-8 -*- import urllib,re...
    99+
    2023-01-31
    爬虫 视频 网站
  • Python项目实战:爬取糗事百科最热门的内涵搞笑段子
    前言相信大家都很喜欢非常喜欢看那种神奇的段子,和下面神评论,哈哈,简直就是笑死人,不偿命,今天就为大家介绍一个爬取糗事百科最热门的内涵段子的案例,让你在敲代码过程,有点烦心的时候,就可以看看最新的搞笑内涵段子了,是不是超棒的呢导入基本库...
    99+
    2023-06-02
  • 如何用Python爬虫爬取美剧网站
    如何用Python爬虫爬取美剧网站,很多新手对此不是很清楚,为了帮助大家解决这个难题,下面小编将为大家详细讲解,有这方面需求的人可以来学习下,希望你能有所收获。爬虫爬取美剧网站!【前言】一直有爱看美剧的习惯,一方面锻炼一下英语听力,一方面打...
    99+
    2023-06-02
  • 如何使用Python爬虫爬取网站图片
    这篇文章主要介绍了如何使用Python爬虫爬取网站图片,具有一定借鉴价值,感兴趣的朋友可以参考下,希望大家阅读完这篇文章之后大有收获,下面让小编带着大家一起了解一下。此次python3主要用requests,解析图片网址主要用beautif...
    99+
    2023-06-22
  • 如何利用Python爬虫爬取网站音乐
    小编给大家分享一下如何利用Python爬虫爬取网站音乐,相信大部分人都还不怎么了解,因此分享这篇文章给大家参考一下,希望大家阅读完这篇文章后大有收获,下面让我们一起去了解一下吧!具体实现引入发送网络请求的第三方库import re...
    99+
    2023-06-15
  • Python爬虫实例:爬取猫眼电影——破
     字体反爬 字体反爬也就是自定义字体反爬,通过调用自定义的字体文件来渲染网页中的文字,而网页中的文字不再是文字,而是相应的字体编码,通过复制或者简单的采集是无法采集到编码后的文字内容的。 现在貌似不少网站都有采用这种反爬机制,我们通过猫眼...
    99+
    2023-01-30
    爬虫 猫眼 实例
  • 使用Python爬虫爬取妹子图图片
            最近在学习Python的爬虫部分。看到有网友在分享使用爬虫爬取各种网站的图片的代码,也想自己写个玩玩。今天花时间分析了一下妹子图网站的结构和HTML代码,使用urllib2和BeautifulSoup写出了一个自动下载妹子图...
    99+
    2023-01-31
    爬虫 妹子 图图
  • Python爬取内涵段子里的段子
    环境:Python3.6#!/usr/bin/env python3 #-*-coding:utf-8-*- #version:3.6.4 __author__ = '杜文涛' import requests import json ...
    99+
    2023-01-31
    段子 内涵 Python
  • Python爬虫之爬取最新更新的小说网站
    目录一、引言二、关于相关访问请求及应答报文2.1、百度搜索请求2.2、百度返回搜索结果2.3、小说网站关于最新更新的展现及html报文格式三、实现思路及代码3.1、根据url获取网站...
    99+
    2024-04-02
  • python爬虫爬取赶集网数据
    一.创建项目 scrapy startproject putu 二.创建spider文件 scrapy genspider  patubole patubole.com   三.利用chrome浏览器分析出房价和标题的两个字段的x...
    99+
    2023-01-31
    爬虫 数据 赶集网
  • 使用Python爬虫怎么避免频繁爬取网站
    这期内容当中小编将会给大家带来有关使用Python爬虫怎么避免频繁爬取网站,文章内容丰富且以专业的角度为大家分析和叙述,阅读完这篇文章希望大家可以有所收获。python的数据类型有哪些python的数据类型:1. 数字类型,包括int(整型...
    99+
    2023-06-15
  • python爬虫之12306网站--车站
    python爬虫查询车站信息 目录: 1.找到要查询的url 2.对信息进行分析 3.对信息进行处理 python爬虫查询全拼相同的车站 目录: 1.找到要查询的url 2.对信息进行分析 3.对信息进行处理 1.找到车站信息的url ...
    99+
    2023-01-30
    爬虫 车站 网站
  • python爬虫爬网站的视频和图片
    环境:centos6.5 python2.6.6   http://www.budejie.com/( 纯属测试,并无恶意 )网站分析:我们点视频按钮 可以看到url是:http://www.budejie.com/video/接着我们点开...
    99+
    2023-01-31
    爬虫 图片 网站
  • python爬虫爬取bilibili网页基本内容
    用爬虫爬取bilibili网站排行榜游戏类的所有名称及链接: 导入requests、BeautifulSoup import requests from bs4 import Be...
    99+
    2024-04-02
  • 爬虫实例(二)—— 爬取高清4K图片
    大家好,我是 Enovo飞鱼,今天继续分享一个爬虫案例,爬取高清4K图片,加油💪。     目录 前言 增加异常处理 增加代码灵活性 基本环境配置 爬取目标网站 分析网站页面 具体代码实现 图片下载示例 感谢支持...
    99+
    2023-09-08
    爬虫 python 开发语言
  • 六个步骤学会使用Python爬虫爬取数据(爬虫爬取微博实战)
    用python的爬虫爬取数据真的很简单,只要掌握这六步就好,也不复杂。以前还以为爬虫很难,结果一上手,从初学到把东西爬下来,一个小时都不到就解决了。 Python爬虫六部曲 第一步:安装request...
    99+
    2023-09-10
    python 爬虫 python入门 python爬虫 python爬虫爬取网页数据
  • 【Python】使用Python做简易爬虫爬取B站评论
    目录 一、前言 二、分析网页 三、代码 1.头 2.获取根评论 3.获取子评论 四、总代码 五、总结 一、前言         B站评论没有查找功能,就随手写了一个爬虫爬取B站评论存储到本地txt中         首先需要安装pyth...
    99+
    2023-08-31
    python 爬虫 开发语言
  • python 爬取壁纸网站的示例
    目录完整代码如下运行部分展示结果如下:本次爬虫用到的网址是: http://www.netbian.com/index.htm: 彼岸桌面.里面有很多的好看壁纸,而且都是可以下载高清...
    99+
    2024-04-02
  • Python爬虫项目--爬取自如网房源信
    本次爬取自如网房源信息所用到的知识点: 1. requests get请求 2. lxml解析html 3. Xpath 4. MongoDB存储 正文 1.分析目标站点 1. url: http://hz.ziroom.com/z/nl...
    99+
    2023-01-30
    爬虫 自如 房源
软考高级职称资格查询
编程网,编程工程师的家园,是目前国内优秀的开源技术社区之一,形成了由开源软件库、代码分享、资讯、协作翻译、讨论区和博客等几大频道内容,为IT开发者提供了一个发现、使用、并交流开源技术的平台。
  • 官方手机版

  • 微信公众号

  • 商务合作