如何用Python爬虫爬取美剧网站

2023-06-02 04:06:36 507人浏览泡泡鱼

Python 官方文档：入门教程 => 点击学习

摘要

如何用python爬虫爬取美剧网站，很多新手对此不是很清楚，为了帮助大家解决这个难题，下面小编将为大家详细讲解，有这方面需求的人可以来学习下，希望你能有所收获。爬虫爬取美剧网站！【前言】一直有爱看美剧的习惯，一方面锻炼一下英语听力，一方面打

如何用python爬虫爬取美剧网站，很多新手对此不是很清楚，为了帮助大家解决这个难题，下面小编将为大家详细讲解，有这方面需求的人可以来学习下，希望你能有所收获。

爬虫爬取美剧网站！

【前言】

一直有爱看美剧的习惯，一方面锻炼一下英语听力，一方面打发一下时间。之前是能在视频网站上面在线看的，可是自从广电总局的限制令之后，进口的美剧英剧等貌似就不在像以前一样同步更新了。但是，作为一个宅diao的我又怎甘心没剧追呢，所以网上随便查了一下就找到一个能用迅雷下载的美剧下载网站【天天美剧】，各种资源随便下载，最近迷上的BBC的高清纪录片，大自然美得不要不要的。

如何用Python爬虫爬取美剧网站

虽说找到了资源网站可以下载了，但是每次都要打开浏览器，输入网址，找到该美剧，然后点击链接才能下载。时间长了就觉得过程好繁琐，而且有时候网站链接还会打不开，会有点麻烦。所以今天的python学习路线教程就想给大家来点实战的东西，抓取该网站上所有美剧链接，并保存在文本文档中，想要哪部剧就直接打开复制链接到迅雷就可以下载啦。

如何用Python爬虫爬取美剧网站

其实一开始打算写那种发现一个url，使用requests打开抓取下载链接，从主页开始爬完全站。但是，好多重复链接，还有其网站的url不是我想的那么规则，写了半天也没有写出我想要的那种发散式的爬虫，也许是自己火候还不到吧，继续努力。。。

后来发现，其电视剧链接都是在文章里面，然后文章url后面有个数字编号，就像这样的Http://cn163.net/arcHives/24016/，所以机智的我又用了之前写过的爬虫经验，解决方法就是自动生成url，其后面的数字不是可以变的吗，而且每部剧的都是唯一的，所以尝试了一下大概有多少篇文章，然后用range函数直接连续生成数来构造url。

但是很多url是不存在的，所以会直接挂掉，别担心，我们用的可是requests，其自带的status_code就是用来判断请求返回的状态的，所以只要是返回的状态码是404的我们都把它跳过，其他的都进去爬取链接，这就解决了url的问题了。

以下就是上述步骤的实现代码。

def get_urls(self): try: for i in range(2015,25000): base_url='http://cn163.net/archives/' url=base_url+str(i)+'/' if requests.get(url).status_code == 404: continue else: self.save_links(url) except Exception,e: pass

其余的就进行的很顺利了，网上找到前人写的类似的爬虫，但是只是爬取一篇文章的，所以借鉴了一下其正则表达式。自己用了BeautifulSoup还没有正则效果好，所以果断弃了，学海无涯啊。但是效果也不是那么理想，有一半左右的链接不能正确抓取，还需继续优化。

# -*- coding:utf-8 -*-import requests import reimport sysimport threadingimport timereload(sys)sys.setdefaultencoding('utf-8')class Archives(object): def save_links(self,url): try: data=requests.get(url,timeout=3) content=data.text link_pat='"(ed2k://\|file\|[^"]+?\.(S\d+)(E\d+)[^"]+?1024X\d{3}[^"]+?)"' name_pat=re.compile(r'<h3 class="entry_title">(.*?)</h3>',re.S) links = set(re.findall(link_pat,content)) name=re.findall(name_pat,content) links_dict = {} count=len(links) except Exception,e: pass for i in links: links_dict[int(i[1][1:3]) * 100 + int(i[2][1:3])] = i#把剧集按s和e提取编号 try: with open(name[0].replace('/',' ')+'.txt','w') as f: print name[0] for i in sorted(list(links_dict.keys())):#按季数+集数排序顺序写入 f.write(links_dict[i][0] + '\n') print "Get links ... ", name[0], count except Exception,e: pass def get_urls(self): try: for i in range(2015,25000): base_url='http://cn163.net/archives/' url=base_url+str(i)+'/' if requests.get(url).status_code == 404: continue else: self.save_links(url) except Exception,e: pass def main(self): thread1=threading.Thread(target=self.get_urls()) thread1.start() thread1.join() if __name__ == '__main__': start=time.time() a=Archives() a.main() end=time.time() print end-start

完整版代码，其中还用到了多线程，但是感觉没什么用，因为Python的GIL的缘故吧，看似有两万多部剧，本以为要很长时间才能抓取完成，但是除去url错误的和没匹配到的，总共抓取时间20分钟不到。搞得我本来还想使用Redis在两台linux上爬取，但是折腾了一番之后感觉没必要，所以就这样吧，后面需要更大数据的时候再去弄。

还有过程中遇到一个很折磨我的问题是文件名的保存，必须在此抱怨一下，txt文本格式的文件名能有空格，但是不能有斜线、反斜线、括号等。就是这个问题，一早上的时间都花在这上面的，一开始我以为是抓取数据的错误，后面查了半天才发现是爬取的剧名中带有斜杠，这可把我坑苦了。大家在尝试的时候一定要仔细认真哈！加油加油呀！

看完上述内容是否对您有帮助呢？如果还想对相关知识有进一步的了解或阅读更多相关文章，请关注编程网Python频道，感谢您对编程网的支持。

您可能感兴趣的文档:

点击免费下载>>软考高级考试备考技巧/历年真题/备考精华资料

--结束END--

本文标题: 如何用Python爬虫爬取美剧网站

本文链接: https://www.lsjlt.com/news/228849.html(转载时请注明来源链接)

有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

本篇文章演示代码以及资料文档资料下载

下载Word文档到电脑，方便收藏和打印～

下载Word文档

去做题

猜你喜欢

如何用Python爬虫爬取美剧网站

如何用Python爬虫爬取美剧网站，很多新手对此不是很清楚，为了帮助大家解决这个难题，下面小编将为大家详细讲解，有这方面需求的人可以来学习下，希望你能有所收获。爬虫爬取美剧网站！【前言】一直有爱看美剧的习惯，一方面锻炼一下英语听力，一方面打...

99+

2023-06-02
如何使用Python爬虫爬取网站图片

这篇文章主要介绍了如何使用Python爬虫爬取网站图片，具有一定借鉴价值，感兴趣的朋友可以参考下，希望大家阅读完这篇文章之后大有收获，下面让小编带着大家一起了解一下。此次python3主要用requests，解析图片网址主要用beautif...

99+

2023-06-22
如何利用Python爬虫爬取网站音乐

小编给大家分享一下如何利用Python爬虫爬取网站音乐，相信大部分人都还不怎么了解，因此分享这篇文章给大家参考一下，希望大家阅读完这篇文章后大有收获，下面让我们一起去了解一下吧！具体实现引入发送网络请求的第三方库import re...

99+

2023-06-15
Python爬虫爬取网站图片

此次python3主要用requests，解析图片网址主要用beautiful soup，可以基本完成爬取图片功能，爬虫这个当然大多数人入门都是爬美女图片，我当然也不落俗套，首先也...

99+

2024-04-02
python爬虫：爬取网站视频

python爬取百思不得姐网站视频：http://www.budejie.com/video/新建一个py文件，代码如下：#!/usr/bin/python # -*- coding: UTF-8 -*- import urllib,re...

99+

2023-01-31

爬虫视频网站
Python如何爬取b站番剧信息

Python如何爬取b站番剧信息，相信很多没有经验的人对此束手无策，为此本文总结了问题出现的原因和解决方法，通过这篇文章希望你能解决这个问题。相信很多人都是B站的粉丝吧因为确实是一个类目都比较齐全的网站,还有各种各样的新番,这是其他网站没有...

99+

2023-06-02
Python 爬虫：如何用 BeautifulSoup 爬取网页数据

在网络时代，数据是最宝贵的资源之一。而爬虫技术就是一种获取数据的重要手段。Python 作为一门高效、易学、易用的编程语言，自然成为了爬虫技术的首选语言之一。而 BeautifulSoup 则是 Py...

99+

2023-10-23

python 爬虫 beautifulsoup
使用Python爬虫怎么避免频繁爬取网站

这期内容当中小编将会给大家带来有关使用Python爬虫怎么避免频繁爬取网站，文章内容丰富且以专业的角度为大家分析和叙述，阅读完这篇文章希望大家可以有所收获。python的数据类型有哪些python的数据类型：1. 数字类型，包括int（整型...

99+

2023-06-15
python爬虫如何爬取图片

这篇文章主要介绍了python爬虫如何爬取图片，具有一定借鉴价值，感兴趣的朋友可以参考下，希望大家阅读完这篇文章之后大有收获，下面让小编带着大家一起了解一下。python可以做什么Python是一种编程语言，内置了许多有效的工具，Pytho...

99+

2023-06-14
怎么用Python爬虫获取网址美图

本篇内容介绍了“怎么用Python爬虫获取网址美图”的有关知识，在实际案例的操作过程中，不少人都会遇到这样的困境，接下来就让小编带领大家学习一下如何处理这些情况吧！希望大家仔细阅读，能够学有所成！Python学习教程之爬虫：爬取街拍美图抓...

99+

2023-06-02
python爬取网站美女图片

今天周五，项目刚刚上线完，有些时间，闲着无聊，继续复习爬虫，这次打算爬取网站的美女图片。得先找到目标，然后目标网站还不会反爬虫，因为自己只是小白，好了开始。寻找目标，发现了目标，哈哈 http://www.meizitu.com 里面图片按...

99+

2023-01-31

美女图片网站
python爬虫中如何爬取新闻

这篇文章主要介绍了python爬虫中如何爬取新闻，具有一定借鉴价值，感兴趣的朋友可以参考下，希望大家阅读完这篇文章之后大有收获，下面让小编带着大家一起了解一下。python的五大特点是什么python的五大特点：1.简单易学，开发程序时，专...

99+

2023-06-14
python爬虫中如何爬取网页新闻内容

小编给大家分享一下python爬虫中如何爬取网页新闻内容，相信大部分人都还不怎么了解，因此分享这篇文章给大家参考一下，希望大家阅读完这篇文章后大有收获，下面让我们一起去了解一下吧！python可以做什么Python是一种编程语言，内置了许多...

99+

2023-06-14
Python爬虫之爬取最新更新的小说网站

目录一、引言二、关于相关访问请求及应答报文2.1、百度搜索请求2.2、百度返回搜索结果2.3、小说网站关于最新更新的展现及html报文格式三、实现思路及代码3.1、根据url获取网站...

99+

2024-04-02
python爬虫爬取赶集网数据

一.创建项目 scrapy startproject putu 二.创建spider文件 scrapy genspider patubole patubole.com 三.利用chrome浏览器分析出房价和标题的两个字段的x...

99+

2023-01-31

爬虫数据赶集网
Python爬虫：爬取美拍小姐姐视频

最近在写一个应用，需要收集微博上一些热门的视频，像这些小视频一般都来自秒拍，微拍，美拍和新浪视频，而且没有下载的选项，所以只能动脑想想办法了。第一步分析网页源码。例如：http://video.weibo.com/show...

99+

2023-01-30

爬虫姐姐视频
Python爬虫如何爬取网页中所有的url

这篇文章主要介绍Python爬虫如何爬取网页中所有的url，文中介绍的非常详细，具有一定的参考价值，感兴趣的小伙伴们一定要看完！python可以做什么Python是一种编程语言，内置了许多有效的工具，Python几乎无所不能，该语言通俗易懂...

99+

2023-06-14
Python爬虫项目--爬取自如网房源信

本次爬取自如网房源信息所用到的知识点: 1. requests get请求 2. lxml解析html 3. Xpath 4. MongoDB存储正文 1.分析目标站点 1. url: http://hz.ziroom.com/z/nl...

99+

2023-01-30

爬虫自如房源
【Python】使用Python做简易爬虫爬取B站评论

目录一、前言二、分析网页三、代码 1.头 2.获取根评论 3.获取子评论四、总代码五、总结一、前言 B站评论没有查找功能，就随手写了一个爬虫爬取B站评论存储到本地txt中首先需要安装pyth...

99+

2023-08-31

python 爬虫开发语言
python爬虫之12306网站--车站

python爬虫查询车站信息目录: 1.找到要查询的url 2.对信息进行分析 3.对信息进行处理 python爬虫查询全拼相同的车站目录： 1.找到要查询的url 2.对信息进行分析 3.对信息进行处理 1.找到车站信息的url ...

99+

2023-01-30

爬虫车站网站