写一个Python脚本自动爬取Bilibili小视频

2024-04-02 19:04:59 956人浏览八月长安

Python 官方文档：入门教程 => 点击学习

摘要

目录实验环境准备 api 寻找 && 提取代码实现项目链接我身边的很多小伙伴们在朋友圈里面晒着出去游玩的照片，简直了，人多的不要不要的，长城被堵到水泄不通，老实

我身边的很多小伙伴们在朋友圈里面晒着出去游玩的照片，简直了，人多的不要不要的，长城被堵到水泄不通，老实人想想啊，既然人这么多，哪都不去也是件好事，没事还可以刷刷 B 站 23333 。这时候老实人也有了一个大胆地想法，能不能让这些在旅游景点排队的小伙伴们更快地打发时间呢？考虑到视频的娱乐性和大众观看量，我决定对 B 站新推出的小视频功能下手，于是我跑到B站去找API接口，果不起然，B站在小视频功能处提供了 API 接口，小伙伴们有福了哟！

B 站小视频网址在这里哦：

Http://vc.bilibili.com/p/eden/rank#/?tab=全部

此次实验，我们爬取的是每日的小视频排行榜前 top100

我们该如何去爬取呢？？？

实验环境准备

Chrome 浏览器 (能使用开发者模式的浏览器都行)
Vim (编辑器任选，老实人比较喜欢Vim界面，所以才用这个啦)
python3 开发环境
Kali linux (其实随便一个操作系统都行啦)

API 寻找 && 提取

我们通过 F12 打开开发者模式，然后在 Networking -> Name 字段下找到这个链接：

我们可以看到Request URL这个属性值，我们向下滑动加载视频的过程中，发现只有这段url是不变的。

http://api.vc.bilibili.com/board/v1/ranking/top?

next_offset 会一直变化，我们可以猜测，这个可能就是获取下一个视频序号，我们只需要把这部分参数取出来，把 next_offset 写成变量值，用 JSON 的格式返回到目标网页即可。

代码实现

我们通过上面的尝试写了段代码，发现 B 站在一定程度上做了反爬虫操作，所以我们需要先获取 headers 信息，否则下载下来的视频是空的，然后定义 params 参数存储 jsON 数据，然后通过 requests.get 去获取其参数值信息，用 JSON 的格式返回到目标网页即可，实现代码如下：


def get_json(url):
    headers = {
        'User-Agent': 
        'Mozilla/5.0 (X11; Linux x86_64) AppleWEBKit/537.36 (Khtml, like Gecko) Chrome/69.0.3497.100 Safari/537.36'
    }

    params = {
        'page_size': 10,
        'next_offset': str(num),
        'tag': '今日热门',
        'platfORM': 'pc'
    }

    try:
        html = requests.get(url,params=params,headers=headers)
        return html.json()

    except BaseException:
        print('request error')
        pass

为了能够清楚的看到我们下载的情况，我们折腾了一个下载器上去，实现代码如下：


def download(url,path):
    start = time.time() # 开始时间
    size = 0
    headers = {
        'User-Agent': 
        'Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/69.0.3497.100 Safari/537.36'
    }

    response = requests.get(url,headers=headers,stream=True) # stream属性必须带上
    chunk_size = 1024 # 每次下载的数据大小
    content_size = int(response.headers['content-length']) # 总大小
    if response.status_code == 200:
        print('[文件大小]:%0.2f MB' %(content_size / chunk_size / 1024)) # 换算单位
        with open(path,'wb') as file:
            for data in response.iter_content(chunk_size=chunk_size):
                file.write(data)
                size += len(data) # 已下载的文件大小

效果如下：

将上面的代码进行汇总，整个实现过程如下：


#!/usr/bin/env python
#-*-coding:utf-8-*-
import requests
import random
import time
def get_json(url):
    headers = {
        'User-Agent': 
        'Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/69.0.3497.100 Safari/537.36'
    }

    params = {
        'page_size': 10,
        'next_offset': str(num),
        'tag': '今日热门',
        'platform': 'pc'
    }

    try:
        html = requests.get(url,params=params,headers=headers)
        return html.json()

    except BaseException:
        print('request error')
        pass

def download(url,path):
    start = time.time() # 开始时间
    size = 0
    headers = {
        'User-Agent': 
        'Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/69.0.3497.100 Safari/537.36'
    }

    response = requests.get(url,headers=headers,stream=True) # stream属性必须带上
    chunk_size = 1024 # 每次下载的数据大小
    content_size = int(response.headers['content-length']) # 总大小
    if response.status_code == 200:
        print('[文件大小]:%0.2f MB' %(content_size / chunk_size / 1024)) # 换算单位
        with open(path,'wb') as file:
            for data in response.iter_content(chunk_size=chunk_size):
                file.write(data)
                size += len(data) # 已下载的文件大小

    

if __name__ == '__main__':
    for i in range(10):
        url = 'http://api.vc.bilibili.com/board/v1/ranking/top?'
        num = i*10 + 1
        html = get_json(url)
        infos = html['data']['items']
        for info in infos:
            title = info['item']['description'] # 小视频的标题
            video_url = info['item']['video_playurl'] # 小视频的下载链接
            print(title)

            # 为了防止有些视频没有提供下载链接的情况
            try:
                download(video_url,path='%s.mp4' %title)
                print('成功下载一个!')
                
            except BaseException:
                print('凉凉,下载失败')
                pass

        time.sleep(int(format(random.randint(2,8)))) # 设置随机等待时间

爬取效果图如下：

似乎爬取的效果还可以，当然喜欢的朋友不要忘记点赞分享转发哦。

项目链接

GitHub

以上就是写一个 Python 脚本自动爬取 Bilibili 小视频的详细内容，更多关于Python 爬取 Bilibili 小视频的资料请关注编程网其它相关文章！

您可能感兴趣的文档:

点击免费下载>>软考高级考试备考技巧/历年真题/备考精华资料

--结束END--

本文标题: 写一个Python脚本自动爬取Bilibili小视频

本文链接: https://www.lsjlt.com/news/124437.html(转载时请注明来源链接)

有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

本篇文章演示代码以及资料文档资料下载

下载Word文档到电脑，方便收藏和打印～

下载Word文档

去做题

猜你喜欢

写一个Python脚本自动爬取Bilibili小视频

目录实验环境准备 API 寻找 && 提取代码实现项目链接我身边的很多小伙伴们在朋友圈里面晒着出去游玩的照片，简直了，人多的不要不要的，长城被堵到水泄不通，老实...

99+

2024-04-02
Python 自动爬取B站视频

文件名自定义（文件格式为.py），脚本内容: #!/usr/bin/env python #-*-coding:utf-8-*- import requests import random import time def get_js...

99+

2023-01-30

视频 Python
用python写一个脚本，自动连wifi，自动登录校园网

文章目录 1.实现原理1.1认识 URL1.2 http请求报文格式1.3 http响应报头格式 2.具体实现2.1 获取url2.2 获取请求报文的报头2.3 获取请求报文的数据2.4 获取本机的局域网ip 3.自动连接W...

99+

2023-08-30

python 服务器网络
写一个Python脚本下载哔哩哔哩舞蹈区的所有视频

目录一、抓取列表二、获取视频的 CID三、下载视频一、抓取列表首先点开舞蹈区先选择宅舞列表。然后打开 F12 的控制面板，可以找到一条 https://api.bilibili...

99+

2024-04-02
Python自动化短视频生成脚本实现热门视频流水线生产

目录一、核心功能设计二、实现步骤1.图片爬取2.图片统一格式大小3.视频合成4.截取背景音乐5.视频和背景音乐合并一、核心功能设计首先我看了网上那些视频营销号的视频，大多数都是围绕...

99+

2024-04-02
怎么用Python写一个京东自动下单抢购脚本

本文小编为大家详细介绍“怎么用Python写一个京东自动下单抢购脚本”，内容详细，步骤清晰，细节处理妥当，希望这篇“怎么用Python写一个京东自动下单抢购脚本”文章能帮助大家解决疑惑，下面跟着小编的思路慢慢深入，一起来学习新知识吧。1 问...

99+

2023-07-05
教你用Python写一个京东自动下单抢购脚本

1 问题背景经过无数次抢购失败后，发现商家会不定时的放出少量货源，目测每次会有几台。如果我们编写一个脚本程序24小时不间断监听商品库存，一旦查询到货源便开始尝试自动下单，这样就可以...

99+

2023-03-23

Python自动下单 Python抢购脚本 Python脚本 Python京东抢购
ChatGPT帮我自动编写Python爬虫脚本的详细过程

目录1、爬取知乎上的专栏文章2. 爬取京东某商品的评论3.继续更多的测试都知道最近ChatGPT聊天机器人爆火，我也想方设法注册了账号，据说后面要收费了。 ChatGPT是一种基于大...

99+

2023-02-16

ChatGPT自动编写 Python 爬虫脚本 ChatGPT编写 Python 爬虫
使用python怎么编写一个自动生成sql语句的脚本

这篇文章主要介绍了使用python怎么编写一个自动生成sql语句的脚本，此处通过实例代码给大家介绍的非常详细，对大家的学习或工作具有一定的参考价值，需要的朋友可以参考下：python是什么意思Python是一种跨平台的、具有解释性、编译性、...

99+

2023-06-06
这怎么在SQL Server编写一个自动备份脚本

本篇文章为大家展示了这怎么在SQL Server编写一个自动备份脚本，内容简明扼要并且容易理解，绝对能使你眼前一亮，通过这篇文章的详细介绍希望你能有所收获。创建SQL脚本新建db_backup.sql文件，填入以下内容。-- 定...

99+

2023-06-14
八个超级好用的Python自动化脚本(小结)

目录1、自动化阅读网页新闻2、自动化数据探索3、自动发送多封邮件4、将 PDF 转换为音频文件5、从列表中播放随机音乐6、智能天气信息7、长网址变短网址8、清理下载文件夹每天你都可能...

99+

2024-04-02
我用Python给班主任写了一个自动阅卷脚本(附源码)

导语幼儿园升小学，小学升中学，中学升高中.......... 每个人都要经历的九年义务教育：伴随的都是作业、随堂考、以及每个科目的大大小小的考试。当然小编被考试支配的恐惧以及过去了...

99+

2024-04-02
python如何自动爬取B站CXK的NBA形象大使的全部鬼畜视频

这篇文章给大家介绍python如何自动爬取B站CXK的NBA形象大使的全部鬼畜视频，内容非常详细，感兴趣的小伙伴们可以参考借鉴，希望对大家能有所帮助。最近CXK的工作室告了B站,然后被B站的各路大神鬼畜恶搞,哈哈哈,至少有几十个版本,啧啧,...

99+

2023-06-02
怎么在Linux中使用expect命令编写一个自动化交互脚本

怎么在Linux中使用expect命令编写一个自动化交互脚本？针对这个问题，这篇文章详细介绍了相对应的分析和解答，希望可以帮助更多想解决这个问题的小伙伴找到更简单易行的方法。expect 是建立在工具控制语言（Tool Control La...

99+

2023-06-09
【Python】京东自动下单抢购脚本——双十一购物小技巧

最近种草一款富士📷已久，但限于富士产能，一直都没有等到开放购买，在尝试几次定闹钟到点准时抢购后，果断放弃，于是花了一个周末时间写了一个简易脚本，终于成为一名合格的“富家子弟”。 ...

99+

2023-09-03

python java 抢购抢购脚本京东
基于Python编写一个B站全自动抽奖的小程序

目录导语开发工具环境搭建原理简介导语应好友邀请，帮他写了个小程序，功能类似于实时监控自己关注的UP主，如果关注的UP主中有人发布了抽奖的动态，就自动参与这个抽奖。这样就能不错过任何...

99+

2024-04-02
【老师见打系列】：我只是写了一个自动回复讨论的脚本~

文章目录 🌟好久不见⛳️实现过程🌴老操作了兄弟们~🐢一步拿捏讨论💖美图结束语专栏Python零基础入门篇&#x...

99+

2023-09-01

python
用python基于appium模块开发一个自动收取能量的小助手

导语昨天楼下买东西，超市老板居然让我加他支付宝好友？？？？嗯哼！对啦，我也很疑惑来着！！当时以为是方便下次买东西，哦吼也没多想，早上起来睁着我睡眼惺忪的熊猫眼，...

99+

2024-04-02
想去看演唱却总是抢不到票？教你用Python制作一个自动抢票脚本

前言嗨喽！大家好，这里是魔王！！大麦网，是中国综合类现场娱乐票务营销平台，业务覆盖演唱会、话剧、音乐剧、体育赛事等领域。但是因为票数有限，还有黄牛们不能丢了饭碗，所以导致了，很多人都抢不到票 ...

99+

2023-08-31

udp python 网络