news 2026/9/20 11:42:30

B站数据导出教程:用InfoSpider把观看历史与账号信息存成JSON文件

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
B站数据导出教程:用InfoSpider把观看历史与账号信息存成JSON文件

B站数据导出教程:用InfoSpider把观看历史与账号信息存成JSON文件

【免费下载链接】InfoSpiderINFO-SPIDER 是一个集众多数据源于一身的爬虫工具箱🧰,旨在安全快捷的帮助用户拿回自己的数据,工具代码开源,流程透明。支持数据源包括GitHub、QQ邮箱、网易邮箱、阿里邮箱、新浪邮箱、Hotmail邮箱、Outlook邮箱、京东、淘宝、支付宝、中国移动、中国联通、中国电信、知乎、哔哩哔哩、网易云音乐、QQ好友、QQ群、生成朋友圈相册、浏览器浏览历史、12306、博客园、CSDN博客、开源中国博客、简书。项目地址: https://gitcode.com/GitHub_Trending/in/InfoSpider

InfoSpider 是一个开源的本地数据爬虫工具箱,选中其中的哔哩哔哩数据源后,程序会把你的B站观看历史和个人资料抓下来,写成本机上的 JSON 文件,完成一次完整的 B站数据导出与账号资料备份,全程无需手写任何抓取代码。

导出完成后你会得到什么

在开始操作前,先看清楚这次B站数据导出最终落到磁盘里的东西:

文件名里面装了什么
bilibili_history.json你的观看历史:视频标题、BV 号、播放时间点等,按每页 200 条分页,最多抓取 10 页(约最近 2000 条)
user_info.json账号基础资料:昵称、头像、签名、等级、粉丝数等信息

两个文件都是 UTF-8 编码的标准 JSON,用文本编辑器就能直接打开,也能丢进 pandas 之类的工具做后续分析。📦

什么时候需要把B站数据拿出来

想复盘自己前两年看过什么内容,却发现历史记录页只能往前翻最近几十条?视频陆续下架之后,连"自己到底收藏过哪些方向"都说不清楚了?把这两份 JSON 存下来,这些问题就有了兜底。

最小化环境要求

  • Python 3.6 以上,并安装 Chrome 浏览器(含与浏览器同版本的驱动)
  • 拉取项目并装好依赖即可:
git clone https://gitcode.com/GitHub_Trending/in/InfoSpider cd InfoSpider pip3 install -r requirements.txt

完整操作流程

整条链路是:运行主程序 → 点击哔哩哔哩数据源 → 浏览器里扫码登录 → 选保存文件夹 → 等待导出

第一步:在弹出的浏览器里扫码完成免密登录

在 InfoSpider 主界面的数据源列表里点击"哔哩哔哩",程序会自动打开一个浏览器窗口并停在B站登录页。这一步不需要输入账号密码,掏出手机用哔哩哔哩 APP 扫一下页面上的二维码、在手机上确认即可;登录跳转完成的瞬间,程序就会带着你的登录凭证进入抓取环节。

第二步:选择存放B站备份文件的本地文件夹

登录成功后会弹出"选择信息保存文件夹"对话框。建议新建一个空目录(比如bilibili_backup)专门放这些文件,选好之后点"选择文件夹"确认;如果点了"取消",程序会直接退出且不产生任何文件。

第三步:等待观看历史导出并核对结果

确认路径后程序开始逐页请求B站接口,每页间隔约 1 秒,页面上会持续打印"爬取中..."。当出现"爬取完成..."后,回到你选的文件夹,应该能看到 bilibili_history.json 与 user_info.json 两个文件。

拿到文件之后怎么做

  • 想看历史明细:用任意编辑器打开 bilibili_history.json,按页查看视频标题和 BV 号即可。
  • 想进一步处理:用 pandas 读取后,可以统计自己观看的时段分布或关注过的内容方向。
  • 备份习惯:建议每个月跑一次,文件不大,本地和云盘各留一份最稳妥。

常见坑点

  • 扫码窗口没弹出或浏览器闪退→ 多为 Chrome 未装或与驱动版本不匹配 → 确认浏览器和驱动版本一致后重跑。
  • 保存文件夹里一个文件都没有→ 选择文件夹对话框点了"取消" → 重新运行并确认选择目录。
  • 历史记录条数比预期少→ 程序只往前抓最近 10 页(约 2000 条)→ 属于设计上限,核对 JSON 实际条数即可。
  • JSON 打开是乱码→ 编辑器默认编码不是 UTF-8 → 切换为 UTF-8 后重新打开。

关于隐私

整个过程都在你自己的机器上发生:程序读取扫码后的登录凭证直接向B站发起请求,结果文件只写进你选的本地目录,数据不经过任何第三方服务器,全程也没有要求你输入密码。

结语

观看历史和账号资料同样是你的数字资产,把它们从网页里搬进自己的文件,才算真正把数据握在手中。有空花几分钟给账号做一次备份,下次想复盘时,资料就在手边。InfoSpider 的B站抓取逻辑见 Spiders/bilibili/main.py,更多数据源可以翻 docs/QuickStart.md 继续了解。

【免费下载链接】InfoSpiderINFO-SPIDER 是一个集众多数据源于一身的爬虫工具箱🧰,旨在安全快捷的帮助用户拿回自己的数据,工具代码开源,流程透明。支持数据源包括GitHub、QQ邮箱、网易邮箱、阿里邮箱、新浪邮箱、Hotmail邮箱、Outlook邮箱、京东、淘宝、支付宝、中国移动、中国联通、中国电信、知乎、哔哩哔哩、网易云音乐、QQ好友、QQ群、生成朋友圈相册、浏览器浏览历史、12306、博客园、CSDN博客、开源中国博客、简书。项目地址: https://gitcode.com/GitHub_Trending/in/InfoSpider

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/20 11:41:39

Hermes记忆机制源码解析:分层设计与检索调优实战

1. 从“失忆”说起:Hermes 记忆机制到底在解决什么问题做过智能体开发的人大概率都经历过这种尴尬:上一轮对话里用户明明说了“我叫老张,做跨境电商的”,下一轮再问“帮我写个选品建议”,模型却像第一次见面一样&#…

作者头像 李华
网站建设 2026/9/20 11:40:32

Java Web机票系统教学案例:B/S架构全链路拆解

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/20 11:40:29

OC-SORT多目标跟踪算法:卡尔曼滤波遮挡顽疾与三大创新点源码解析

多目标跟踪这个领域,SORT系列算法算是绕不开的里程碑。但真正在项目里落地过的人都清楚,原始SORT在遮挡场景下的表现有多让人头疼——目标被树挡住三五帧再出来,ID大概率就换了,轨迹碎得跟玻璃渣一样。OC-SORT(Observa…

作者头像 李华
网站建设 2026/9/20 11:40:19

2026信息素养大赛C++初赛模拟卷:核心考点与避坑指南

1. 这份模拟卷的命题逻辑:参赛前必须先搞懂的考情2026年全国青少年信息素养大赛算法应用主题赛(C赛项)的初赛,和很多家长同学想象中的"考背诵、考记忆"完全不同。它的核心考察点只有一个:能不能用C语言解决实…

作者头像 李华
网站建设 2026/9/20 11:38:41

论文写作效率革命:从手工排版到智能工具的全流程升级

1. 引言:论文写作的痛点与破局 作为一名正在奋战论文的大学生,我深知写论文的艰辛。每次打开文档,面对那些繁琐的格式、反复修改的段落,我的内心总是充满了困惑与无奈。论文写作从来不只是"写"那么简单——从选题、查资…

作者头像 李华
网站建设 2026/9/20 11:38:38

AI日报制作全流程:从信息采集到结构化输出的工程实践

1. 一份AI日报的诞生:从信息洪流到结构化认知每天早上七点,我的信息采集脚本会准时跑完最后一轮抓取。屏幕上滚过几百条标题、摘要、推文和论文更新,然后我要在四十分钟内把它们压缩成一份能让人在通勤路上读完的日报。这个习惯我坚持了快两年…

作者头像 李华