B站数据导出教程:用InfoSpider把观看历史与账号信息存成JSON文件
【免费下载链接】InfoSpiderINFO-SPIDER 是一个集众多数据源于一身的爬虫工具箱🧰,旨在安全快捷的帮助用户拿回自己的数据,工具代码开源,流程透明。支持数据源包括GitHub、QQ邮箱、网易邮箱、阿里邮箱、新浪邮箱、Hotmail邮箱、Outlook邮箱、京东、淘宝、支付宝、中国移动、中国联通、中国电信、知乎、哔哩哔哩、网易云音乐、QQ好友、QQ群、生成朋友圈相册、浏览器浏览历史、12306、博客园、CSDN博客、开源中国博客、简书。项目地址: https://gitcode.com/GitHub_Trending/in/InfoSpider
InfoSpider 是一个开源的本地数据爬虫工具箱,选中其中的哔哩哔哩数据源后,程序会把你的B站观看历史和个人资料抓下来,写成本机上的 JSON 文件,完成一次完整的 B站数据导出与账号资料备份,全程无需手写任何抓取代码。
导出完成后你会得到什么
在开始操作前,先看清楚这次B站数据导出最终落到磁盘里的东西:
| 文件名 | 里面装了什么 |
|---|---|
| bilibili_history.json | 你的观看历史:视频标题、BV 号、播放时间点等,按每页 200 条分页,最多抓取 10 页(约最近 2000 条) |
| user_info.json | 账号基础资料:昵称、头像、签名、等级、粉丝数等信息 |
两个文件都是 UTF-8 编码的标准 JSON,用文本编辑器就能直接打开,也能丢进 pandas 之类的工具做后续分析。📦
什么时候需要把B站数据拿出来
想复盘自己前两年看过什么内容,却发现历史记录页只能往前翻最近几十条?视频陆续下架之后,连"自己到底收藏过哪些方向"都说不清楚了?把这两份 JSON 存下来,这些问题就有了兜底。
最小化环境要求
- Python 3.6 以上,并安装 Chrome 浏览器(含与浏览器同版本的驱动)
- 拉取项目并装好依赖即可:
git clone https://gitcode.com/GitHub_Trending/in/InfoSpider cd InfoSpider pip3 install -r requirements.txt完整操作流程
整条链路是:运行主程序 → 点击哔哩哔哩数据源 → 浏览器里扫码登录 → 选保存文件夹 → 等待导出。
第一步:在弹出的浏览器里扫码完成免密登录
在 InfoSpider 主界面的数据源列表里点击"哔哩哔哩",程序会自动打开一个浏览器窗口并停在B站登录页。这一步不需要输入账号密码,掏出手机用哔哩哔哩 APP 扫一下页面上的二维码、在手机上确认即可;登录跳转完成的瞬间,程序就会带着你的登录凭证进入抓取环节。
第二步:选择存放B站备份文件的本地文件夹
登录成功后会弹出"选择信息保存文件夹"对话框。建议新建一个空目录(比如bilibili_backup)专门放这些文件,选好之后点"选择文件夹"确认;如果点了"取消",程序会直接退出且不产生任何文件。
第三步:等待观看历史导出并核对结果
确认路径后程序开始逐页请求B站接口,每页间隔约 1 秒,页面上会持续打印"爬取中..."。当出现"爬取完成..."后,回到你选的文件夹,应该能看到 bilibili_history.json 与 user_info.json 两个文件。
拿到文件之后怎么做
- 想看历史明细:用任意编辑器打开 bilibili_history.json,按页查看视频标题和 BV 号即可。
- 想进一步处理:用 pandas 读取后,可以统计自己观看的时段分布或关注过的内容方向。
- 备份习惯:建议每个月跑一次,文件不大,本地和云盘各留一份最稳妥。
常见坑点
- 扫码窗口没弹出或浏览器闪退→ 多为 Chrome 未装或与驱动版本不匹配 → 确认浏览器和驱动版本一致后重跑。
- 保存文件夹里一个文件都没有→ 选择文件夹对话框点了"取消" → 重新运行并确认选择目录。
- 历史记录条数比预期少→ 程序只往前抓最近 10 页(约 2000 条)→ 属于设计上限,核对 JSON 实际条数即可。
- JSON 打开是乱码→ 编辑器默认编码不是 UTF-8 → 切换为 UTF-8 后重新打开。
关于隐私
整个过程都在你自己的机器上发生:程序读取扫码后的登录凭证直接向B站发起请求,结果文件只写进你选的本地目录,数据不经过任何第三方服务器,全程也没有要求你输入密码。
结语
观看历史和账号资料同样是你的数字资产,把它们从网页里搬进自己的文件,才算真正把数据握在手中。有空花几分钟给账号做一次备份,下次想复盘时,资料就在手边。InfoSpider 的B站抓取逻辑见 Spiders/bilibili/main.py,更多数据源可以翻 docs/QuickStart.md 继续了解。
【免费下载链接】InfoSpiderINFO-SPIDER 是一个集众多数据源于一身的爬虫工具箱🧰,旨在安全快捷的帮助用户拿回自己的数据,工具代码开源,流程透明。支持数据源包括GitHub、QQ邮箱、网易邮箱、阿里邮箱、新浪邮箱、Hotmail邮箱、Outlook邮箱、京东、淘宝、支付宝、中国移动、中国联通、中国电信、知乎、哔哩哔哩、网易云音乐、QQ好友、QQ群、生成朋友圈相册、浏览器浏览历史、12306、博客园、CSDN博客、开源中国博客、简书。项目地址: https://gitcode.com/GitHub_Trending/in/InfoSpider
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考