把散落在 25 个平台里的个人数据,用一个开源爬虫工具箱全部捡回来
【免费下载链接】InfoSpiderINFO-SPIDER 是一个集众多数据源于一身的爬虫工具箱🧰,旨在安全快捷的帮助用户拿回自己的数据,工具代码开源,流程透明。支持数据源包括GitHub、QQ邮箱、网易邮箱、阿里邮箱、新浪邮箱、Hotmail邮箱、Outlook邮箱、京东、淘宝、支付宝、中国移动、中国联通、中国电信、知乎、哔哩哔哩、网易云音乐、QQ好友、QQ群、生成朋友圈相册、浏览器浏览历史、12306、博客园、CSDN博客、开源中国博客、简书。项目地址: https://gitcode.com/GitHub_Trending/in/InfoSpider
你有没有算过,自己的个人数据散落在多少个平台里?B 站的观影记录、淘宝的订单、GitHub 的代码提交、知乎的点赞收藏……这些数字资产平时感觉不到重量,可一旦想翻找某条旧记录,往往哪个平台都找不全。InfoSpider 就是为此而生的开源爬虫工具箱——它专门帮你把这些个人数据安全、完整地拿回本地,真正做到"我的数据我做主"。
想翻回三年前的一条弹幕,结果哪都找不到
去年年底,我想找一条三年前在 B 站发过的评论。登录账号,翻收藏、翻历史、翻动态,全都没有。弹幕和评论这种"边角料"数据,平台压根不提供导出入口。类似的憋屈我遇到过很多次:换了手机想找回旧订单,网页存档早就失效;想统计这些年到底写了多少篇博客,只能一篇篇手动数。
平台不是没有数据,它们只是把"导出"这件事做得极其麻烦。手动复制粘贴吧,几百条记录复制到手酸;平台自带导出功能吧,有的根本没这功能,有的导出格式混乱得没法看。我的个人数据明明属于我,想要一份完整的副本,却比登天还难。
转折:一个把数据"搬回家"的开源爬虫工具箱
直到我在开发者社区里翻到 InfoSpider,才觉得这事儿有解了。它是一个开源的个人数据爬虫工具箱,代码全部公开、流程透明,支持的数据源超过二十个:GitHub、QQ 邮箱、网易邮箱、京东、淘宝、支付宝、知乎、哔哩哔哩、网易云音乐、QQ 好友、QQ 群、朋友圈相册、浏览器历史、12306、移动联通电信、博客园、CSDN、开源中国、简书……几乎覆盖了普通人数字生活的方方面面。
它做的事很简单:帮你登录自己的账号,调用官方接口,把属于你的数据整理成整齐的 JSON 文件,存到你指定的文件夹。全程在你自己的电脑上运行,数据不会上传到任何服务器。
五分钟上手:先拿 B 站个人数据练手
光说不练没意思,咱们直接来一遍,整个过程大概四步:
第一步,进入项目目录下的 tools 文件夹,运行python main.py,程序会弹出主界面,就是上面那张图,点一下"哔哩哔哩"。
第二步,在浏览器里登录 B 站,按 F12 打开开发者工具,切到 Network 标签,刷新页面,随便挑一个请求,把 Cookie 复制出来,贴进脚本对应位置。
第三步,运行python Spiders/bilibili/main.py。程序会验证登录状态,然后弹出一个文件夹选择框——给这批数据找个新家。
第四步,等它跑完,打开那个文件夹,你会看到两个 JSON 文件:bilibili_history.json 是完整的观看历史,user_info.json 是你的账号信息。
整个过程不涉及任何"黑科技",就是把本该属于你的东西,用合法的方式拿回来。其他平台的操作逻辑大同小异,会一个,剩下的都能照葫芦画瓢。
拿回数据之后,能干点什么
别觉得这只是"备份",数据到手后的玩法多着呢:
- 分析型选手:把 B 站观看历史导进表格,看看自己晚上十点后到底刷了多少视频;把淘宝订单拉出来,算算一年在"冲动消费"上花了多少钱。
- 记录型选手:把 GitHub 的提交记录、博客园和 CSDN 的博文存档,多年后翻出来,就是一份完整的成长编年史。
- 学习型选手:统计自己在技术社区的活动轨迹,找出学习热点和盲区,规划下一阶段该补什么。
说白了,数据是死的,怎么用是活的。InfoSpider 的价值不只是帮你存数据,而是把"用数据做决策"这件事变成可能。
新手最容易踩的坑,提前给你排雷
- Cookie 过期:登录状态失效后提取会失败,重新登录再取一次就行。
- ChromeDriver 版本不匹配:报错多半是这个,去装一个跟你浏览器版本对应的驱动。
- 依赖装不上:建议在干净的虚拟环境里跑
pip install -r requirements.txt。 - 数据量大内存吃紧:别一次性贪多,分平台、分批次提取更稳妥。
- 公共网络操作:不要在陌生 Wi-Fi 下导出敏感数据,安全第一。
快问快答:你最关心的几个问题
问:会不会被封号? 答:它调用的是你账号自己的数据接口,访问频率也做了控制,正常使用很安全。
问:提取的数据格式统一吗? 答:统一是 JSON,方便你自己写脚本分析,也方便迁移。
问:我想加一个新平台怎么办? 答:每个数据源都是独立模块,源码就摆在 Spiders 目录下,照着已有模块改就行,门槛不高。
下一步,从备份第一份个人数据开始
回到开头那个问题:你的个人数据,真的完整属于你吗?过去,答案可能是否定的;现在,InfoSpider 给了你一个说"是"的机会。
行动清单很简短:克隆仓库(git clone https://gitcode.com/GitHub_Trending/in/InfoSpider)、装依赖、跑 tools 里的主程序、从你最常用的平台开始导出第一份个人数据。别追求一次全搞定,先备份一个平台,哪怕只是 B 站的观看历史,你也会发现——原来拿回属于自己的数字资产,是一件这么简单的事。
【免费下载链接】InfoSpiderINFO-SPIDER 是一个集众多数据源于一身的爬虫工具箱🧰,旨在安全快捷的帮助用户拿回自己的数据,工具代码开源,流程透明。支持数据源包括GitHub、QQ邮箱、网易邮箱、阿里邮箱、新浪邮箱、Hotmail邮箱、Outlook邮箱、京东、淘宝、支付宝、中国移动、中国联通、中国电信、知乎、哔哩哔哩、网易云音乐、QQ好友、QQ群、生成朋友圈相册、浏览器浏览历史、12306、博客园、CSDN博客、开源中国博客、简书。项目地址: https://gitcode.com/GitHub_Trending/in/InfoSpider
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考