news 2026/8/14 11:46:30

把散落在 25 个平台里的个人数据,用一个开源爬虫工具箱全部捡回来

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
把散落在 25 个平台里的个人数据,用一个开源爬虫工具箱全部捡回来

把散落在 25 个平台里的个人数据,用一个开源爬虫工具箱全部捡回来

【免费下载链接】InfoSpiderINFO-SPIDER 是一个集众多数据源于一身的爬虫工具箱🧰,旨在安全快捷的帮助用户拿回自己的数据,工具代码开源,流程透明。支持数据源包括GitHub、QQ邮箱、网易邮箱、阿里邮箱、新浪邮箱、Hotmail邮箱、Outlook邮箱、京东、淘宝、支付宝、中国移动、中国联通、中国电信、知乎、哔哩哔哩、网易云音乐、QQ好友、QQ群、生成朋友圈相册、浏览器浏览历史、12306、博客园、CSDN博客、开源中国博客、简书。项目地址: https://gitcode.com/GitHub_Trending/in/InfoSpider

你有没有算过,自己的个人数据散落在多少个平台里?B 站的观影记录、淘宝的订单、GitHub 的代码提交、知乎的点赞收藏……这些数字资产平时感觉不到重量,可一旦想翻找某条旧记录,往往哪个平台都找不全。InfoSpider 就是为此而生的开源爬虫工具箱——它专门帮你把这些个人数据安全、完整地拿回本地,真正做到"我的数据我做主"。

想翻回三年前的一条弹幕,结果哪都找不到

去年年底,我想找一条三年前在 B 站发过的评论。登录账号,翻收藏、翻历史、翻动态,全都没有。弹幕和评论这种"边角料"数据,平台压根不提供导出入口。类似的憋屈我遇到过很多次:换了手机想找回旧订单,网页存档早就失效;想统计这些年到底写了多少篇博客,只能一篇篇手动数。

平台不是没有数据,它们只是把"导出"这件事做得极其麻烦。手动复制粘贴吧,几百条记录复制到手酸;平台自带导出功能吧,有的根本没这功能,有的导出格式混乱得没法看。我的个人数据明明属于我,想要一份完整的副本,却比登天还难。

转折:一个把数据"搬回家"的开源爬虫工具箱

直到我在开发者社区里翻到 InfoSpider,才觉得这事儿有解了。它是一个开源的个人数据爬虫工具箱,代码全部公开、流程透明,支持的数据源超过二十个:GitHub、QQ 邮箱、网易邮箱、京东、淘宝、支付宝、知乎、哔哩哔哩、网易云音乐、QQ 好友、QQ 群、朋友圈相册、浏览器历史、12306、移动联通电信、博客园、CSDN、开源中国、简书……几乎覆盖了普通人数字生活的方方面面。

它做的事很简单:帮你登录自己的账号,调用官方接口,把属于你的数据整理成整齐的 JSON 文件,存到你指定的文件夹。全程在你自己的电脑上运行,数据不会上传到任何服务器。

五分钟上手:先拿 B 站个人数据练手

光说不练没意思,咱们直接来一遍,整个过程大概四步:

第一步,进入项目目录下的 tools 文件夹,运行python main.py,程序会弹出主界面,就是上面那张图,点一下"哔哩哔哩"。

第二步,在浏览器里登录 B 站,按 F12 打开开发者工具,切到 Network 标签,刷新页面,随便挑一个请求,把 Cookie 复制出来,贴进脚本对应位置。

第三步,运行python Spiders/bilibili/main.py。程序会验证登录状态,然后弹出一个文件夹选择框——给这批数据找个新家。

第四步,等它跑完,打开那个文件夹,你会看到两个 JSON 文件:bilibili_history.json 是完整的观看历史,user_info.json 是你的账号信息。

整个过程不涉及任何"黑科技",就是把本该属于你的东西,用合法的方式拿回来。其他平台的操作逻辑大同小异,会一个,剩下的都能照葫芦画瓢。

拿回数据之后,能干点什么

别觉得这只是"备份",数据到手后的玩法多着呢:

  • 分析型选手:把 B 站观看历史导进表格,看看自己晚上十点后到底刷了多少视频;把淘宝订单拉出来,算算一年在"冲动消费"上花了多少钱。
  • 记录型选手:把 GitHub 的提交记录、博客园和 CSDN 的博文存档,多年后翻出来,就是一份完整的成长编年史。
  • 学习型选手:统计自己在技术社区的活动轨迹,找出学习热点和盲区,规划下一阶段该补什么。

说白了,数据是死的,怎么用是活的。InfoSpider 的价值不只是帮你存数据,而是把"用数据做决策"这件事变成可能。

新手最容易踩的坑,提前给你排雷

  • Cookie 过期:登录状态失效后提取会失败,重新登录再取一次就行。
  • ChromeDriver 版本不匹配:报错多半是这个,去装一个跟你浏览器版本对应的驱动。
  • 依赖装不上:建议在干净的虚拟环境里跑pip install -r requirements.txt
  • 数据量大内存吃紧:别一次性贪多,分平台、分批次提取更稳妥。
  • 公共网络操作:不要在陌生 Wi-Fi 下导出敏感数据,安全第一。

快问快答:你最关心的几个问题

问:会不会被封号? 答:它调用的是你账号自己的数据接口,访问频率也做了控制,正常使用很安全。

问:提取的数据格式统一吗? 答:统一是 JSON,方便你自己写脚本分析,也方便迁移。

问:我想加一个新平台怎么办? 答:每个数据源都是独立模块,源码就摆在 Spiders 目录下,照着已有模块改就行,门槛不高。

下一步,从备份第一份个人数据开始

回到开头那个问题:你的个人数据,真的完整属于你吗?过去,答案可能是否定的;现在,InfoSpider 给了你一个说"是"的机会。

行动清单很简短:克隆仓库(git clone https://gitcode.com/GitHub_Trending/in/InfoSpider)、装依赖、跑 tools 里的主程序、从你最常用的平台开始导出第一份个人数据。别追求一次全搞定,先备份一个平台,哪怕只是 B 站的观看历史,你也会发现——原来拿回属于自己的数字资产,是一件这么简单的事。

【免费下载链接】InfoSpiderINFO-SPIDER 是一个集众多数据源于一身的爬虫工具箱🧰,旨在安全快捷的帮助用户拿回自己的数据,工具代码开源,流程透明。支持数据源包括GitHub、QQ邮箱、网易邮箱、阿里邮箱、新浪邮箱、Hotmail邮箱、Outlook邮箱、京东、淘宝、支付宝、中国移动、中国联通、中国电信、知乎、哔哩哔哩、网易云音乐、QQ好友、QQ群、生成朋友圈相册、浏览器浏览历史、12306、博客园、CSDN博客、开源中国博客、简书。项目地址: https://gitcode.com/GitHub_Trending/in/InfoSpider

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/14 11:45:19

Trolol新手入门:最有趣的5个整蛊命令,让朋友哭笑不得

Trolol新手入门:最有趣的5个整蛊命令,让朋友哭笑不得 【免费下载链接】trolol Troll your friends with simple commands AS QUICKLY AS POSSIBLE 项目地址: https://gitcode.com/gh_mirrors/tr/trolol Trolol是一款专为整蛊爱好者设计的命令行工…

作者头像 李华
网站建设 2026/8/14 11:45:06

Windows环境下基于Docker部署Snipe-IT开源IT资产管理系统实战指南

在IT资产管理领域,手工记录设备信息、追踪资产状态和审批流程不仅效率低下,而且极易出错。当团队规模扩大或设备数量激增时,一个集中化、可视化的资产管理系统就成为刚需。Snipe-IT 作为一款开源的IT资产管理系统,因其功能全面、部…

作者头像 李华