news 2026/8/14 12:03:24

5分钟学会个人数据提取:用InfoSpider爬虫工具箱拿回你的完整数字资产

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
5分钟学会个人数据提取:用InfoSpider爬虫工具箱拿回你的完整数字资产

5分钟学会个人数据提取:用InfoSpider爬虫工具箱拿回你的完整数字资产

【免费下载链接】InfoSpiderINFO-SPIDER 是一个集众多数据源于一身的爬虫工具箱🧰,旨在安全快捷的帮助用户拿回自己的数据,工具代码开源,流程透明。支持数据源包括GitHub、QQ邮箱、网易邮箱、阿里邮箱、新浪邮箱、Hotmail邮箱、Outlook邮箱、京东、淘宝、支付宝、中国移动、中国联通、中国电信、知乎、哔哩哔哩、网易云音乐、QQ好友、QQ群、生成朋友圈相册、浏览器浏览历史、12306、博客园、CSDN博客、开源中国博客、简书。项目地址: https://gitcode.com/GitHub_Trending/in/InfoSpider

深夜十一点,你关掉B站准备睡觉,突然有点好奇:这一年我到底看了多少视频?又是什么时候看的?你打开历史记录想翻一翻,却发现页面只显示最近三个月,再往前,一片空白。不止B站——淘宝的订单、网易云音乐的听歌排行、GitHub的代码贡献,它们统统散落在各个平台里,你看得见,却带不走。

直到你遇见 InfoSpider——一个开源的爬虫工具箱,它的使命简单得有点酷:安全快捷地帮你拿回属于自己的个人数据。你只需要点几下鼠标,B站观看历史、京东订单、知乎点赞、浏览器浏览记录……这些本该属于你的数字资产,就能以统一的JSON格式完整下载到你的电脑里。

一个工具箱,收拢你散落各处的"数据碎片"

想想看,如果没有它,你想备份个人数据是什么体验?

没有它:打开每个平台,翻设置找导出功能,大多数平台压根不提供;手动复制粘贴,几百条记录能折腾一晚上;更别提想统一分析自己的消费和观影习惯了。

有它:InfoSpider把超过24个主流数据源收进一个界面——GitHub、QQ/网易/阿里/新浪邮箱、京东、淘宝、支付宝、移动联通电信、知乎、哔哩哔哩、网易云音乐、QQ好友与群、朋友圈相册、浏览器历史、12306、博客园、CSDN、简书……点一下对应图标,浏览器自动弹出帮你登录,登录后数据就自动爬取回本地,你唯一要做的,是选一个保存文件夹。

整个过程代码全开源、流程全透明,数据只在你的电脑上流转,不上传任何服务器。所有爬虫脚本都放在项目的 Spiders 目录下,每个数据源相互独立,想看哪个平台的提取逻辑,打开对应文件夹就能研究。

三步跑起来:装环境、进目录、敲一行命令

上手比想象中简单,先克隆仓库:

git clone https://gitcode.com/GitHub_Trending/in/InfoSpider cd InfoSpider

然后准备两样东西:Python 3 环境,以及一个与你 Chrome 浏览器版本完全匹配的 ChromeDriver。依赖安装一行搞定——pip install -r requirements.txt(Windows 上),Linux 用户直接跑 install_deps.sh 脚本。

最后进入 tools 目录,运行主程序:

cd tools python main.py

一个印着"拿回你的个人信息"的窗口就会弹出来,里面整整齐齐排列着二十多个数据源图标,就像一盒多功能的数字瑞士军刀。

第一次实操:从启动到拿到B站完整数据

我以B站为例,带你完整走一遍,其他平台的操作逻辑完全一样。

窗口打开后,点击"哔哩哔哩"按钮。程序会自动启动 Chrome 并跳转到B站登录页,你像平时一样扫码或输密码登录即可:

登录成功的瞬间,程序会自动捕获你的登录信息,随后弹出一个文件夹选择框。这里有个小建议:为每个数据源单独建一个文件夹,比如bilibili_backup,因为一次提取可能会生成多个文件:

点击确认后,底部状态栏会显示"爬取中……",浏览器自动关闭后变成"爬取完成!"。打开你选的文件夹,惊喜出现了——两个 JSON 文件安静地躺在那里:

bilibili_history.json装着你完整的观看历史(注意,是全部,不是三个月),user_info.json是你的账号信息和等级数据。用文本编辑器打开就能看,用程序解析也不费劲,格式统一清爽。

试试看京东:登录后你会收获更多,包括收货地址、浏览足迹、白条信息、金融收益、关注的店铺和商品等,一整套 JSON 文件整齐排列,堪称你的"消费全景图":

可能你还不知道的三个隐藏玩法

第一,浏览器历史也能整体搬走。程序里的"Chrome历史记录"图标,能把你的上网足迹完整导出。翻翻三个月前的网页浏览记录,看看自己当初为什么搜索那个关键词,意外地很有回忆感。

第二,技术创作数据可视化分析。博客园、CSDN、开源中国、简书这四类数据源在提取数据之外,还额外提供数据分析功能——基于你的个人数据生成 HTML 图表文件。发文数量趋势、写作时间分布、热门博文排行,一眼看穿自己这几年的创作轨迹。

第三,邮箱全家桶一次搞定。QQ、网易、阿里、新浪、Hotmail、Outlook,六种主流邮箱全在支持列表里,邮件备份不再是各平台来回切换的苦差事。

你可能会问的几个问题

Q:会不会爬错别人的数据?不会。所有爬虫都只调用平台官方 API,且仅访问你自己账号下的数据,全程用你本人登录的凭证,不涉及任何他人隐私。

Q:数据安全吗?会不会被工具偷走?代码完全开源,你可以逐行审查它做了什么。所有数据只在本地处理,不上传任何服务器。官方文档在 docs/QuickStart.md 和 docs/README.md 里,操作前不放心可以先翻一遍。

Q:运行时报 ChromeDriver 版本错误怎么办?这是最常见的坑。下载与你 Chrome 浏览器完全同版本的驱动,放到系统 PATH 包含的目录,基本就能解决。

Q:只有 Windows 能跑吗?目前主流程在 Windows 下运行最顺畅,Linux 环境也提供了一键安装脚本,可以先尝试,若遇到问题去项目 Issue 区反馈即可。

现在,把数据主权拿回自己手里

你的每一次搜索、每一笔订单、每一首单曲循环,都在互联网上留下了你的影子。与其让这些数据沉睡在平台的黑箱里,不如花五分钟,把它们接回家。

克隆仓库、安装依赖、运行python main.py,然后点开你最常用的那个平台图标——你会发现,"我的数据我做主"不是一句口号,而是一个下午就能完成的小工程。

拿回数据只是开始,读懂自己才是真正的收获。

【免费下载链接】InfoSpiderINFO-SPIDER 是一个集众多数据源于一身的爬虫工具箱🧰,旨在安全快捷的帮助用户拿回自己的数据,工具代码开源,流程透明。支持数据源包括GitHub、QQ邮箱、网易邮箱、阿里邮箱、新浪邮箱、Hotmail邮箱、Outlook邮箱、京东、淘宝、支付宝、中国移动、中国联通、中国电信、知乎、哔哩哔哩、网易云音乐、QQ好友、QQ群、生成朋友圈相册、浏览器浏览历史、12306、博客园、CSDN博客、开源中国博客、简书。项目地址: https://gitcode.com/GitHub_Trending/in/InfoSpider

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/14 12:02:00

PyCharm与Conda环境配置全攻略:从虚拟环境到项目实战

1. 项目概述:为什么PyCharmConda是Python开发的黄金搭档每次打开PyCharm,面对新建项目时那个“配置解释器”的选项,你是不是也曾经一头雾水,或者干脆直接用了系统自带的Python?如果你还在这么做,那可能错过…

作者头像 李华
网站建设 2026/8/14 11:54:19

揭秘Grok图像模型:如何让AI真正看懂流程图与拓扑图

如果你最近关注AI图像理解领域,可能会注意到一个现象:很多模型在标准测试集上表现优异,但面对稍微复杂一点的图像结构——比如流程图、电路图、网络拓扑图——就立刻“露怯”,要么识别错误,要么只能给出笼统的描述。这…

作者头像 李华
网站建设 2026/8/14 11:53:03

HsMod插件终极指南:60+实用功能一键解锁炉石传说新体验

HsMod插件终极指南:60实用功能一键解锁炉石传说新体验 【免费下载链接】HsMod Hearthstone Modification Based on BepInEx 项目地址: https://gitcode.com/GitHub_Trending/hs/HsMod 你有没有过这样的时刻:打开炉石传说,明明只想痛快…

作者头像 李华