5分钟学会个人数据提取:用InfoSpider爬虫工具箱拿回你的完整数字资产
【免费下载链接】InfoSpiderINFO-SPIDER 是一个集众多数据源于一身的爬虫工具箱🧰,旨在安全快捷的帮助用户拿回自己的数据,工具代码开源,流程透明。支持数据源包括GitHub、QQ邮箱、网易邮箱、阿里邮箱、新浪邮箱、Hotmail邮箱、Outlook邮箱、京东、淘宝、支付宝、中国移动、中国联通、中国电信、知乎、哔哩哔哩、网易云音乐、QQ好友、QQ群、生成朋友圈相册、浏览器浏览历史、12306、博客园、CSDN博客、开源中国博客、简书。项目地址: https://gitcode.com/GitHub_Trending/in/InfoSpider
深夜十一点,你关掉B站准备睡觉,突然有点好奇:这一年我到底看了多少视频?又是什么时候看的?你打开历史记录想翻一翻,却发现页面只显示最近三个月,再往前,一片空白。不止B站——淘宝的订单、网易云音乐的听歌排行、GitHub的代码贡献,它们统统散落在各个平台里,你看得见,却带不走。
直到你遇见 InfoSpider——一个开源的爬虫工具箱,它的使命简单得有点酷:安全快捷地帮你拿回属于自己的个人数据。你只需要点几下鼠标,B站观看历史、京东订单、知乎点赞、浏览器浏览记录……这些本该属于你的数字资产,就能以统一的JSON格式完整下载到你的电脑里。
一个工具箱,收拢你散落各处的"数据碎片"
想想看,如果没有它,你想备份个人数据是什么体验?
没有它:打开每个平台,翻设置找导出功能,大多数平台压根不提供;手动复制粘贴,几百条记录能折腾一晚上;更别提想统一分析自己的消费和观影习惯了。
有它:InfoSpider把超过24个主流数据源收进一个界面——GitHub、QQ/网易/阿里/新浪邮箱、京东、淘宝、支付宝、移动联通电信、知乎、哔哩哔哩、网易云音乐、QQ好友与群、朋友圈相册、浏览器历史、12306、博客园、CSDN、简书……点一下对应图标,浏览器自动弹出帮你登录,登录后数据就自动爬取回本地,你唯一要做的,是选一个保存文件夹。
整个过程代码全开源、流程全透明,数据只在你的电脑上流转,不上传任何服务器。所有爬虫脚本都放在项目的 Spiders 目录下,每个数据源相互独立,想看哪个平台的提取逻辑,打开对应文件夹就能研究。
三步跑起来:装环境、进目录、敲一行命令
上手比想象中简单,先克隆仓库:
git clone https://gitcode.com/GitHub_Trending/in/InfoSpider cd InfoSpider然后准备两样东西:Python 3 环境,以及一个与你 Chrome 浏览器版本完全匹配的 ChromeDriver。依赖安装一行搞定——pip install -r requirements.txt(Windows 上),Linux 用户直接跑 install_deps.sh 脚本。
最后进入 tools 目录,运行主程序:
cd tools python main.py一个印着"拿回你的个人信息"的窗口就会弹出来,里面整整齐齐排列着二十多个数据源图标,就像一盒多功能的数字瑞士军刀。
第一次实操:从启动到拿到B站完整数据
我以B站为例,带你完整走一遍,其他平台的操作逻辑完全一样。
窗口打开后,点击"哔哩哔哩"按钮。程序会自动启动 Chrome 并跳转到B站登录页,你像平时一样扫码或输密码登录即可:
登录成功的瞬间,程序会自动捕获你的登录信息,随后弹出一个文件夹选择框。这里有个小建议:为每个数据源单独建一个文件夹,比如bilibili_backup,因为一次提取可能会生成多个文件:
点击确认后,底部状态栏会显示"爬取中……",浏览器自动关闭后变成"爬取完成!"。打开你选的文件夹,惊喜出现了——两个 JSON 文件安静地躺在那里:
bilibili_history.json装着你完整的观看历史(注意,是全部,不是三个月),user_info.json是你的账号信息和等级数据。用文本编辑器打开就能看,用程序解析也不费劲,格式统一清爽。
试试看京东:登录后你会收获更多,包括收货地址、浏览足迹、白条信息、金融收益、关注的店铺和商品等,一整套 JSON 文件整齐排列,堪称你的"消费全景图":
可能你还不知道的三个隐藏玩法
第一,浏览器历史也能整体搬走。程序里的"Chrome历史记录"图标,能把你的上网足迹完整导出。翻翻三个月前的网页浏览记录,看看自己当初为什么搜索那个关键词,意外地很有回忆感。
第二,技术创作数据可视化分析。博客园、CSDN、开源中国、简书这四类数据源在提取数据之外,还额外提供数据分析功能——基于你的个人数据生成 HTML 图表文件。发文数量趋势、写作时间分布、热门博文排行,一眼看穿自己这几年的创作轨迹。
第三,邮箱全家桶一次搞定。QQ、网易、阿里、新浪、Hotmail、Outlook,六种主流邮箱全在支持列表里,邮件备份不再是各平台来回切换的苦差事。
你可能会问的几个问题
Q:会不会爬错别人的数据?不会。所有爬虫都只调用平台官方 API,且仅访问你自己账号下的数据,全程用你本人登录的凭证,不涉及任何他人隐私。
Q:数据安全吗?会不会被工具偷走?代码完全开源,你可以逐行审查它做了什么。所有数据只在本地处理,不上传任何服务器。官方文档在 docs/QuickStart.md 和 docs/README.md 里,操作前不放心可以先翻一遍。
Q:运行时报 ChromeDriver 版本错误怎么办?这是最常见的坑。下载与你 Chrome 浏览器完全同版本的驱动,放到系统 PATH 包含的目录,基本就能解决。
Q:只有 Windows 能跑吗?目前主流程在 Windows 下运行最顺畅,Linux 环境也提供了一键安装脚本,可以先尝试,若遇到问题去项目 Issue 区反馈即可。
现在,把数据主权拿回自己手里
你的每一次搜索、每一笔订单、每一首单曲循环,都在互联网上留下了你的影子。与其让这些数据沉睡在平台的黑箱里,不如花五分钟,把它们接回家。
克隆仓库、安装依赖、运行python main.py,然后点开你最常用的那个平台图标——你会发现,"我的数据我做主"不是一句口号,而是一个下午就能完成的小工程。
拿回数据只是开始,读懂自己才是真正的收获。
【免费下载链接】InfoSpiderINFO-SPIDER 是一个集众多数据源于一身的爬虫工具箱🧰,旨在安全快捷的帮助用户拿回自己的数据,工具代码开源,流程透明。支持数据源包括GitHub、QQ邮箱、网易邮箱、阿里邮箱、新浪邮箱、Hotmail邮箱、Outlook邮箱、京东、淘宝、支付宝、中国移动、中国联通、中国电信、知乎、哔哩哔哩、网易云音乐、QQ好友、QQ群、生成朋友圈相册、浏览器浏览历史、12306、博客园、CSDN博客、开源中国博客、简书。项目地址: https://gitcode.com/GitHub_Trending/in/InfoSpider
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考