news 2026/9/20 10:55:22

5分钟跑通GetQzonehistory:QQ空间说说批量导出完整指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
5分钟跑通GetQzonehistory:QQ空间说说批量导出完整指南

5分钟跑通GetQzonehistory:QQ空间说说批量导出完整指南

【免费下载链接】GetQzonehistory获取QQ空间发布的历史说说项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory

GetQzonehistory是一个QQ空间历史说说导出工具,通过扫码登录获取账号历史消息列表,把账号发布过的说说、转发、留言整理成Excel表格和HTML网页,并批量下载说说图片,适合需要批量导出QQ空间数据做备份的人。

快速上手:3步完成QQ空间说说导出环境安装

环境要求:Python 3.8+。

  1. 克隆仓库并进入目录:
git clone https://gitcode.com/GitHub_Trending/ge/GetQzonehistory cd GetQzonehistory
  1. 创建并激活虚拟环境:
python -m venv myenv # Windows 激活: myenv\Scripts\activate # macOS/Linux 激活: source myenv/bin/activate
  1. 安装依赖并运行:
pip install -r requirements.txt python main.py
依赖用途
beautifulsoup4解析QQ空间返回的HTML消息列表
pandas数据处理与Excel导出
tqdm显示进度条
requests发起网络请求
Pillow打开并缩放登录二维码图片
openpyxl生成.xlsx文件
pyzbar解码终端中的登录二维码
qrcode在终端绘制登录二维码
fake-useragent生成随机浏览器User-Agent
chardet检测返回内容的字符编码

首次运行后,终端会生成QQ扫码登录二维码,提示"登录二维码获取成功"。用QQ扫码后终端每3秒打印一次状态(未失效/认证中/已失效/登录成功),随后依次出现"正在获取消息列表数量..."和"Progress"两个进度条,完成后自动打开结果目录,并打印消息总数、好友数、说说的最早发布时间等统计信息。

核心功能

基于消息列表的历史恢复以QQ空间互动消息列表为主要数据源,逐批翻页抓取,能取回消息列表里留存的早期说说,弥补空间主页看不到的历史内容。

可见说说补充抓取完消息列表后,再分页拉取账号当前可见的未删除说说(含2014年之前的内容),与消息列表合并后按内容去重,减少遗漏。

6个Excel分类导出最终生成全部列表、说说列表、转发列表、留言列表、其他列表、好友列表共6个Excel文件,按互动类型拆开,每类包含时间、内容、图片链接等字段。

网页版还原把说说和转发合并成一条按时间倒序的"说说网页版.html",还原头像、QQ表情、图片和评论,点击图片可在新标签页打开。

中断自动保存程序注册了信号处理,运行中按Ctrl+C会立即保存已抓取的数据,中途退出不会丢掉进度。

工作原理(简化版)

GetQzonehistory/ ├── main.py # 主入口:抓取、分类、保存 ├── fetch_all_message.py # 独立脚本:导出全部可见未删除说说 └── util/ # 工具模块 ├── LoginUtil.py # 扫码登录与cookie管理 ├── RequestUtil.py # 消息列表请求与数量探测 ├── GetAllMomentsUtil.py # 可见未删除说说获取 ├── ConfigUtil.py # 目录配置与用户cookie存取 └── ToolsUtil.py # HTML模板与通用处理函数

数据流共5步:

  1. 扫码登录,cookie保存到resource/user/,下次运行可直接选择已登录账号(详见LoginUtil.py)。
  2. 用二分查找探测消息列表总条数。
  3. 按每批10条分页拉取,批与批之间暂停3秒,用BeautifulSoup解析每条记录的昵称、QQ号、时间、内容和图片链接。
  4. 分页拉取可见的未删除说说(每页30条)做补充,并与已有数据去重。
  5. 按内容分类写入Excel和HTML,下载全部图片后打印统计信息。

输出成果

运行完成后,结果生成在resource/result/你的QQ号/目录下:

  1. QQ号_全部列表.xlsx- 抓取到的全部历史消息,含时间、内容、图片链接、评论4列
  2. QQ号_说说列表.xlsx- 你本人发布的说说
  3. QQ号_转发列表.xlsx- 你本人的转发记录
  4. QQ号_留言列表.xlsx- 你本人的留言
  5. QQ号_其他列表.xlsx- 好友产生的其他互动消息
  6. QQ号_好友列表.xlsx- 互动好友的昵称、QQ号、空间主页
  7. QQ号_说说网页版.html- 网页版时间线,图片可点击放大
  8. pic/目录 - 所有说说图片,按"说说内容"命名(非法字符替换为下划线,超过40字符截断),重名时追加时间戳

实用技巧

用Excel做二次统计:6个表结构一致,用数据透视表按年份对"时间"列分组计数,就能统计每年发布说说的数量。

自定义网页版样式说说网页版.html内嵌了全部CSS,直接编辑.post等样式类,即可调整背景色和卡片布局,再另存为PDF或截图分享。

重复运行免扫码:cookie按QQ号存在resource/user/下,下次启动时选择已登录用户序号即可跳过扫码,输入0重新登录。

常见问题

macOS/Linux运行提示找不到zbar共享库

pyzbar依赖zbar系统库,Python包本身不带。macOS执行brew install zbar,RPM系Linux执行sudo dnf install -y zbar,安装后重新运行python main.py即可。

登录后没有获取到数据

多为网络或登录态问题。先确认浏览器能正常打开QQ空间网页版,再删除resource/user/下对应的cookie文件重新扫码;若单批提示"获取消息失败",程序会跳过该批次继续抓取,可稍后重跑补全。

导出的数据比预期少

工具以消息列表为主要来源,从未出现在消息列表里、或仅自己可见的早期说说无法获取;可见的未删除说说是补充来源。这是数据源特性,不是程序缺陷。

图片下载失败

部分原始图片链接已失效,程序会跳过非HTTP或下载失败的链接继续处理,不影响其他文件导出。

运行中断后如何恢复

抓取期间直接按Ctrl+C,信号处理会立即保存已有数据到resource/result/。由于每批请求固定等待3秒,数据量大时总耗时较长,中断后重新运行可继续补全。

使用须知

程序每批抓取10条消息、批间暂停3秒,消息量大时抓取阶段可能需要30分钟以上,请勿关闭窗口。图片逐张下载并写入磁盘,说说过千时建议预留1GB以上空间。

本工具仅供个人学习和技术研究使用,不得用于商业或非法用途。使用即表示同意遵守QQ平台相关条款及法律法规,尊重他人版权与隐私,作者对使用本工具产生的后果不承担责任。

GetQzonehistory把QQ空间历史说说的批量导出压缩为一次扫码加一次运行,适合需要长期备份空间数据的人,仓库地址见文首git clone链接。

【免费下载链接】GetQzonehistory获取QQ空间发布的历史说说项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/20 10:54:11

前端转战AI应用开发:手把手打造内部知识库问答助手

前端这个圈子这些年有个很有趣的现象:一到技术转型节点,跳得最欢的往往不是后端,而是天天跟页面打交道的前端。前两篇我们聊了本地大模型部署和对话网页怎么搭,今天这篇我打算换个节奏,从一个真实需求出发,…

作者头像 李华
网站建设 2026/9/20 10:54:05

eNSP安装避坑指南:从VirtualBox版本选择到高频报错排查

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/20 10:53:34

OpenResearch本地优先研究工作流:原理、验证与AI可替换实践

1. 项目概述:一个被误读的开源研究协作范式“OpenResearch”这个词最近在开发者社区里频繁出现,但很多人一看到就下意识联想到某个具体工具、某个CLI命令,甚至直接去搜“orx install”或者“autoresearch setup”。其实这恰恰暴露了一个普遍存…

作者头像 李华
网站建设 2026/9/20 10:52:28

GAC水平集图像分割:PDE驱动的自演化边界模型

简介:本资源是面向图像处理初学者与计算机视觉学习者的Matlab实践项目,聚焦Geodesic Active Contours(GAC)水平集图像分割算法的完整实现,解决边界模糊、光照不均等典型图像分割难题,适用于医学影像分析、目…

作者头像 李华
网站建设 2026/9/20 10:52:25

第四次工业革命:从技术堆叠到系统重构的产业逻辑

1. 从“技术堆叠”到“系统重构”:产业逻辑到底在变什么很多技术人聊到第四次工业革命,第一反应是“AI、物联网、大数据、云计算”,然后把这些词像贴标签一样往PPT上堆。但如果你真的在制造业、物流、能源或者医疗行业待过,就会发…

作者头像 李华