ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

GetQzonehistory 五分钟上手指南:完整备份 QQ 空间说说与图片到本地

GetQzonehistory 五分钟上手指南:完整备份 QQ 空间说说与图片到本地 GetQzonehistory 五分钟上手指南完整备份 QQ 空间说说与图片到本地【免费下载链接】GetQzonehistory获取QQ空间发布的历史说说项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory翻到第 9 页2013 年的那条说说还躺在消息列表里。但历史数据能留多久、留多少从来不由你说了算平台接口一改某些内容就再也抓不出来了。GetQzonehistory 是一款免费开源的 Python 工具用来做 QQ 空间说说备份手机扫码登录后把账号下能获取到的全部历史说说、评论和图片导出成本地文件不经过任何第三方服务器整个处理过程都发生在你的电脑上。第一次备份从哪里开始克隆到扫码一共 5 步git clone https://gitcode.com/GitHub_Trending/ge/GetQzonehistory cd GetQzonehistory pip install -r requirements.txt python main.py依赖不多requests、pandas、beautifulsoup4、qrcode 这几个完整清单在 requirements.txt 里。想隔离环境就python -m venv myenv建一个虚拟环境再装一遍依赖流程不变。两个第一次运行时常见的问题依赖 pyzbar 需要系统里的 zbar 共享库缺失时程序会提示并直接退出Linux 上sudo dnf install -y zbar即可解决提示出自 util/LoginUtil.py。配置读取自resource/config/config.ini见 util/ConfigUtil.py但该文件没有包含在仓库里克隆后需要自己建一个内容只有三行[File] temp resource/temp/ user resource/user/ result resource/result/程序跑起来后终端会打印一个登录二维码用手机 QQ 扫码确认即可。登录状态缓存到resource/user/目录下次运行选择账号序号继续输入 0 重新扫码。不想碰命令行也没关系README.MD 提到 release 页有打包好的单文件可以直接执行。备份文件夹里有什么7 类产出一次说清跑完后resource/result/QQ号/下会出现这些东西程序结束前会自动打开这个文件夹并在控制台打印统计消息总条数、最早一条说说的时间、好友数、图片数。QQ号_全部列表.xlsx所有消息含时间、内容、图片链接、评论 4 列评论列存的是结构化数组时间、内容、昵称、QQ 号QQ号_说说列表.xlsx和QQ号_转发列表.xlsx自己的原创与转发内容分开存放分类依据是消息里是否出现“转发”等关键词QQ号_留言列表.xlsx和QQ号_其他列表.xlsx好友留下的留言以及其余互动消息QQ号_好友列表.xlsx好友昵称、QQ 号、空间主页链接QQ号_说说网页版.html仿空间动态流排版的网页双击就能翻看原创和转发里面的图片链接会自动替换为高清版本在线加载pic/目录说说里的图片逐张下载为 jpg文件名取说说内容前 40 个字符重名时追加时间戳按时间或内容筛选用 Excel按原始界面翻看用 HTML图片本身在pic/里按文件名对应。哪些说说拿不到3 类会漏的数据数据来自两个接口QQ 空间历史消息列表以及“全部可见说说”接口后者能覆盖到 2014 年之前。两边都没有的内容就拿不到README.MD 里也写明了这一点设置为“仅自己可见”的说说不在可见说说接口的返回里已删除的说说两个接口都不会再返回视频只保留链接不会下载视频文件本身另外消息列表接口是分页拉取的某一批请求超时会跳过该批继续出现少量缺漏属正常现象。中途按 CtrlC 退出不会丢数据程序注册了信号处理会先把已抓到的内容存盘再结束。备份要花多久按代码里的间隔估算代码中的请求间隔是写死的耗时基本由说说总量决定历史消息列表每次取 10 条请求函数内停 5 秒、批末再停 3 秒10 条约 8 秒1000 条大约 15 分钟正式拉取前会先二分探测消息总量上限 1000 万约 23 次请求每次带 5 秒停顿几分钟内结束“全部可见说说”每次取 30 条、间隔 0.02 秒这一步本身不慢图片逐张下载耗时随图片数量线性增加千图账号要预留相当一段时间会改代码的人两个入口架构很简单main.py 是唯一主入口util/ 下 5 个模块分别管登录、请求、解析、配置和 HTML 渲染主流程都摆在 main.py 里不容易迷路。想换 HTML 配色或者改成输出 Markdown、JSON从 util/ToolsUtil.py 里的get_html_template()下手网页模板就写在那里只想要 Markdown 不想开 Excel可以看 fetch_all_message.py独立入口只拉可见说说写成“所有可见说说.md”图片一并下载到resource/fetch-all/收尾备份这件事做一次就够把resource/result/整个目录复制到移动硬盘或网盘顺手删掉存放登录缓存的resource/user/然后就不用再惦记了。如果最近有空找个晚上扫一次码跑完剩下的交给时间。【免费下载链接】GetQzonehistory获取QQ空间发布的历史说说项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表