ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

15 分钟备份一个抖音主页:抖音批量下载与增量同步实战

15 分钟备份一个抖音主页:抖音批量下载与增量同步实战 15 分钟备份一个抖音主页抖音批量下载与增量同步实战【免费下载链接】douyin-downloaderA practical Douyin downloader for both single-item and profile batch downloads, with progress display, retries, SQLite deduplication, and browser fallback support. 抖音批量下载工具去水印支持视频、图集、合集、音乐(原声)。项目地址: https://gitcode.com/GitHub_Trending/do/douyin-downloader把博主主页整页备份下来、把竞品素材一条条收进素材库抖音批量下载靠手动做非常耗时。开源项目 douyin-downloader 把这件事自动化贴一个抖音链接它自动判断是视频、合集还是主页并批量拉取无水印视频封面、BGM、元数据一并落地。5 分钟跑通抖音批量下载这一节直接回答三个问题装在哪、通行证从哪来、第一个任务怎么发。环境要求只有一条Python 3.8。克隆后装依赖git clone https://gitcode.com/GitHub_Trending/do/douyin-downloader cd douyin-downloader pip install -r requirements.txt # 可选需要自动获取 Cookie或浏览器兜底时再装一个无头浏览器 pip install playwright python -m playwright install chromiumCookie 三种配法怎么选Cookie 是访问抖音接口的通行证没有它部分主页接口拿不到数据。三种配法按推荐顺序排自动获取运行 Cookie 抓取脚本会自动打开浏览器你登录完回终端按 Enter字段直接写进配置最省心整串粘贴从浏览器开发者工具复制完整 Cookie 字符串整段填进配置文件键值对填写msToken、ttwid、sid_guard逐字段填结构最清晰但字段一多最容易填错。# 自动方式浏览器登录完成后回终端按 Enter python -m tools.cookie_fetcher --config config.yml # 跑第一个任务 python run.py -c config.yml最小可运行配置配置文件保留这几个字段就能跑起来多余的后面再按需加link: - https://www.douyin.com/user/你的目标博主ID path: ./Downloaded/ mode: - post # 发布作品也可加 like / mix / music number: post: 50 # 最多 50 条0 表示全量 thread: 5 retry_times: 3 database: true increase: post: true # 只取新作品命令行会实时刷进度条跑完自动汇总成功 / 失败 / 跳过数量。7 种链接形态它都能认你不需要告诉它这是什么类型的下载。链接解析与下载器装配在 core/ 目录里按 URL 形态自动匹配链接形态拿到的内容/video/视频ID单条短视频/note/笔记ID、/gallery/笔记ID图文笔记/collection/合集ID、/mix/合集ID整个合集/music/音乐ID该原声下的所有作品/user/用户ID博主主页配合 mode 批量下载v.douyin.com/短链分享短链自动展开后下载live.douyin.com/直播间直播录制live.max_duration_seconds: 0录到主播下播它认得出的链接按上表七种全覆盖认不出的链接会明确报错退出不会闷头跑空。下载产物每个作品落地一整套视频默认走无水印源并在码率档位里自动挑最高画质。视频本体之外封面、背景音乐、作者头像、JSON 元数据点赞数、评论数、发布时间、话题标签都可以用开关开启。文件按作者 / 模式 / 作品三层归档Downloaded/ ├── download_manifest.jsonl # 下载清单每行一条 JSON └── 作者名/ └── post/ └── 2024-02-07_作品标题_作品ID/ ├── 2024-02-07_作品标题_作品ID.mp4 ├── 2024-02-07_作品标题_作品ID_cover.jpg ├── 2024-02-07_作品标题_作品ID_music.mp3 └── 2024-02-07_作品标题_作品ID_data.json文件夹里的日期取自作品发布时间而不是下载时间隔三个月再备份时间线依然整齐。根目录的download_manifest.jsonl清单记录日期、作者、标题、文件路径方便后期检索和二次处理。增量同步怎么开下过就不再碰批量下载最费的是重复拉取——博主新更 10 条你重跑一遍却把 100 条全下了。工具用 storage/database.py 里的 SQLite 数据库解决每下载一条就把作品 ID、作者、发布时间、保存路径写库再次运行已存在的直接跳过。开关就两个配置项database: true # 去重数据库默认开启 increase: post: true # 跳过已下载只取新增每天挂一次定时任务效果等同自动追更新作品进来旧的绝不动。做博主监控或长期素材库这一条能省下大量带宽和磁盘。命名模板与时间范围过滤怎么配默认的日期_标题_ID不够用时用filename_template从变量里自由拼装可用变量定义在 utils/naming.pyfilename_template: {date}_{author}_{title}_{id} start_time: 2024-01-01 end_time: 2024-12-31常用变量有date、author、title、id、year、month、type、mode写错变量会直接报错。start_time/end_time是很多人忽略的利器做年度盘点或时间段研究时配合number数量限制就能精确圈定样本不必全量拉取。⚠️ 四个高频翻车点与对策遇到下面四种情况别慌它们的行为都是可预期的Cookie 失效接口返回未登录可交互环境下自动打开浏览器重新登录并重试服务器这类非交互环境会提示你手动刷新 Cookie。主页只能抓到 20 条左右这是接口翻页风控的典型表现。确认browser_fallback.enabled: trueAPI 受限时它会切到浏览器模式滚动采集作品 ID 再补全详情headless: false下弹窗出现时手动过一下验证即可。个别视频下载失败被删、设私密、断网都会失败。工具默认跳过失败项继续跑完其余任务需要排查时加--verbose看完整日志。文件名日期不对日期优先取发布时间该字段缺失或非法时回退到当天日期并记告警属预期行为而不是 bug。调参建议网络一般时thread: 5就够盲目调高并发反而容易触发风控请求被限速时优先调低rate_limit默认 2 请求/秒而不是并发数网络波动大再把retry_times提到 5。️ 不想敲命令线用桌面版 Douzy仓库里还有配套桌面客户端 Douzy和命令行共享同一套后端逻辑。粘贴链接即可开始内容类型、保存路径全在窗口内配置关注页能同步你关注的博主、标记新作品并加备注从列表直接发起下载适合日常素材采集任务中心用列表展示每个任务的进度与状态失败项可单独重试还能一键打开输出目录不熟悉终端的用户这是最顺手的入口有自动化需求的用户命令行随时可切换两边不用重新学逻辑。把使用守住边界再交给工具跑工具能干很多但用法要有分寸用途适合个人学习、研究分析、内部资料整理不适合商业性内容分发或侵权二传频率项目内置请求间隔与并发上限别去掉限速逻辑去冲接口大规模高频抓取会干扰平台服务来源下载内容注明出处遵守平台内容使用协议不用于恶意竞争或获取隐私信息。配好后按这五步进入日常运转克隆仓库跑一遍pip install -r requirements.txt用自动方式取一次 Cookie浏览器登录即可贴一个博主主页链接跑最小配置验证产物打开database与increase让重跑只取新增挂系统定时任务每天自动执行之后只看报表。【免费下载链接】douyin-downloaderA practical Douyin downloader for both single-item and profile batch downloads, with progress display, retries, SQLite deduplication, and browser fallback support. 抖音批量下载工具去水印支持视频、图集、合集、音乐(原声)。项目地址: https://gitcode.com/GitHub_Trending/do/douyin-downloader创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表