ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Buzz 离线转录指南:3 步把会议录音变成字幕,全程免费不上云

Buzz 离线转录指南:3 步把会议录音变成字幕,全程免费不上云 Buzz 离线转录指南3 步把会议录音变成字幕全程免费不上云【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款跑在本地的音频转文字工具基于 OpenAI 的 Whisper 模型支持 99 种语言数据全程留在你的电脑里。装好之后你可以导入一段 MP3几分钟拿到带时间戳的文字稿也可以对着麦克风说话让句子实时变成字幕。先跑起来Buzz 安装各平台一条命令这一节让你在 5 分钟内装好 Buzz覆盖 Windows、macOS 和 Linux。Windows执行pip install buzz-captions再用python -m buzz启动或者从发布页下载安装包双击运行出现未验证发布者提示时选「更多信息 → 仍要运行」。macOS从发布页下载.dmg把 Buzz 拖进应用程序文件夹命令安装方式与 Windows 相同。Linuxsudo snap install buzz首次启动会自动下载基础转录模型等它完成即可。之后按 CtrlMac 上是 Command加逗号打开设置窗口在模型设置里能看到下载进度也可以提前把常用模型下好。第一次转录4 步从音频到文字这一节带你走最短路径拿到第一份文字稿。点工具栏的号或 Ctrl/Command O选中音频文件MP3、WAV、M4A、MP4 都支持。选择文件使用的语言——手动指定比自动检测更稳定模型保持默认 Base 即可。点 Run等状态列显示Completed。双击该行打开转录结果选一个格式导出文字稿就成了。如果音频里有人名、地名或专业术语可以把容易拼错的词写进初始提示导入后点Advanced…按钮模型生成文字时会参照它减少错字。三种用法单文件、批量队列、实时录音这一节把 Buzz 的三种任务类型分清楚你对号入座选一种就行。单文件转录导入一个文件选模型和语言点 Run。适合把单条采访、讲座、播客变成文稿。它和第一次转录的区别只在一处跑完发现准确率不满意可以换一个更大的模型重新跑。批量队列按住 Ctrl 一次选中多个文件它们全部进入任务列表按顺序处理单个任务可以暂停、恢复。适合一次导入整季播客或一门课的录音。再进一步可以配置监控文件夹新音频放进指定目录就自动开始转录不用手动导入。实时录音 ️在实时录音区域选好麦克风、语言和模型点 Record句子会逐句出现在屏幕上还可以打开演示窗口把字幕放大投屏。适合会议纪要、活动现场字幕。提醒一句实时转录吃性能模型选小了才跟得上语速。字幕与导出 SRT、VTT、TXT 三种格式这一节解决文字稿怎么变成能用的视频字幕。双击打开转录结果底部时间轴和文字同步拖动或直接输入秒数就能改每一段的起止时间。点Resize重新切分字幕单行最大长度建议40~50 个字符开启按标点拆分想让字幕在屏幕上多留一会儿可以把每段结束时间延长 0.2~0.5 秒。导出格式三种SRT 给剪辑软件VTT 给网页播放器TXT 要纯文字就用它。转录前如果勾选了词级时间戳Resize 会依据每个词的时间点切分合并和拆分都更准。模型怎么选Whisper 五档一张表这一节帮你按电脑内存直接定档位不用自己猜。模型速度内存约需适合场景tiny最快1GB实时录音、快速草稿base快~1GB日常使用默认选择small中等~2GB速度和准确率平衡medium慢~5GB专业转录、有背景噪音的音频large最慢~10GB追求最高准确率结论默认用base内存有 16GB 可以直接上small准确率不满意时先升到medium再考虑更大的。模型在设置 - 模型设置里按需下载、删除空间紧张时选量化版本如 q5内存省掉近一半准确率损失不大。避坑指南 ⚠️6 个高频问题以下是最常见的 6 个问题每条给出原因和解决办法。语言检测识别错——自动检测靠开头几秒音频开头是音乐或噪音就容易误判 → 手动指定语言速度还更快。Windows 安装时提示未验证发布者——程序未签名导致的正常现象 → 点「更多信息 → 仍要运行」即可。实时录音卡顿、句子出不来——默认转录链路比较吃资源 → 改用 Whisper.cpp 引擎配 tiny 或 base 模型关掉其他占资源的应用。模型下载慢或失败——模型文件从几十 MB 到几 GB 不等 → 网络好的时候重试也可以手动下载模型文件放进模型目录用环境变量BUZZ_MODEL_ROOT指定位置。专有名词老拼错——模型不知道说话人的背景 → 把常用名词写进初始提示。字幕行太长不好读——默认分段偏粗 → 用 Resize 工具把最大长度设到 40~50 字符。Buzz 适合三类人常处理录音的办公和媒体从业者、需要字幕的视频创作者、不想把音频交给在线服务的用户。更多操作细节见仓库文档 文件导入 与 偏好设置。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表