ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Buzz:从录音到逐字稿的 5 分钟离线语音识别

Buzz:从录音到逐字稿的 5 分钟离线语音识别 Buzz从录音到逐字稿的 5 分钟离线语音识别【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz周五下午四点一场 40 分钟的跨部门会议刚散场你要在今晚复盘前拿到逐字稿。把录音拖进 Buzz几分钟后一份带时间戳的文本就躺在桌面整个过程音频文件没有离开过这台电脑。这就是 Buzz 主打的离线语音识别模型和音频都在本地没有上传环节。一分钟搞清楚 Buzz 是什么Buzz 是一个桌面应用内核是 OpenAI 开源的 Whisper 模型把声音转成文字的大模型加若干本地推理后端把它理解成 Whisper 的桌面客户端就对了。它装在 Windows、macOS 或 Linux 上转录和翻译都跑在你自己的机器里只有第一次下载模型权重需要联网。适合不想把会议、访谈、课程录音交给第三方服务的个人和团队。跑起来之后你会发现它更像一台本地录音转写工作台批量排队、说话人标注、字幕导出都是流程的一部分。从下载到出第一条逐字稿Windows从官方渠道下载安装包安装向导会提示应用未签名点“更多信息”→“仍要运行”即可装完。macOS下载 .dmg把应用拖进应用程序文件夹Apple Silicon 芯片原生加速。Linux终端执行flatpak install flathub io.github.chidiwilliams.BuzzFlatpak 是把应用装在独立沙箱里的 Linux 打包格式或执行sudo snap install buzz安装 Snap 包。开发者版需要 Python 3.12 并预装好 ffmpeg然后pip install buzz-captions python -m buzz第一次转录点工具栏“”号或 Ctrl/CmdO选中一段录音任务保持默认的 transcribe点 Run。状态列显示 Completed 后双击那一行打开转录页。音频怎么进来逐字稿怎么出去输入有三种入口文件MP3/WAV/FLAC/M4A/OGG 音频、MP4/MKV 等视频自动抽音频用拖拽或 Ctrl/CmdO 触发链接把 YouTube 地址当任务粘贴进去Buzz 先下载再转录实时点麦克风按钮从麦克风实时转写还能开演示窗口投到大屏上。中间能做的事批量排队一次加入多个文件每行可以指定不同模型任务表逐行显示进度语音分离嘈杂的音频可勾选“Extract speech”先把人声抽成干净音轨再转说话人识别在转录页点“Identify speakers”每位说话人自动打标可试听 10 秒样本并把标签改成真名。产出有三种格式TXT、SRT、VTT文件名支持模板变量原文件名、任务、日期等字幕长短可在转录页用 Resize字幕长度调整合并过近的片段或按标点切分外语材料选 translate 任务输出直接是译文。三个可照抄的录音处理工作流工作流一会议纪要目标会前拿到可分发的纪要底稿。关键配置导入录音 → 手动指定语言自动检测偶尔会判错→ 在“高级”里把容易拼错的人名、术语写进 Initial prompt → 点 Run。你拿到的产出带时间戳的逐字稿改完导出 TXT。工作流二访谈整理目标一两个小时访谈出按人分组的文字稿。关键配置导入文件 → 转录视图点“Identify speakers” → 把每个标签改成“采访人/受访者” → 勾选“Merge speaker sentences”保存。你拿到的产出按说话人归段的文字稿导出 TXT。工作流三视频字幕目标拿到一套能直接导入剪辑软件的字幕。关键配置导入视频自动抽音频→ Export As 选 SRT → 字幕行过长就用 Resize 按间隙合并 → 导出。你拿到的产出.srt 文件。什么时候需要动模型和参数默认设置transcribe 任务 较小的模型对付日常听写已经够用下面这些情况才需要动手模型大小开销转录速度什么时候选它tiny最小低内存机器可跑最快首次试用、快速校对base略大快日常会议录音small中等中准确率要求开始抬头的场景medium明显偏大建议有显卡较慢重要访谈与讲座large最大显存要求高最慢把准确率放在第一位的场合加速NVIDIA 显卡可启用 CUDA 后端Mac 走 Apple Silicon 原生加速普通独显还有 Vulkan 选项。命名与自动化在偏好设置里配默认导出文件名模板支持{{ input_file_name }}等变量开启 Folder Watch文件夹监视指定一个目录新录音自动转录导出适合接 OBS 的录像输出目录。插件菜单里打开 Plugins 面板AI 摘要、DOCX 导出、跳过已转录文件等内置插件按需勾选即可。五个值得先看的目录buzz/transcriber/ — 各个转录后端本地 Whisper、whisper.cpp、Hugging Face 模型、OpenAI API。buzz/widgets/main_window.py — 主窗口任务表与工具栏。buzz/widgets/transcription_viewer/ — 转录视图页编辑、播放、说话人识别、字幕调整。buzz/widgets/preferences_dialog/ — 全部偏好设置页。buzz/plugins/ — 插件系统与内置插件。离线语音识别的边界与已知限制常见误解“离线”不等于“永不联网”。首次使用某个模型要联网下载权重文件YouTube 链接任务也要联网拉视频。性能边界速度与模型大小成反比laptop 用 large 转一小时录音可能要好几个小时没显卡的机器建议小文件或分批夜间跑。已知不足Intel 版 Mac 上说话人识别不可用超长文件先分段再转更稳单个任务长期占着队列进度不好把控。把离线语音识别接进你的工作流挑一条最近的会议录音用默认设置跑一遍导出 SRT 看看字幕长短是否够用。想再省事一点就把 Folder Watch 指向 OBS 的录像输出目录第二天早上导出文件夹里已经躺着当天的稿子。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表