ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Buzz 本地音频转录完整指南:如何用 Whisper 在电脑上离线完成语音转文字

Buzz 本地音频转录完整指南:如何用 Whisper 在电脑上离线完成语音转文字 Buzz 本地音频转录完整指南如何用 Whisper 在电脑上离线完成语音转文字【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz会议刚结束录音文件躺在你的电脑里你需要一份文字稿——但不想把文件上传给任何在线服务。Buzz 就是为这件事做的一款完全离线运行的音频转录工具基于 OpenAI 的 Whisper 模型在你的个人电脑上完成语音转文字和翻译支持 99 种语言音频数据始终不离开你的设备。先装好 Buzz三大平台安装命令Buzz 支持 macOS、Windows 和 Linux全部免费一次安装终身使用。Windows 与 macOS从项目发布页下载对应系统的安装包Windows 为.exemacOS 为.dmg。Windows 安装包未经代码签名安装时若出现拦截提示选择更多信息→仍要运行即可。Linux 一键安装# Flatpak flatpak install flathub io.github.chidiwilliams.Buzz# Snap sudo snap install buzz用 pip 安装开发者向需要 Python 3.12 环境和 ffmpegpip install buzz-captions python -m buzz第一次转录导入文件到出文字稿安装完成后首次运行 Buzz 会自动提示下载 Whisper 模型建议在有网络的环境下完成这一步——之后你就可以彻底离线使用了。导入文件的操作很简单菜单File → Import Media File或按Ctrl/Cmd O也可以直接用图标选择音频或视频文件MP3、MP4、WAV、M4A 等均可YouTube 链接也支持选择任务转录或翻译成英文、语言和模型点击运行状态显示Completed后双击该行即可打开转录结果。 官方文档建议如果知道音频语言手动指定语言比自动检测更稳定识别质量通常更好。主界面是一个任务队列可以一次导入多个文件它们会排队处理每行显示进度。转录完成后结果以 TXT、SRT 或 VTT 格式导出到指定位置。模型怎么选速度、精度与硬件的平衡转录质量由 Whisper 模型决定。模型大小从 tiny 到 large越大越准、越吃资源模型大小速度内存需求适用场景tiny极快最低实时转录、快速草稿base / small快较低日常使用medium中等中等重要内容的专业转录large慢最高追求最佳精度除了模型大小你还能选择Whisper 类型这决定了用哪个推理引擎WhisperOpenAI 官方实现准确但慢吃内存Whisper.cppC 实现快且省资源Mac 和核显用户的首选甚至能在普通笔记本上跑实时转录Faster Whisper如果你有 6GB 以上显存的 NVIDIA 显卡速度优势明显Hugging Face支持大量社区模型包括支持 1000 语言的 MMS 系列。模型管理在 Help → Preferences → Models 中可以下载、删除模型并一键打开模型存放目录Linux 在~/.cache/BuzzWindows 在%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache。会议实时转录录音、翻译与演示窗口Buzz 的实时录音功能适合讲座、采访和会议选好转录任务、语言和麦克风点击 Record 即可边说边出文字。几个实用细节演示窗口录音开始后会出现 Presentation Window 选项可以开一个大号文字窗口投屏展示实时字幕做活动主持很有用实时翻译配合 OpenAI 兼容 API可以边录边翻译成英文并同步显示转录用模型建议官方文档提示默认 Whisper 模型实时转录比较吃资源建议改用 Whisper.cpp 并选小模型。完整操作见 docs/docs/usage/2_live_recording.md里面还讲了 Mac、Windows、Linux 下如何录制电脑内部播放的声音。编辑结果查看器、说话人识别与字幕优化转录完成后双击任务行进入转录查看器这是 Buzz 功能最集中的地方。查看器支持全文搜索、音频播放控制和倍速调节逐段核对很方便直接编辑双击段落即可修改识别错误的文字说话人识别点Identify speakersBuzz 会自动给每位说话人的句子打标签你可以试听 10 秒片段确认后把标签改成真实姓名连续发言还能合并成一段。字幕优化方面Buzz 提供了 Resize 工具勾选了Word-Level Timings的转录可以按最大字幕长度、标点分割、静音间隔重新分组还能给每条字幕统一延长显示时长。导出格式支持TXT、SRT、VTTSRT 可直接导入剪辑软件做字幕。详细规则见 docs/docs/usage/4_edit_and_resize.md。批量与自动化监控文件夹、命令行和插件当你处理的文件多起来Buzz 的这三项能力能省不少事。监控文件夹在偏好设置里指定一个文件夹之后丢进去的音频文件会自动开始转录适合录完就转的工作流。命令行Buzz 提供 CLI适合脚本和自动化一条命令完成转录并输出 SRTbuzz add --model-type whispercpp --model-size base -l zh --srt interview.mp3完整参数见 docs/docs/cli.md。插件系统1.4.5 版本起内置了多个插件在 Help → Plugins 里开关和排序。目前包括AI 摘要生成转录完自动写摘要、DeepFilterNet 降噪转录前先去除背景噪音、导出 DOCX 文档、语言检测增强、跳过已转录文件等。插件源码在 buzz/plugins/每个插件都带完整多语言文案结构清晰适合想二次开发的人参考。偏好设置里还有几个值得配置项默认导出文件名模板支持{{ input_file_name }}、{{ task }}、{{ date_time }}等变量、实时转录自动导出为 txt可对接 OBS 等软件、快捷键自定义。说明见 docs/docs/preferences.md。遇到问题怎么办转录太慢换小一号的模型或改用 Whisper.cpp 引擎有 6GB 显存的 NVIDIA 显卡可以试 Faster Whisper。模型选择详解见 docs/docs/faq.md 第 4 条。纯离线环境使用在有网的电脑上下载好模型把整个模型目录拷到离线机器的相同位置即可仓库里还提供了 scripts/download-models.py 帮助批量准备离线模型缓存。麦克风报错Windows 上PaErrorCode-9999检查系统隐私设置里是否允许 Buzz 访问麦克风。程序崩溃多半是模型下载不完整在Help → Preferences → Models里删掉重新下载仍不行可点Help → About Buzz → Show logs查看日志定位。下一步可以直接动手挑一段手头的录音按上面第一次转录的四步跑通完整流程想深入细节从中文说明 readme/README.zh_CN.md 和 docs/docs/faq.md 读起即可。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表