ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

faster-whisper 离线语音转写快速上手

faster-whisper 离线语音转写快速上手 faster-whisper 离线语音转写快速上手【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper如果 40 分钟的会议录音跑十几分钟才出稿、内存几乎被打满这就是你现在卡住的地方。faster-whisper 是基于 CTranslate2 重写 OpenAI Whisper 的语音转写推理实现吃进音频就吐出带时间戳的逐字稿。同等精度下最高快 4 倍int8 量化还能进一步省内存适合想用 N 卡或纯 CPU 做离线转写、又不想单独装 FFmpeg 的开发者PyAV 依赖把解码库打包好了。看懂与原版 openai-whisper 的差异说白了模型权重没换换的是推理引擎同一套 Whisper 模型放到 CTranslate2 上跑。看官方基准RTX 3070 Tibeam size 5large-v2 转写 13 分钟音频faster-whisper fp16 用时 1 分 03 秒、显存约 4.5GBint8 59 秒、约 2.9GB原版 openai/whisper 则要 2 分 23 秒。核对 Python 版本与 GPU 环境在终端跑这条命令做环境自检要求 Python 3.9 及以上不满足就先装新版再来。打算在 N 卡上跑的话还要备好 CUDA 12 的 cuBLAS 与 cuDNN 9 运行库缺失时的处理见「处理两个高频报错」一节。python -V完成第一次转写装主包一条命令装好 faster-whisperctranslate2、tokenizers、onnxruntime 等依赖会自动带上。pip install faster-whisper加载模型并跑转写加载 base 档模型首次试跑小且快转写一段音频并打印带时间戳的句子。from faster_whisper import WhisperModel # 有 N 卡用 cuda float16没有就改 devicecpu、compute_typeint8 model WhisperModel(base, devicecuda, compute_typefloat16) segments, info model.transcribe(meeting.mp3, beam_size5, vad_filterTrue) # vad 先剪静音 print(f语言: {info.language}置信度 {info.language_probability:.2f}) for seg in segments: # 转写真正在这次遍历中执行 print(f[{seg.start:.2f}s - {seg.end:.2f}s] {seg.text})vad_filterTrue 让内置 Silero VAD 先剪掉长静音再送模型省算力beam_size 控制解码精度值越大越准也越慢。长音频切批量推理分钟级以上的时长切到 BatchedInferencePipeline把多个片段合并成批处理基准里 13 分钟音频从 1 分 03 秒降到 17 秒左右。from faster_whisper import WhisperModel, BatchedInferencePipeline model WhisperModel(large-v3, devicecuda, compute_typefloat16) pipeline BatchedInferencePipeline(modelmodel) segments, _ pipeline.transcribe(meeting.mp3, batch_size16) # 批量模式默认启用 VAD for seg in list(segments): print(f[{seg.start:.2f}s - {seg.end:.2f}s] {seg.text})模型档位的选择base、small 试跑够用正式出稿再上 large-v3 或 turbo。处理两个高频报错遇到 CUDA 运行库加载失败时先检查 CUDA 12 的 cuBLAS 与 cuDNN 9 是否装好、库目录是否在 LD_LIBRARY_PATHWindows 是 PATH里。Linux 上可直接pip install nvidia-cublas-cu12 nvidia-cudnn-cu129.*把库目录加入环境变量后重启 Python。老环境的对应关系CUDA 11 cuDNN 8 回退 ctranslate2 3.24.0CUDA 12 cuDNN 8 回退 4.4.0。遇到 transcribe 无文本输出时先检查是否在遍历 segmentstranscribe 返回的是生成器转写真正开始运行是在遍历那一刻把结果套一层list(segments)或 for 循环就能跑出文本。挑 3 个方向继续深入做词级时间戳转写时加word_timestampsTrue句子里的每个词都会带上起止时间seg.words适合做字幕或卡拉 OK参数细节见 transcribe.py。调 VAD 切分省算力长音频说话占比低时把vad_parameters里的min_silence_duration_ms收紧到 500静音切分更激进默认值与含义见 vad.py。转换自定义模型README.md 的 Model conversion 一节给了ct2-transformers-converter命令把你微调的权重转成 CTranslate2 模型之后按本地路径加载即可。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表