ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

VoxCPM2 完整指南:免费开源的多语言语音合成与高保真声音克隆技术

VoxCPM2 完整指南:免费开源的多语言语音合成与高保真声音克隆技术 VoxCPM2 完整指南免费开源的多语言语音合成与高保真声音克隆技术【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM给海外市场做产品配音中英文版本要找不同服务商方言需求多时音色更是难以统一。VoxCPM2 用单一模型解决这些问题2B 开源权重的多语言语音合成系统覆盖 30 种语言并支持 9 种中文方言输出 48kHz 音频一段短音频即可克隆音色还能用自然语言直接设计一个不存在的音色。 VoxCPM2 能力一览30 种语言与 48kHz 输出项目VoxCPM2支持语言30 种 9 种中文方言粤语、川话、吴语等输出采样率48kHz参考音频 16kHz 即可模型规模2B 参数MiniCPM-4 骨干显存需求约 8 GB合成速度RTF合成耗时/音频时长约 0.3RTX 4090接 Nano-vLLM 后约 0.13开源协议Apache-2.0权重与代码均可商用和同类方案比VoxCPM2 最突出的两点一是输入任意支持语言的文本即可直接合成不需要语言标签二是提供音色设计模式只写一段自然语言描述就能造一个新音色完全不依赖参考音频。声音克隆则从短音频片段即可工作并保留原音色的同时接受风格指令。 它是怎么做到的VoxCPM2 是无分词器tokenizer-free的扩散自回归 TTS文本转语音系统跳过音频→离散 token→解码的传统链路文本直接映射为连续语音潜表征避免量化带来的音色细节损失。内部为四阶段流水线LocEnc局部音频编码→ TSLM文本-语义语言模型→ RALM残差声学模型→ LocDiT局部扩散解码器其中 RALM 通过 FSQ有限标量量化 LocDiT 产出连续潜 token一套序列组织同时支撑文本转语音、音色设计与声音克隆。最后由 AudioVAE V2 非对称编解码收尾16kHz 参考音频进去48kHz 音频出来内置超分无需外部上采样器。 VoxCPM2 安装与首次运行5 分钟跑通环境要求单行记清Python ≥ 3.103.13、PyTorch ≥ 2.5.0、CUDA ≥ 12.0推荐 GPU、至少 8GB 显存。安装包并验证环境pip install voxcpm需要源码如后续微调时克隆仓库git clone https://gitcode.com/GitHub_Trending/vo/VoxCPM cd VoxCPM跑通最小合成示例首次运行会自动下载模型权重from voxcpm import VoxCPM import soundfile as sf model VoxCPM.from_pretrained(openbmb/VoxCPM2, load_denoiserFalse) wav model.generate( text你好这是由 VoxCPM2 合成的语音。, cfg_value2.0, # 引导强度默认 2.0推荐 2.0~3.0 inference_timesteps10, # 扩散步数默认 10可调 10~20 ) sf.write(demo.wav, wav, model.tts_model.sample_rate)浏览器里想直观体验的话跑python app.py --port 8808后访问http://localhost:8808无显卡时用--device cpu或--device mps切换设备。️ 三种典型用法1. 纯文本合成与音色设计适合没有素材、想快速产出配音或多语言内容的场景。想定制音色时把描述放在文本开头的括号里即可例如wav model.generate( text(年轻女性温柔甜美的声音)欢迎使用多语言语音合成系统。, cfg_value2.0, inference_timesteps10, ) sf.write(design.wav, wav, model.tts_model.sample_rate)官方说明音色设计与风格控制的结果在多次运行间会有波动同一描述生成 1~3 次、挑一次满意的即可。2. 声音克隆的两个档位适合用真人声音但换内容的场景VoxCPM2 提供两档克隆# 档位一可控克隆——传入参考音频克隆音色并可用括号指令调风格 wav model.generate( text(稍快语速欢快语气)这是克隆后的声音。, reference_wav_pathpath/to/voice.wav, ) # 档位二极致克隆——提供参考音频及其文本转录 # 模型从参考音频续写保留全部声音细节 wav model.generate( text这是极致克隆演示。, prompt_wav_pathpath/to/voice.wav, prompt_text参考音频的文本内容, reference_wav_pathpath/to/voice.wav, # 传入同一段音频相似度更高 ) sf.write(clone.wav, wav, model.tts_model.sample_rate)参考音频质量直接决定克隆上限建议选 5 秒以上、少背景噪声的干声。3. 实时流式合成长文本或实时交互场景用generate_streaming逐块取音频边生成边播放、边落盘import numpy as np chunks [c for c in model.generate_streaming(text流式合成让实时交互成为可能。)] sf.write(stream.wav, np.concatenate(chunks), model.tts_model.sample_rate)RTX 4090 上标准实现 RTF 约 0.3配合 Nano-vLLM 约 0.13均低于实时线RTF 1。 效果对比与主流 TTS 差多少基于 Seed-TTS-eval 基准测试WER/CER 为词/字错误率越低越好SIM 为说话人相似度越高越好模型参数量开源EN WER/%ZH CER/%EN SIM/%VoxCPM22B✅1.840.9775.3FishAudio S24B✅0.990.54—Qwen3-TTS1.7B✅1.231.2271.7CosyVoice31.5B❌2.221.1272.0IndexTTS21.5B✅2.231.0370.6F5-TTS0.3B✅2.001.5367.0结论可读性上 VoxCPM2 与顶级闭源系统同档落后于 FishAudio S2 的 WER但后者未公布相似度在开源模型中VoxCPM2 的英语 SIM75.3处于第一梯队。多语言维度上CV3-eval 基准它和 CosyVoice3、FishAudio S2 各有领先语种例如德语 4.77、意大利语 4.25 的 CER 优于后两者。 部署与扩展从本地体验到生产服务本地使用python app.py --port 8808起 Web 界面或直接用命令行例如voxcpm clone --text ... --reference-audio voice.wav --output out.wav还支持voxcpm batch批量处理文本文件。服务化部署面向多租户生产环境vLLM-Omni 提供 OpenAI 兼容接口启动一条命令vllm serve openbmb/VoxCPM2 --omni --port 8000 # 之后任何 OpenAI 客户端都能调用 /v1/audio/speech追求更高吞吐可用 Nano-vLLMpip install nano-vllm-voxcpm支持并发请求与 FastAPI HTTP 服务。深度定制5~10 分钟音频就能做 LoRA 微调适配特定说话人、语言或领域python scripts/train_voxcpm_finetune.py \ --config_path conf/voxcpm_v2/voxcpm_finetune_lora.yaml微调数据为 JSONL每行含 audio 路径、text 转录、duration配置模板见仓库conf/voxcpm_v2/不想配命令行就运行python lora_ft_webui.py用 WebUI 完成训练与试听。周边生态社区维护非 OpenBMB 官方出品项目一句话描述适用场景Nano-vLLM-VoxCPM高吞吐 GPU 推理引擎RTF 约 0.13高并发在线服务vLLM-OmnivLLM 官方多模态扩展PagedAttention OpenAI 兼容 API多租户生产部署llama.cpp-omniC 推理引擎GGUF 权重跑在 CPU/Metal/CUDA/Vulkan端侧与边缘部署VoxCPM.cpp / VoxCPM-ONNXGGML/GGUF 与 ONNX 格式导出无 Python 环境的 CPU 推理ComfyUI-VoxCPM节点式工作流支持多说话人、LoRA 切换可视化批量生产⚡ 常见问题排障速查问题现象常见原因处理方式合成时 CUDA 显存不足2B 模型约占 8GB 显存加载时传load_denoiserFalse仍不足则降低并发或换大显存卡音色设计/风格控制效果不稳定官方注明可控性仍在改进多次运行有差异同一输入生成 1~3 次择优需要可复现时固定seed某些语言合成效果不佳超出 30 种支持语言或方言覆盖范围先直接测试不行就用自有数据做 LoRA 微调第一次合成特别慢optimizeTrue触发 torch.compile 预热属正常现象后续调用恢复正常无 GPU 环境想运行默认优先 CUDA--device auto/cpu/mps切换或改用 llama.cpp-omni、ONNX 等生态VoxCPM2 的定位很清晰一个权重完全开源、可商用、覆盖 30 种语言的 2B 声音合成与克隆模型。建议的路径是先按上面的最小示例跑通再试括号描述做音色设计验证克隆效果后按业务形态选择本地 WebUI、CLI 批量或 vLLM-Omni 服务化接入生产。【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表