多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

Win10安装OmniVoice 部署本地TTS服务

Win10安装OmniVoice 部署本地TTS服务 OmniVoice 完整安装指南小米开源的高质量语音克隆 TTS 模型前言OmniVoice 是小米 AI 实验室旗下的语音团队 k2-fsa下一代 Kaldi 团队于 2026 年 4 月正式开源的多语言文本转语音TTS模型。它是一款大规模多语言零样本语音合成模型支持600 多种语言具备语音克隆和语音设计两大核心能力。模型参数量仅 0.8B基于 58.1 万小时开源语音数据训练而成采用 Apache-2.0 协议个人和商业均可免费使用。其推理速度 RTF 低至 0.025即40 倍实时速度。本文将带你一步步完成 OmniVoice 在 Windows 系统上的完整安装与配置。一、前提条件在开始之前请确保你的系统满足以下要求项目要求操作系统Windows 1021H2 或更新版本或 Windows 1164位PythonPython 3.11 或更高版本硬盘空间至少 10-14 GB 可用空间用于存放应用、Python环境和模型权重显卡可选NVIDIA GPU 最新驱动程序可实现CUDA加速AMD显卡在Windows上仅支持CPU模式网络需要稳定访问互联网以下载模型文件约14GB和依赖包提示如果你没有 NVIDIA 显卡OmniVoice 仍然可以在 CPU 上运行但生成速度会明显变慢。二、安装步骤第 1 步安装 Python访问 python.org 下载 Python 3.11 或更高版本的安装包。运行安装程序务必勾选“Add Python to PATH”将Python添加到环境变量。安装完成后打开命令提示符CMD或 PowerShell验证安装是否成功python--version应显示类似Python 3.11.x的信息。第 2 步安装 Git可选但推荐Git 用于从 GitHub 克隆代码。如果只从 PyPI 安装则非必需但建议安装以备后续开发使用。从 git-scm.com 下载并安装 Git for Windows。安装后可在 PowerShell 中验证git--version第 3 步安装 Microsoft C Build Tools可选某些 PyPI 源码包如 pyannote.audio在安装时需要编译 C 代码建议提前安装下载并安装 Visual Studio 2022 Build Tools安装时勾选“Desktop development with C”工作负载第 4 步创建 Python 虚拟环境强烈推荐使用虚拟环境可以避免包版本冲突。# 创建项目文件夹并进入mkdir omnivoice_project cd omnivoice_project# 创建 Python 虚拟环境python-m venv venv# 激活虚拟环境Windowsvenv\Scripts\activate激活成功后命令提示符前会出现(venv)标识。第 5 步安装 PyTorch深度学习框架OmniVoice 依赖 PyTorch。根据你的显卡类型选择对应的安装命令。✅ 如果你有 NVIDIA 显卡推荐首先确认你的显卡驱动支持的 CUDA 版本。在终端运行nvidia-smi查看右上角的 CUDA Version 信息。根据你的 CUDA 版本选择对应命令。例如 CUDA 12.x 版本pip install torch2.8.0cu128 torchaudio2.8.0cu128--extra-index-url https://download.pytorch.org/whl/cu128 pip install torch2.11.0cu130 torchaudio2.11.0cu130--extra-index-url https://download.pytorch.org/whl/cu130-i https://mirrors.aliyun.com/pypi/simple/注意Windows 下 OmniVoice 的 GPU 加速仅支持 NVIDIA/CUDA无需单独安装 CUDA Toolkit驱动程序已包含所需支持。✅ 如果你没有 NVIDIA 显卡仅 CPU 模式pip install torch torchaudio第 6 步安装 OmniVoice选择以下任意一种方式安装方式一从 PyPI 安装稳定版推荐pip install omnivoice pip install omnivoice-i https://mirrors.aliyun.com/pypi/simple/方式二从 GitHub 源码安装最新开发版pip install githttps://github.com/k2-fsa/OmniVoice.git方式三克隆源码后开发模式安装git clone https://github.com/k2-fsa/OmniVoice.git cd OmniVoice pip install-e.三、验证安装安装完成后可以通过以下命令验证 OmniVoice 是否安装成功# 查看 omnivoice 命令是否可用omnivoice-tts--help如果显示帮助信息说明安装成功。四、命令行使用方法1. 基本文字转语音最简单的用法将文字转换为语音omnivoice-tts--text你好欢迎使用小米开源的语音合成服务。生成的音频文件默认保存在当前目录下。2. 语音克隆核心功能使用一段 3-10 秒的参考音频来克隆声音omnivoice-tts--text这是克隆出来的声音。--ref-audioC:\path\to\your\reference.wav将C:\path\to\your\reference.wav替换为你自己的音频文件路径。提示手机录音即可使用内置去噪功能可处理轻微噪音。建议在安静环境下录制清晰完整的语句效果更稳定。3. 语音设计通过文字描述来控制生成音色的属性omnivoice-tts--text你好。--voice-designmale, elderly, low pitch, British accent支持控制的属性包括性别、年龄、音调、方言、口音、耳语等。4. 情绪控制在文本中加入特殊标签来控制语气omnivoice-tts--text这真是太有趣了[laughter] 我忍不住笑了出来。支持的标签包括[laughter]笑声、[sigh]叹气、[breath]呼吸声等。5. 启动本地 Web 界面可选如果你想要更友好的图形化操作界面可以启动本地 Web 服务omnivoice-demo--ip 0.0.0.0--port 8001然后在浏览器中访问http://localhost:8001即可使用 Web 界面。五、Python API 使用示例除了命令行工具OmniVoice 也提供了完整的 Python APIfromomnivoiceimportOmniVoiceimporttorchimporttorchaudio# 加载模型modelOmniVoice.from_pretrained(k2-fsa/OmniVoice,device_mapcuda:0,dtypetorch.float16)# 生成音频语音克隆audiomodel.generate(textHello, this is a test of zero-shot voice cloning.,ref_audioref.wav,ref_textTranscription of the reference audio.,)# 保存音频采样率 24kHztorchaudio.save(out.wav,audio[0],24000)六、常见问题与解决方案Q1: 首次运行时报错“模型下载失败”或连接超时原因HuggingFace 在国内访问可能不稳定。解决方案设置国内镜像源$env:HF_ENDPOINT https://hf-mirror.com然后再运行生成命令。Q2: 提示 CUDA 不可用原因PyTorch 未正确识别 GPU。解决方案确认 NVIDIA 显卡驱动已更新到最新版本确认安装了正确 CUDA 版本的 PyTorch运行以下命令验证importtorchprint(torch.cuda.is_available())Q3: 内存不足或生成速度慢建议使用 GPU 模式NVIDIA 显卡推荐 6GB 显存以上4GB 显存可运行但速度偏慢CPU 模式仅适合测试用途1 秒语音约需 10 秒生成七、总结OmniVoice 作为一款开源的多语言零样本语音合成模型凭借其600 语言支持、40 倍实时推理速度、3 秒语音克隆等特性在同类开源 TTS 模型中表现突出。通过本文的逐步指南你应该已经能够在 Windows 系统上顺利完成 OmniVoice 的安装与配置。更多信息请参考GitHub 仓库PyPI 页面Hugging Face 模型页
返回列表