1. 项目定位与用途
OmniVoice是k2-fsa开源的多语言零样本文本转语音(TTS)模型与配套工具库,核心定位是为多语言场景提供高保真、可定制的语音合成能力。其基于扩散语言模型风格架构设计,原生支持600+语言覆盖,是当前零样本TTS模型中语言覆盖最广的方案之一。除基础文本转语音功能外,还支持零样本声音克隆、声音属性定制、非语言符号控制与发音校正等扩展能力,配套提供从训练、微调到推理评估的全流程工具链,满足科研与工业场景的多样化需求。
OmniVoice是k2-fsa开发的高质量多语言零样本TTS工具库,支持600+语言覆盖、零样本声音克隆与语音属性定制,推理速度可达实时40倍。本文档包含项目定位、安装指南、使用方式与全流程工具链说明。
OmniVoice是k2-fsa开发的高质量多语言零样本文本转语音(TTS)工具库,支持600+语言,具备声音克隆、语音属性定制能力,推理速度可达实时40倍,为多语言语音合成场景提供高效高保真方案。
OmniVoice是k2-fsa开源的多语言零样本文本转语音(TTS)模型与配套工具库,核心定位是为多语言场景提供高保真、可定制的语音合成能力。其基于扩散语言模型风格架构设计,原生支持600+语言覆盖,是当前零样本TTS模型中语言覆盖最广的方案之一。除基础文本转语音功能外,还支持零样本声音克隆、声音属性定制、非语言符号控制与发音校正等扩展能力,配套提供从训练、微调到推理评估的全流程工具链,满足科研与工业场景的多样化需求。
传统TTS方案普遍存在多语言覆盖不足、零样本声音克隆保真度低、推理效率差、语音属性定制能力弱等问题,OmniVoice针对这些痛点做了针对性优化:一是通过架构设计实现600+语言的零样本支持,覆盖大量低资源小语种场景;二是基于扩散语言模型架构实现当前业界领先的零样本声音克隆效果;三是推理实时率(RTF)最低可达0.025,速度是实时合成的40倍,大幅降低部署与使用成本;四是提供细粒度的语音属性控制与非语言符号、发音校正能力,满足个性化语音合成需求。
OmniVoice的多语言覆盖与高可定制性使其适用于多类语音合成场景:一是多语言内容自动配音,可覆盖600+语言的视频、播客、在线课程等内容配音需求;二是特定人声克隆复刻,仅需少量参考音频即可复刻目标音色;三是有声书、短视频的批量语音生成,支持长文本合成与细粒度内容控制;四是小语种语音合成,填补了大量低资源小语种的TTS能力空白;五是语音助手、对话系统的音色定制,可根据需求调整语音的性别、年龄、口音等属性。
OmniVoice支持pip与uv两种安装方式,要求Python版本不低于3.10,核心依赖为PyTorch>=2.4、torchaudio>=2.4,适配NVIDIA CUDA、Apple Silicon、Intel Arc XPU三类硬件。pip安装时需先安装对应硬件版本的PyTorch,之后可选择从PyPI安装稳定版、从GitHub源码安装最新版,或克隆仓库后以开发模式安装;使用uv的话可克隆仓库后执行uv sync同步依赖,还可通过额外安装tn、eval、lora三类可选依赖扩展文本归一化、评估、LoRA微调相关能力。
OmniVoice提供Python API与命令行工具两种使用方式:Python API可直接调用TTS推理、声音设计等核心能力,支持自定义生成参数;命令行工具包含4个内置入口,分别是单条文本推理、批量文本推理、Gradio可视化演示、LoRA权重合并。此外项目还提供完整的数据预处理、训练、微调、评估流程,支持通过LoRA对模型做轻量微调,配套examples目录下的脚本可快速启动训练与评估任务。
OmniVoice的训练数据采用WebDataset格式存储,音频经8层离散tokenizer编码后打包为tar分片,支持基础数据制备、Sidon模型降噪增强、噪声/RIR增强三级预处理流程。项目基于扩散语言模型风格架构实现,设计简洁可扩展,在质量与速度上取得平衡。此外社区生态已衍生出多个第三方集成项目,包括ComfyUI节点、vLLM推理服务、Apple Silicon MLX推理后端、Rust推理实现、OpenAI兼容API服务等,覆盖多种部署与使用场景。
当前原生支持600+语言,覆盖绝大多数主流语言与小语种,完整语言列表可参考仓库docs/languages.md文件。
OmniVoice基于扩散语言模型架构实现,零样本声音克隆效果处于当前业界领先水平,仅需少量参考音频即可复刻目标音色。
项目支持NVIDIA CUDA、Apple Silicon、Intel Arc XPU三类硬件,可通过pip或uv安装,社区还提供OpenAI兼容API服务、Rust推理、TensorRT-LLM部署等多种第三方部署方案。
支持,项目提供完整的训练数据制备、LoRA微调流程,配套示例脚本与配置文件,可快速对模型做轻量领域适配。
模型推理实时率(RTF)最低可达0.025,即合成1秒语音仅需0.025秒,速度是实时合成的40倍,适合批量语音生成与在线服务部署。