源码系统概览
文章正文
FireRedTTS3 是 FireRedTeam 开源的多语种、多方言语音合成与编辑框架。
它在 PyTorch 上实现了声音克隆、指令式嗓音设计与语音编辑,适合需要本地化语音生成的研发与内容生产场景。
源码简介
FireRedTTS3 的官方代码对应论文 FireRedTTS3,核心合成管线位于 fireredtts3/core.py,封装了 FireRedTTS3Base 与 FireRedTTS3Instruct 两条路径。
Base 模式根据提示文本与提示音频完成零样本声音克隆,Instruct 模式通过自然语言指令设计目标嗓音并直接生成对应语音。
项目采用 Apache 2.0 许可,已在 HuggingFace 与 ModelScope 发布预训练权重,依赖包含 torch 2.8、torchaudio、transformers 5.6、flash-attn 与 faster-whisper。
仓库内置 24 种语言的文本归一化模板,覆盖中、英、日、韩、德、法等主要语种与方言,文本前端在生成前统一规整标点和数字读法。
CAM++ 说话人表征模块从提示音频提取 512 维嵌入,配合语义增强的语音表征提升跨语种克隆的稳定度。
适用场景
多语种影视配音与有声书本地化,需要把同一脚本快速换成不同语言与方言嗓音。
虚拟角色与数字人嗓音设计,用一句指令定义年龄、性别、语速与情绪。
语音编辑与修复,对已有录音做局部替换、拼接与风格迁移。
语音助手与客服系统的离线语音生成,避免把敏感文本送到第三方云服务。
功能亮点
零样本声音克隆,只需几秒提示音频即可复刻目标嗓音。
指令式嗓音设计,用自然语言描述而非参数调节来定制输出。
语音编辑能力,支持在波形层面做替换与修复。
多语种多方言覆盖,内置 24 种语言的文本归一化模板。
语义增强语音表征,提升跨语种与低资源方言的克隆稳定度。
LLM 文本归一化,自动按语种选择关闭思维链的方式规整前端文本。
技术架构与部署指南
技术栈与运行环境
开发语言:Python 3.10 及以上,核心推理基于 PyTorch 2.8 与 torchaudio 2.8。
加速组件:flash-attn 2.8.3 提供注意力加速,transformers 5.6.2 加载基座声学模型。
文本前端:faster-whisper 做语音识别辅助,LLM 网关完成文本归一化,配置写在 .env。
说话人表征:CAM++ 提取 512 维嵌入,kaldi fbank 80 维梅尔特征作为输入。
许可协议:Apache 2.0,预训练权重发布于 HuggingFace 与 ModelScope。
安装与部署提示
克隆仓库后执行 pip install -r requirements.txt 安装依赖,确保本机具备 CUDA 与匹配的 torch 版本。
从 HuggingFace 或 ModelScope 下载 pretrained_models 权重目录,推理时传入该路径即可加载。
复制 .env.example 为 .env,填入 LLM_TN_API_URL 与 LLM_TN_API_KEY,推荐 qwen3-30b-a3b 及以上模型做文本归一化。
参考 fireredtts3/core.py 的用法示例,调用 generate 或 generate_voice_design 完成合成并保存 wav。
截图与演示说明

代码层面可演示的模块包括 fireredtts3/core.py 的合成管线入口,它对外暴露 FireRedTTS3 与 FireRedTTS3Instruct 两个类。
fireredtts3/llm 目录下的 base 与 instruct 实现分别是两条生成路径,包含文本前端与声学模型调用。
fireredtts3/campp/campp.py 提供说话人嵌入提取,配合 assets 下的 logo 与演示资源构成项目主视觉。
fireredtts3/utils/llm_tn/templates 目录按语种存放文本归一化模板,是前端规整逻辑的可视化入口。
常见问题
问:FireRedTTS3 需要显卡才能跑吗?
答:声学模型与 flash-attn 依赖 CUDA,本地推理建议具备支持 torch 2.8 的 NVIDIA 显卡;纯 CPU 环境速度很慢,仅适合验证流程。
问:支持中文以外的语言吗?
答:支持,仓库内置 24 种语言的文本归一化模板,覆盖日、韩、德、法等多语种与多方言,克隆时由提示音频决定目标音色。
安全风险提示
LLM 文本归一化的 API Key 写在 .env,请勿提交到公开仓库,也不要在共享环境明文保存。
预训练权重体积较大,请仅从 HuggingFace 或 ModelScope 官方地址获取,校验文件完整性后再加载。
语音克隆可被用于冒用他人声线,生产环境应加入水印与授权校验,遵守当地关于合成语音的合规要求。
下载说明
本仓库仅供学习与研究使用,下载后请遵守 Apache 2.0 许可与项目作者的使用限制。
代码中包含的模型权重与第三方依赖需自行从官方渠道获取,本站不提供违规重分发。
使用本源码产生的任何语音内容,均由使用者自行承担合规与版权责任。
GitHub项目开源地址:https://github.com/FireRedTeam/FireRedTTS3