FireRedTTS3语音克隆合成系统源码本地AI配音工具

FireRedTTS3语音克隆合成系统源码本地AI配音工具

  • 全站源码免费
  • 日/微信/10次解锁
  • 日/IP/100次解锁
资源下载
免费资源
立即下载

源码系统概览

文章正文

FireRedTTS3 是 FireRedTeam 开源的多语种、多方言语音合成与编辑框架。

它在 PyTorch 上实现了声音克隆、指令式嗓音设计与语音编辑,适合需要本地化语音生成的研发与内容生产场景。

源码简介

FireRedTTS3 的官方代码对应论文 FireRedTTS3,核心合成管线位于 fireredtts3/core.py,封装了 FireRedTTS3Base 与 FireRedTTS3Instruct 两条路径。

Base 模式根据提示文本与提示音频完成零样本声音克隆,Instruct 模式通过自然语言指令设计目标嗓音并直接生成对应语音。

项目采用 Apache 2.0 许可,已在 HuggingFace 与 ModelScope 发布预训练权重,依赖包含 torch 2.8、torchaudio、transformers 5.6、flash-attn 与 faster-whisper。

仓库内置 24 种语言的文本归一化模板,覆盖中、英、日、韩、德、法等主要语种与方言,文本前端在生成前统一规整标点和数字读法。

CAM++ 说话人表征模块从提示音频提取 512 维嵌入,配合语义增强的语音表征提升跨语种克隆的稳定度。

适用场景

多语种影视配音与有声书本地化,需要把同一脚本快速换成不同语言与方言嗓音。

虚拟角色与数字人嗓音设计,用一句指令定义年龄、性别、语速与情绪。

语音编辑与修复,对已有录音做局部替换、拼接与风格迁移。

语音助手与客服系统的离线语音生成,避免把敏感文本送到第三方云服务。

功能亮点

零样本声音克隆,只需几秒提示音频即可复刻目标嗓音。

指令式嗓音设计,用自然语言描述而非参数调节来定制输出。

语音编辑能力,支持在波形层面做替换与修复。

多语种多方言覆盖,内置 24 种语言的文本归一化模板。

语义增强语音表征,提升跨语种与低资源方言的克隆稳定度。

LLM 文本归一化,自动按语种选择关闭思维链的方式规整前端文本。

技术架构与部署指南

技术栈与运行环境

开发语言:Python 3.10 及以上,核心推理基于 PyTorch 2.8 与 torchaudio 2.8。

加速组件:flash-attn 2.8.3 提供注意力加速,transformers 5.6.2 加载基座声学模型。

文本前端:faster-whisper 做语音识别辅助,LLM 网关完成文本归一化,配置写在 .env。

说话人表征:CAM++ 提取 512 维嵌入,kaldi fbank 80 维梅尔特征作为输入。

许可协议:Apache 2.0,预训练权重发布于 HuggingFace 与 ModelScope。

安装与部署提示

克隆仓库后执行 pip install -r requirements.txt 安装依赖,确保本机具备 CUDA 与匹配的 torch 版本。

从 HuggingFace 或 ModelScope 下载 pretrained_models 权重目录,推理时传入该路径即可加载。

复制 .env.example 为 .env,填入 LLM_TN_API_URL 与 LLM_TN_API_KEY,推荐 qwen3-30b-a3b 及以上模型做文本归一化。

参考 fireredtts3/core.py 的用法示例,调用 generate 或 generate_voice_design 完成合成并保存 wav。

截图与演示说明

FireRedTTS Logo

代码层面可演示的模块包括 fireredtts3/core.py 的合成管线入口,它对外暴露 FireRedTTS3 与 FireRedTTS3Instruct 两个类。

fireredtts3/llm 目录下的 base 与 instruct 实现分别是两条生成路径,包含文本前端与声学模型调用。

fireredtts3/campp/campp.py 提供说话人嵌入提取,配合 assets 下的 logo 与演示资源构成项目主视觉。

fireredtts3/utils/llm_tn/templates 目录按语种存放文本归一化模板,是前端规整逻辑的可视化入口。

常见问题

问:FireRedTTS3 需要显卡才能跑吗?

答:声学模型与 flash-attn 依赖 CUDA,本地推理建议具备支持 torch 2.8 的 NVIDIA 显卡;纯 CPU 环境速度很慢,仅适合验证流程。

问:支持中文以外的语言吗?

答:支持,仓库内置 24 种语言的文本归一化模板,覆盖日、韩、德、法等多语种与多方言,克隆时由提示音频决定目标音色。

安全风险提示

LLM 文本归一化的 API Key 写在 .env,请勿提交到公开仓库,也不要在共享环境明文保存。

预训练权重体积较大,请仅从 HuggingFace 或 ModelScope 官方地址获取,校验文件完整性后再加载。

语音克隆可被用于冒用他人声线,生产环境应加入水印与授权校验,遵守当地关于合成语音的合规要求。

下载说明

本仓库仅供学习与研究使用,下载后请遵守 Apache 2.0 许可与项目作者的使用限制。

代码中包含的模型权重与第三方依赖需自行从官方渠道获取,本站不提供违规重分发。

使用本源码产生的任何语音内容,均由使用者自行承担合规与版权责任。

GitHub项目开源地址:https://github.com/FireRedTeam/FireRedTTS3

资源下载
下载价格免费
本文章资源https://www.aosen.cc/mianfei15230.html来源于互联网,如存在侵权,请联系我们立马删除!
0
显示验证码