Voice-Pro AI语音转换配音源码 视频配音工具

Voice-Pro AI语音转换配音源码 视频配音工具

  • 全站源码免费
  • 日/微信/10次解锁
  • 日/IP/100次解锁
资源下载
免费资源
立即下载

Voice-Pro AI语音转换与多语言配音工具封面

源码系统概览

文章正文

Voice-Pro 是 ABUS 团队开源的 AI 语音处理 WebUI,把语音识别、翻译、合成与语音克隆整合进同一个操作面板。

它基于 Gradio 构建,面向视频配音、有声内容创作与多语言本地化等实际场景。

本仓库当前版本为 4.0.0,采用 uv 管理依赖,整体运行在 Windows 与 NVIDIA GPU 环境。

源码简介

Voice-Pro 是一款面向创作者与开发者的 AI 多媒体处理源码,核心能力覆盖语音识别、机器翻译、文本转语音与零样本语音克隆。

项目以 Gradio 6.20 搭建本地 WebUI,用户上传音频或视频后即可在一个页面内完成字幕生成、翻译与多语种配音。

语音识别部分接入 Whisper、Faster-Whisper 与 Whisper-Timestamped 三套方案,可按精度与速度灵活切换。

语音合成与克隆部分整合 Edge-TTS、kokoro、F5-TTS、E2-TTS 与阿里 CosyVoice,其中 CosyVoice 还支持 Fun-CosyVoice3 多语种克隆。

项目作者为 ABUS,GitHub 账号是 abus-aikorea,以 GPL-3.0 协议开源,星标约 1.2 万,在开源 AI 语音工具里已经打磨得比较成熟。

适用场景

视频创作者可用它把 YouTube 视频下载后自动识别原声、翻译字幕并生成目标语种配音,完成跨语言搬运。

播客与有声书制作者能借助语音克隆把旁白换成指定音色,批量产出多语言版本。

需要卡拉 OK 或伴奏分离的用户,可用内置 Demucs 与 MDX-Net 做人与伴奏拆分。

开发者与研究者在做语音相关实验时,也能把它当作 Whisper、F5-TTS、CosyVoice 的本地化集成入口。

功能亮点

一站式流水线:识别、翻译、合成、克隆在单个 Gradio 标签页内串联,免去在多款工具间来回切换。

多引擎语音合成:同时内置 Edge-TTS、kokoro、F5-TTS、E2-TTS 与 CosyVoice,覆盖通用音色与零样本克隆。

零样本语音克隆:上传几秒参考音频即可克隆音色,Fun-CosyVoice3 额外支持韩、日、英等九种语言。

友好部署:v4 起改用 uv 安装器,所有依赖提供预编译轮子,PyTorch 自带 CUDA 运行时,普通办公电脑也能跑。

受限环境适配:无需管理员权限,ffmpeg 缺失时自动下载便携版,模型下载中断可自动续传自愈。

相较于 RVC 这类只做语音转换的开源项目,Voice-Pro 把识别、翻译、合成与克隆串成完整链路,更适合视频配音全流程。

Voice-Pro 与同类开源语音工具定位对比
维度 Voice-Pro RVC(语音转换) Coqui XTTS(语音合成)
技术栈 Python + Gradio + Whisper/F5/CosyVoice Python + 预训练声码器 Python + TTS 生成模型
部署复杂度 uv 一键安装,建议 NVIDIA GPU 模型推理,需 GPU 模型推理,需 GPU
功能侧重 识别+翻译+合成+克隆全链路 语音转换为主 文本转语音为主

技术架构与部署指南

维度 本套源码 同类通用方案
技术栈 前端:Gradio 6.20 构建的本地 WebUI 操作面板。 依具体方案选型,需自行搭建与维护
部署方式 下载仓库后在 Windows 上双击 start.bat,脚本会自动拉取 uv、Python 3.12 并执行 uv s 多托管于第三方平台或订阅云服务
功能侧重 一站式流水线:识别、翻译、合成、克隆在单个 Gradio 标签页内串联,免去在多款工具间来回切换。 功能通用,定制深度有限
数据归属 数据自持,部署在自有服务器,不出站 数据通常留存于服务商侧
成本模式 获取后自主部署,无持续授权费用 通常按订阅或调用量计费

技术栈与运行环境

前端:Gradio 6.20 构建的本地 WebUI 操作面板。

后端:Python 3.12 运行时,由 uv 虚拟环境统一托管依赖。

数据库:无独立数据库,模型权重与用户配置以本地文件形式存储。

运行环境:Windows 平台,推荐 NVIDIA 显卡,PyTorch 2.8.0 搭配 CUDA 12.8 运行时。

其他依赖:ffmpeg 便携版在首次运行按需下载,HuggingFace 与 ModelScope 模型运行时拉取。

安装与部署提示

下载仓库后在 Windows 上双击 start.bat,脚本会自动拉取 uv、Python 3.12 并执行 uv sync 安装依赖。

启动命令为 python start-abus.py voice-pro,首次运行会按 uv.lock 冻结环境并下载所需 AI 模型。

有 NVIDIA 显卡时选择 GPU 环境,无显卡则使用 CPU 环境,两者通过 start.bat 的交互选项切换。

Azure 语音与翻译为可选能力,把 .env.example 复制为 .env 并填入自己的密钥后即可启用。

模型默认存放在 model 目录,重装时删除 installer_files 即可,已下载的模型会被保留。

截图与演示说明

主工作区 Dubbing Studio 是整套流程的入口,左侧上传媒体、右侧排列识别翻译与配音控件。

Dubbing Studio

 

源码内的 CosyVoice 选项卡可加载 Fun-CosyVoice3 等模型,首次使用会从官方 HuggingFace 仓库拉取权重。

Live Translation 选项卡提供实时字幕与翻译,适合会议与直播场景下的多语种字幕生成。

常见问题

问:Voice-Pro 是免费开源的吗。

答:是的,项目以 GPL-3.0 协议完全开源且免费,任何人都可以下载、分发与二次修改。

问:没有 NVIDIA 显卡能运行吗。

答:可以,安装时选择 CPU 环境即可,只是语音合成与克隆的速度会明显慢于 GPU 环境。

问:和 RVC 这类工具比有什么不同。

答:RVC 主要做语音转换,而 Voice-Pro 把识别、翻译、合成与克隆整合到一个面板,更适合视频配音全流程。

问:需要自己提前准备 AI 模型吗。

答:不需要提前准备,Whisper、F5-TTS、CosyVoice 等模型会在首次使用时自动从 HuggingFace 下载。

安全风险提示

特别提示:本源码未检测安全风险文件,下载后请务必进行安全审计,删除恶意代码后再部署使用!

下载说明

源码仅供学习研究、测试部署和二次开发参考,商用前请自行确认授权、版权和安全风险。

项目使用大量第三方 AI 模型,运行时需从 HuggingFace、ModelScope 等公开仓库按需下载权重,请仅在可信网络下操作。

若启用 Azure 语音或翻译能力,密钥保存在本地 .env 文件中,请勿将含密钥的文件提交到公开仓库。

GitHub项目开源地址:https://github.com/abus-aikorea/voice-pro

最后更新:2026-08-16

资源下载
下载价格免费
本文章资源https://www.aosen.cc/mianfei12497.html来源于互联网,如存在侵权,请联系我们立马删除!
0
显示验证码