
源码系统概览
文章正文
Voice-Pro 是 ABUS 团队开源的 AI 语音处理 WebUI,把语音识别、翻译、合成与语音克隆整合进同一个操作面板。
它基于 Gradio 构建,面向视频配音、有声内容创作与多语言本地化等实际场景。
本仓库当前版本为 4.0.0,采用 uv 管理依赖,整体运行在 Windows 与 NVIDIA GPU 环境。
源码简介
Voice-Pro 是一款面向创作者与开发者的 AI 多媒体处理源码,核心能力覆盖语音识别、机器翻译、文本转语音与零样本语音克隆。
项目以 Gradio 6.20 搭建本地 WebUI,用户上传音频或视频后即可在一个页面内完成字幕生成、翻译与多语种配音。
语音识别部分接入 Whisper、Faster-Whisper 与 Whisper-Timestamped 三套方案,可按精度与速度灵活切换。
语音合成与克隆部分整合 Edge-TTS、kokoro、F5-TTS、E2-TTS 与阿里 CosyVoice,其中 CosyVoice 还支持 Fun-CosyVoice3 多语种克隆。
项目作者为 ABUS,GitHub 账号是 abus-aikorea,以 GPL-3.0 协议开源,星标约 1.2 万,在开源 AI 语音工具里已经打磨得比较成熟。
适用场景
视频创作者可用它把 YouTube 视频下载后自动识别原声、翻译字幕并生成目标语种配音,完成跨语言搬运。
播客与有声书制作者能借助语音克隆把旁白换成指定音色,批量产出多语言版本。
需要卡拉 OK 或伴奏分离的用户,可用内置 Demucs 与 MDX-Net 做人与伴奏拆分。
开发者与研究者在做语音相关实验时,也能把它当作 Whisper、F5-TTS、CosyVoice 的本地化集成入口。
功能亮点
一站式流水线:识别、翻译、合成、克隆在单个 Gradio 标签页内串联,免去在多款工具间来回切换。
多引擎语音合成:同时内置 Edge-TTS、kokoro、F5-TTS、E2-TTS 与 CosyVoice,覆盖通用音色与零样本克隆。
零样本语音克隆:上传几秒参考音频即可克隆音色,Fun-CosyVoice3 额外支持韩、日、英等九种语言。
友好部署:v4 起改用 uv 安装器,所有依赖提供预编译轮子,PyTorch 自带 CUDA 运行时,普通办公电脑也能跑。
受限环境适配:无需管理员权限,ffmpeg 缺失时自动下载便携版,模型下载中断可自动续传自愈。
相较于 RVC 这类只做语音转换的开源项目,Voice-Pro 把识别、翻译、合成与克隆串成完整链路,更适合视频配音全流程。
| 维度 | Voice-Pro | RVC(语音转换) | Coqui XTTS(语音合成) |
|---|---|---|---|
| 技术栈 | Python + Gradio + Whisper/F5/CosyVoice | Python + 预训练声码器 | Python + TTS 生成模型 |
| 部署复杂度 | uv 一键安装,建议 NVIDIA GPU | 模型推理,需 GPU | 模型推理,需 GPU |
| 功能侧重 | 识别+翻译+合成+克隆全链路 | 语音转换为主 | 文本转语音为主 |
技术架构与部署指南
| 维度 | 本套源码 | 同类通用方案 |
|---|---|---|
| 技术栈 | 前端:Gradio 6.20 构建的本地 WebUI 操作面板。 | 依具体方案选型,需自行搭建与维护 |
| 部署方式 | 下载仓库后在 Windows 上双击 start.bat,脚本会自动拉取 uv、Python 3.12 并执行 uv s | 多托管于第三方平台或订阅云服务 |
| 功能侧重 | 一站式流水线:识别、翻译、合成、克隆在单个 Gradio 标签页内串联,免去在多款工具间来回切换。 | 功能通用,定制深度有限 |
| 数据归属 | 数据自持,部署在自有服务器,不出站 | 数据通常留存于服务商侧 |
| 成本模式 | 获取后自主部署,无持续授权费用 | 通常按订阅或调用量计费 |
技术栈与运行环境
前端:Gradio 6.20 构建的本地 WebUI 操作面板。
后端:Python 3.12 运行时,由 uv 虚拟环境统一托管依赖。
数据库:无独立数据库,模型权重与用户配置以本地文件形式存储。
运行环境:Windows 平台,推荐 NVIDIA 显卡,PyTorch 2.8.0 搭配 CUDA 12.8 运行时。
其他依赖:ffmpeg 便携版在首次运行按需下载,HuggingFace 与 ModelScope 模型运行时拉取。
安装与部署提示
下载仓库后在 Windows 上双击 start.bat,脚本会自动拉取 uv、Python 3.12 并执行 uv sync 安装依赖。
启动命令为 python start-abus.py voice-pro,首次运行会按 uv.lock 冻结环境并下载所需 AI 模型。
有 NVIDIA 显卡时选择 GPU 环境,无显卡则使用 CPU 环境,两者通过 start.bat 的交互选项切换。
Azure 语音与翻译为可选能力,把 .env.example 复制为 .env 并填入自己的密钥后即可启用。
模型默认存放在 model 目录,重装时删除 installer_files 即可,已下载的模型会被保留。
截图与演示说明
主工作区 Dubbing Studio 是整套流程的入口,左侧上传媒体、右侧排列识别翻译与配音控件。

源码内的 CosyVoice 选项卡可加载 Fun-CosyVoice3 等模型,首次使用会从官方 HuggingFace 仓库拉取权重。
Live Translation 选项卡提供实时字幕与翻译,适合会议与直播场景下的多语种字幕生成。
常见问题
问:Voice-Pro 是免费开源的吗。
答:是的,项目以 GPL-3.0 协议完全开源且免费,任何人都可以下载、分发与二次修改。
问:没有 NVIDIA 显卡能运行吗。
答:可以,安装时选择 CPU 环境即可,只是语音合成与克隆的速度会明显慢于 GPU 环境。
问:和 RVC 这类工具比有什么不同。
答:RVC 主要做语音转换,而 Voice-Pro 把识别、翻译、合成与克隆整合到一个面板,更适合视频配音全流程。
问:需要自己提前准备 AI 模型吗。
答:不需要提前准备,Whisper、F5-TTS、CosyVoice 等模型会在首次使用时自动从 HuggingFace 下载。
安全风险提示
特别提示:本源码未检测安全风险文件,下载后请务必进行安全审计,删除恶意代码后再部署使用!
下载说明
源码仅供学习研究、测试部署和二次开发参考,商用前请自行确认授权、版权和安全风险。
项目使用大量第三方 AI 模型,运行时需从 HuggingFace、ModelScope 等公开仓库按需下载权重,请仅在可信网络下操作。
若启用 Azure 语音或翻译能力,密钥保存在本地 .env 文件中,请勿将含密钥的文件提交到公开仓库。
GitHub项目开源地址:https://github.com/abus-aikorea/voice-pro
最后更新:2026-08-16