Meta实时音频感知模型Muse发布 支持20说话人分轨

Meta实时音频感知模型Muse发布 支持20说话人分轨

  • 全站源码免费
  • 日/微信/10次解锁
  • 日/IP/100次解锁

Meta AI官网Muse系列模型介绍页面截图

Meta Muse Voice Transcribe 是一款实时音频感知语音转写系统,版本号 v1.0.0,是全球首个具备实时音频感知能力的语音 AI 模型,可对超过 20 名说话人的会议音频进行分轨转写。

该模型支持 70 多种语言,在 Artificial Analysis 流式语音转写榜单排名第一,通过 Meta Model API 提供服务。

核心功能与技术亮点

文章正文

Meta 于 2026 年 8 月发布 Muse Voice Transcribe 语音转写模型。

这是全球首个实时音频感知 AI 模型,能在转写的同时感知说话人切换、语气和音频事件。

模型支持 20 名以上说话人的音频分轨,单段音频时长可超过 1 小时。

语言方面宣称支持 70 多种,其中 25 种经过深度验证。

自适应延迟机制可根据场景动态平衡响应速度与识别准确率。

源码简介

Muse Voice Transcribe 由 Meta 开发,属于 Muse 语音模型系列。

与仅输出文字的传统语音识别不同,该模型在流式转写中同步感知音频上下文。

说话人分轨能力可在多人会议中区分超过 20 名发言者并分别成稿。

作者为 Meta 语音团队,模型未采用 MIT 或 Apache 协议开源,通过 Meta Model API 商业授权调用。

版本号 v1.0.0,最后更新 2026 年 8 月,更新日志见 Meta AI 官方文档。

竞品对比

特性 Muse Voice Transcribe WHISPER Deepgram
定位 实时音频感知 批量转写 实时转写
说话人分轨 20人以上 不支持 12人
音频时长 1小时以上 30秒窗口 长音频
语言数量 70种以上 99种 36种
定价 $3/千分钟 开源免费 按量计费

对比 WHISPER 和 Deepgram,区别在于 Muse Voice Transcribe 具备实时音频感知与超多人分轨能力,可作为 WHISPER 流式会议转写场景的替代方案。

适用场景

适用于大型多人会议的实时记录与分轨纪要生成。

支持客服中心电话录音的批量转写与说话人分离。

可用于播客和访谈节目的自动字幕与逐字稿制作。

适合跨语言会议中 70 多种语言的实时翻译辅助。

技术栈与运行环境

核心为实时音频感知架构,流式转写延迟可动态调节。

说话人分轨支持 20 人以上,适合大型会议场景。

语言覆盖 70 多种,其中 25 种为深度验证语种。

调用方式为 Meta Model API,定价每千分钟 3 美元,折合每小时 0.18 美元。

版本号 v1.0.0,最后更新 2026 年 8 月,更新日志见官方文档。

功能亮点

  • 实时音频感知,全球首个在转写中同步理解音频上下文的模型
  • 超多人分轨,单段音频区分 20 名以上说话人
  • 长音频支持,单次处理超过 1 小时的连续音频
  • 自适应延迟,按场景平衡响应速度与准确率
  • 榜单第一,Artificial Analysis 流式语音转写榜排名第一

部署指南与常见问题

安装与部署提示

模型通过 Meta Model API 调用,无需本地部署 GPU 资源。

定价为每千分钟 3 美元,适合大批量音频的转写需求。

开发者可在 Meta AI 开发者平台申请 API 密钥并查阅接入文档。

版本号 v1.0.0,最后更新 2026 年 8 月,更新日志见官方发布说明。

截图与演示说明

封面展示了 Meta AI 官网的 Muse 系列产品介绍页面。

页面列出了 Muse 系列模型的更新动态与体验入口。

开发者可在平台内查看流式转写的演示与延迟指标。

API 文档提供了说话人分轨与多语言参数的配置说明。

常见问题

问,Muse Voice Transcribe 和 WHISPER 有什么区别?

区别在于 Muse 具备实时音频感知能力和 20 人以上说话人分轨,而 WHISPER 以批量转写为主且不支持分轨。

问,支持哪些语言?

宣称支持 70 多种语言,其中 25 种经过深度验证,覆盖全球主要语种。

问,如何收费?

通过 Meta Model API 按量计费,每千分钟 3 美元,折合每小时约 0.18 美元。

问,是否开源?

模型未开源,属于 Meta 商业授权服务,需通过 Meta Model API 调用。

下载说明

本文来源,IT之家,原文链接 https://www.ithome.com/0/997/218.htm 。

Muse Voice Transcribe 由 Meta 于 2026 年 8 月发布,版本 v1.0.0。

更新日志见 Meta AI 官网,最后更新 2026 年 8 月。

相关开源语音研究可参考,GitHub 地址 https://github.com/facebookresearch ,MIT 协议项目见仓库说明。

本文章资源https://www.aosen.cc/mianfei15855.html来源于互联网,如存在侵权,请联系我们立马删除!
0
显示验证码