杂谈

微软上新三款语音 AI 模型:MAI-Transcribe-2-Streaming 转写准确率登顶

微软 ⭐ **三款语音 AI 模型**(2026-10-01 发布):⭐ **MAI-Transcribe-2-Streaming**(流式语音转文字 / 60 种语言 / ⭐ Artificial Analysis **38 款测评准确率第一** + 最终 WER 2.5% / 延迟 0.13 秒)+ ⭐ **MAI-Voice-2.1**(TTS / ⭐ 23 种语言 / 26 地区 / 跨语言同声)+ ⭐ **MAI-Voice-2.1-Flash**(低延迟 / 比可比模型**快 55% / 便宜 60%**)。价格 $0.54 / 小时(年末前优惠)。

一句话总结

微软 ⭐ 三款语音 AI 模型(2026-10-01 发布):⭐ MAI-Transcribe-2-Streaming(流式语音转文字 / 60 种语言 / ⭐ Artificial Analysis 38 款测评准确率第一 + 最终 WER 2.5% / 延迟 0.13 秒)+ ⭐ MAI-Voice-2.1(TTS / ⭐ 23 种语言 / 26 地区 / 跨语言同声)+ ⭐ MAI-Voice-2.1-Flash(低延迟 / ⭐ 比可比模型快 55% / 便宜 60%)。价格 $0.54 / 小时(年末前优惠)。


三款模型速览 ⭐

模型类别关键能力价格
⭐ MAI-Transcribe-2-Streaming实时 STT60 种语言 / WER 2.5% 第一 / 延迟 0.13 秒$0.54 / 小时(年末前优惠)
⭐ MAI-Voice-2.1TTS23 种语言 / 26 个地区口音 / 跨语言同声$22 / 百万字符
⭐ MAI-Voice-2.1-FlashTTS 低延迟比可比模型快 55% / 便宜 60%$15 / 百万字符

1️⃣ MAI-Transcribe-2-Streaming ⭐

测评成绩 ⭐

AI 基准测试与分析平台 Artificial Analysis 公布数据:

模型最终 WER最终延迟排名
⭐ MAI-Transcribe-2-Streaming2.5%0.13 秒⭐ #1(38 款中)
Grok Voice Transcribe 2.0(之前 #1)2.7%0.49 秒#2
Muse Voice Transcribe3.1%0.16 秒—
ElevenLabs Scribe v2 Realtime3.6%0.14 秒—
Cartesia Ink Preview3.1%0.11 秒⚠️ 略快但准确率低于微软

“首次部分转录”测试中 MAI-Transcribe-2-Streaming:⭐ WER 2.5% / 延迟 0.12 秒(同样最佳)。

流式 vs 传统 ⭐

“与传统语音转文字模型’听完—处理—输出’的模式不同,⭐ 流式模型会先快速生成部分转录结果,再随着更多语音信息进入不断修正,最终形成稳定文本。”

“微软表示,⭐ 模型能够在接收到音频后 100 多毫秒就开始产生首批结果。”

关键能力 ⭐

能力详情
⭐ 支持语言60 种
持续自动识别⭐ 不必等用户一句话说完就开始输出文字
首批结果⭐ 音频后 100+ 毫秒

应用场景 ⭐

“在客服场景中,AI 智能体可以在用户尚未说完一句话时就开始识别需求;语音助手则可以提前进行推理、准备工具调用,而不是等用户说完后才启动整个处理流程。”

“微软称,在实时听写和字幕等应用中,其内部测试显示,文字出现速度约为最接近竞争对手的两倍。”

价格 ⭐

维度详情
⭐ 年末前优惠价$0.54 / 小时
对应⭐ $9 / 1000 分钟
定位面向开发者的推广阶段

“这也意味着微软此次并非单纯通过低价抢市场,而是试图将 ⭐ 准确率、延迟和企业级部署能力结合起来。”

横向价格对比 ⭐

模型价格 / 1000 分钟
Gemini 3.5 Transcribe Live≈ $9
⭐ MAI-Transcribe-2-Streaming⭐ $9(年末优惠)
ElevenLabs Scribe v2 Realtime≈ $6.50
Deepgram Flux≈ $6.50
Cartesia Ink-2≈ $4
Muse Voice Transcribe≈ $3

⭐ 微软定价处于相对较高位置,但 ⭐ 主打准确率 + 延迟 + 企业级综合能力。


2️⃣ MAI-Voice 2.1 系列 ⭐

一端”说得快” ⭐

“MAI-Voice-2.1 和 MAI-Voice-2.1-Flash,分别对应更高的表达质量和更低的延迟。”

模型定位价格优势
MAI-Voice-2.1⭐ 表达质量优先$22 / 百万字符23 种语言 + 26 地区口音
MAI-Voice-2.1-Flash⭐ 低延迟 + 成本敏感$15 / 百万字符⭐ 快 55% / 便宜 60%

跨语言同声 ⭐

“MAI-Voice-2.1 支持 ⭐ 23 种语言、26 个地区 / 语言环境。微软强调,⭐ 同一个声音可以跨语言保持一致,同时针对不同语言使用更自然的本地口音。”

”⭐ 开发者可以让一个 AI 助手在英语、中文、德语等语言之间切换,而无需为每种语言配置不同的声音。”

安全措施 ⭐

“两款模型均支持 ⭐ 基于数秒参考音频进行声音克隆,并加入 ⭐ 同意机制等安全措施。”


三、端到端产品组合 ⭐

“听得快 + 说得快” ⭐

“从产品组合来看,微软此次实际上是在 ⭐ 同时压缩语音 AI 交互的两端延迟:MAI-Transcribe-2-Streaming 负责快速’听懂’,MAI-Voice-2.1-Flash 负责快速’说出’。”

“微软称,⭐ 两者结合后,可以为语音智能体释放更多时间用于推理、调用工具和检查答案,同时保持接近自然人类对话的交互节奏。”


四、微软 MAI 模型矩阵 ⭐

已有自研模型 ⭐

“微软此前已经推出 ⭐ MAI-Transcribe-2 / MAI-Voice-2 / MAI-Thinking-1 / MAI-Code-1.1-Flash 以及 MAI-Image 系列模型,并将这些模型逐步接入 ⭐ Microsoft Foundry 以及 ⭐ Copilot / Teams / GitHub / Dynamics 365 等产品和服务。”

MAI-Transcribe-2 场景

“MAI-Transcribe-2 目前已经覆盖 ⭐ 会议记录 / 视频字幕 / 客服文档 / 无障碍服务 / 语音智能体等场景;微软此次进一步加入 ⭐ 实时流式版本,意味着其自研模型的竞争重点 ⭐ 正从单项识别准确率,转向实时语音智能体完整链路。”


五、战略意义 ⭐

“对于微软而言,这一方向的意义并不只在于增加几个模型。⭐ 随着 AI 智能体从文字交互进一步走向电话客服、语音助手、实时翻译和多模态工作流,语音识别和语音生成的延迟、准确率与成本都会直接影响用户体验和企业部署成本。”

“此次 MAI-Transcribe-2-Streaming 在 Artificial Analysis 测试中 ⭐ 登顶,至少显示微软在语音 AI 这一细分赛道 ⭐ 正在加速追赶并进入第一梯队。”


配图

微软 MAI 语音 AI 模型矩阵

图 1:微软三款语音 AI 模型 —— MAI-Transcribe-2-Streaming + MAI-Voice-2.1 / 2.1-Flash(华尔街见闻 · 2026-10-02)

来源