微软上新三款语音 AI 模型:MAI-Transcribe-2-Streaming 转写准确率登顶
微软 ⭐ **三款语音 AI 模型**(2026-10-01 发布):⭐ **MAI-Transcribe-2-Streaming**(流式语音转文字 / 60 种语言 / ⭐ Artificial Analysis **38 款测评准确率第一** + 最终 WER 2.5% / 延迟 0.13 秒)+ ⭐ **MAI-Voice-2.1**(TTS / ⭐ 23 种语言 / 26 地区 / 跨语言同声)+ ⭐ **MAI-Voice-2.1-Flash**(低延迟 / 比可比模型**快 55% / 便宜 60%**)。价格 $0.54 / 小时(年末前优惠)。
一句话总结
微软 ⭐ 三款语音 AI 模型(2026-10-01 发布):⭐ MAI-Transcribe-2-Streaming(流式语音转文字 / 60 种语言 / ⭐ Artificial Analysis 38 款测评准确率第一 + 最终 WER 2.5% / 延迟 0.13 秒)+ ⭐ MAI-Voice-2.1(TTS / ⭐ 23 种语言 / 26 地区 / 跨语言同声)+ ⭐ MAI-Voice-2.1-Flash(低延迟 / ⭐ 比可比模型快 55% / 便宜 60%)。价格 $0.54 / 小时(年末前优惠)。
三款模型速览 ⭐
| 模型 | 类别 | 关键能力 | 价格 |
|---|---|---|---|
| ⭐ MAI-Transcribe-2-Streaming | 实时 STT | 60 种语言 / WER 2.5% 第一 / 延迟 0.13 秒 | $0.54 / 小时(年末前优惠) |
| ⭐ MAI-Voice-2.1 | TTS | 23 种语言 / 26 个地区口音 / 跨语言同声 | $22 / 百万字符 |
| ⭐ MAI-Voice-2.1-Flash | TTS 低延迟 | 比可比模型快 55% / 便宜 60% | $15 / 百万字符 |
1️⃣ MAI-Transcribe-2-Streaming ⭐
测评成绩 ⭐
AI 基准测试与分析平台 Artificial Analysis 公布数据:
| 模型 | 最终 WER | 最终延迟 | 排名 |
|---|---|---|---|
| ⭐ MAI-Transcribe-2-Streaming | 2.5% | 0.13 秒 | ⭐ #1(38 款中) |
| Grok Voice Transcribe 2.0(之前 #1) | 2.7% | 0.49 秒 | #2 |
| Muse Voice Transcribe | 3.1% | 0.16 秒 | — |
| ElevenLabs Scribe v2 Realtime | 3.6% | 0.14 秒 | — |
| Cartesia Ink Preview | 3.1% | 0.11 秒 | ⚠️ 略快但准确率低于微软 |
“首次部分转录”测试中 MAI-Transcribe-2-Streaming:⭐ WER 2.5% / 延迟 0.12 秒(同样最佳)。
流式 vs 传统 ⭐
“与传统语音转文字模型’听完—处理—输出’的模式不同,⭐ 流式模型会先快速生成部分转录结果,再随着更多语音信息进入不断修正,最终形成稳定文本。”
“微软表示,⭐ 模型能够在接收到音频后 100 多毫秒就开始产生首批结果。”
关键能力 ⭐
| 能力 | 详情 |
|---|---|
| ⭐ 支持语言 | 60 种 |
| 持续自动识别 | ⭐ 不必等用户一句话说完就开始输出文字 |
| 首批结果 | ⭐ 音频后 100+ 毫秒 |
应用场景 ⭐
“在客服场景中,AI 智能体可以在用户尚未说完一句话时就开始识别需求;语音助手则可以提前进行推理、准备工具调用,而不是等用户说完后才启动整个处理流程。”
“微软称,在实时听写和字幕等应用中,其内部测试显示,文字出现速度约为最接近竞争对手的两倍。”
价格 ⭐
| 维度 | 详情 |
|---|---|
| ⭐ 年末前优惠价 | $0.54 / 小时 |
| 对应 | ⭐ $9 / 1000 分钟 |
| 定位 | 面向开发者的推广阶段 |
“这也意味着微软此次并非单纯通过低价抢市场,而是试图将 ⭐ 准确率、延迟和企业级部署能力结合起来。”
横向价格对比 ⭐
| 模型 | 价格 / 1000 分钟 |
|---|---|
| Gemini 3.5 Transcribe Live | ≈ $9 |
| ⭐ MAI-Transcribe-2-Streaming | ⭐ $9(年末优惠) |
| ElevenLabs Scribe v2 Realtime | ≈ $6.50 |
| Deepgram Flux | ≈ $6.50 |
| Cartesia Ink-2 | ≈ $4 |
| Muse Voice Transcribe | ≈ $3 |
⭐ 微软定价处于相对较高位置,但 ⭐ 主打准确率 + 延迟 + 企业级综合能力。
2️⃣ MAI-Voice 2.1 系列 ⭐
一端”说得快” ⭐
“MAI-Voice-2.1 和 MAI-Voice-2.1-Flash,分别对应更高的表达质量和更低的延迟。”
| 模型 | 定位 | 价格 | 优势 |
|---|---|---|---|
| MAI-Voice-2.1 | ⭐ 表达质量优先 | $22 / 百万字符 | 23 种语言 + 26 地区口音 |
| MAI-Voice-2.1-Flash | ⭐ 低延迟 + 成本敏感 | $15 / 百万字符 | ⭐ 快 55% / 便宜 60% |
跨语言同声 ⭐
“MAI-Voice-2.1 支持 ⭐ 23 种语言、26 个地区 / 语言环境。微软强调,⭐ 同一个声音可以跨语言保持一致,同时针对不同语言使用更自然的本地口音。”
”⭐ 开发者可以让一个 AI 助手在英语、中文、德语等语言之间切换,而无需为每种语言配置不同的声音。”
安全措施 ⭐
“两款模型均支持 ⭐ 基于数秒参考音频进行声音克隆,并加入 ⭐ 同意机制等安全措施。”
三、端到端产品组合 ⭐
“听得快 + 说得快” ⭐
“从产品组合来看,微软此次实际上是在 ⭐ 同时压缩语音 AI 交互的两端延迟:MAI-Transcribe-2-Streaming 负责快速’听懂’,MAI-Voice-2.1-Flash 负责快速’说出’。”
“微软称,⭐ 两者结合后,可以为语音智能体释放更多时间用于推理、调用工具和检查答案,同时保持接近自然人类对话的交互节奏。”
四、微软 MAI 模型矩阵 ⭐
已有自研模型 ⭐
“微软此前已经推出 ⭐ MAI-Transcribe-2 / MAI-Voice-2 / MAI-Thinking-1 / MAI-Code-1.1-Flash 以及 MAI-Image 系列模型,并将这些模型逐步接入 ⭐ Microsoft Foundry 以及 ⭐ Copilot / Teams / GitHub / Dynamics 365 等产品和服务。”
MAI-Transcribe-2 场景
“MAI-Transcribe-2 目前已经覆盖 ⭐ 会议记录 / 视频字幕 / 客服文档 / 无障碍服务 / 语音智能体等场景;微软此次进一步加入 ⭐ 实时流式版本,意味着其自研模型的竞争重点 ⭐ 正从单项识别准确率,转向实时语音智能体完整链路。”
五、战略意义 ⭐
“对于微软而言,这一方向的意义并不只在于增加几个模型。⭐ 随着 AI 智能体从文字交互进一步走向电话客服、语音助手、实时翻译和多模态工作流,语音识别和语音生成的延迟、准确率与成本都会直接影响用户体验和企业部署成本。”
“此次 MAI-Transcribe-2-Streaming 在 Artificial Analysis 测试中 ⭐ 登顶,至少显示微软在语音 AI 这一细分赛道 ⭐ 正在加速追赶并进入第一梯队。”
配图
图 1:微软三款语音 AI 模型 —— MAI-Transcribe-2-Streaming + MAI-Voice-2.1 / 2.1-Flash(华尔街见闻 · 2026-10-02)
来源
- 网易新闻(华尔街见闻)· 原文
- Artificial Analysis 基准测试平台
- 微软 MAI 自研模型矩阵
- Microsoft Foundry / Copilot / Teams / GitHub / Dynamics 365