MAI Realtime是微软(Microsoft AI)正在测试的首款原生实时语音交互模型,于2026年8月初被媒体曝光。它属于微软自研MAI(Microsoft AI)系列模型家族中的语音交互产品,由Mustafa Suleyman领导的微软AI部门研发。
与传统”用户说完→模型再答”的轮次式语音助手不同,MAI Realtime 实现了双向、全双工(Full-Duplex)实时对话——系统可以同时聆听和回应,用户无需等待AI说完即可插话,对话体验无限逼近真人交流。
目前该模型已在微软的 MAI Playground 平台向部分合作伙伴开放测试,尚未正式上线 Microsoft Foundry 或集成到 Copilot 语音功能中。

MAI Realtime核心特点
表格
| 特点 | 说明 |
|---|---|
| 全双工交互 | 听说并行,打破”一问一答”的轮次交替模式,支持同步聆听与回应 |
| 多语言支持 | 支持16种语言(含中文),覆盖全球主要语种 |
| 自动语言识别与切换 | 对话中可自动识别用户所用语言,并支持中途无缝切换语言 |
| 两种语音风格 | 提供 Victoria 和 Grant 两种语音风格供选择 |
| 原生实时架构 | 非”语音识别→文本推理→语音合成”的拼接方案,而是端到端的原生实时模型 |
| 对话系统定位 | 不支持唱歌或生成非语音音效,专注于自然对话交互 |
| 调试透明化 | 调试面板可显示实时延迟、模型思考内容和处理步骤 |
MAI Realtime技术原理
1. 全双工通信架构
MAI Realtime 采用双向、全双工交互方式,系统在同一时间既能接收用户语音,又能输出回复语音。这意味着:
- 不需要等用户完全说完才开始处理;
- 不需要等模型完全输出完用户才能开口;
- 双方可以像真人一样重叠说话、插话、打断。
2. 端点检测
系统依靠端点检测技术来识别:
- 说话的开始(用户何时开口)
- 说话的停顿(是思考还是结束)
- 说话的结束(一轮发言完毕)
当检测到用户中途插话时,模型能即时调整输出——暂停、修改或重新组织回复内容,实现真正自然的对话节奏。
3. 原生语音到语音
与早期将语音拆分为”ASR→LLM→TTS”三段式管道不同,MAI Realtime 是原生实时语音模型,语音理解与语音生成在统一模型内完成,大幅降低端到端延迟,避免拼接方案中各环节累积的延迟和自然度损失。
4. 多语言实时处理
模型内置多语言理解能力,能够:
- 自动检测用户当前使用的语言;
- 在对话过程中无需用户手动切换即可跟随语言变化;
- 在16种语言之间流畅过渡。
5. 与此前MAI语音模型的区别
微软此前发布的MAI语音模型均为单向模型:
- MAI-Voice-2 / MAI-Voice-2-Flash:语音合成(文本→语音),单向输出;
- MAI-Transcribe-1.5:语音识别(语音→文本),单向输入。
MAI Realtime 则是首个双向交互式语音模型,将”听”和”说”统一到一个实时对话系统中。
MAI Realtime主要功能
- 实时自然对话:以接近真人的节奏进行语音交流,支持打断、插话、追问;
- 多语言对话:16种语言自由使用,自动识别,无需手动设置;
- 语言中途切换:对话进行中可从一种语言切换到另一种,模型无缝跟随;
- 双风格语音输出:Victoria(女声)和 Grant(男声)两种风格;
- 实时调试面板:开发者可查看实时延迟数据、模型内部思考过程和处理步骤;
- 样本分享(规划中):测试权限扩大后,或向平台用户开放对话样本分享功能。
MAI Realtime应用场景
基于全双工实时语音的特性,MAI Realtime 适合以下场景:
- 智能客服与呼叫中心:客户可随时打断、补充信息,无需等待机器人说完,体验接近真人客服;
- 会议与协作助手:实时参与多人讨论,随时回应提问,不打断会议节奏;
- 车载语音交互:驾驶中双手不便操作,全双工语音让指令和反馈更自然流畅;
- 语言学习与陪练:模拟真人对话节奏,支持多语言切换练习,中途纠正即时响应;
- 无障碍交互:为视障或行动不便用户提供无需等待轮次的自然语音交互;
- 教育与辅导:学生可随时插话提问,AI即时调整讲解方向;
- Copilot语音功能升级:未来集成到微软Copilot后,用户与AI助手的语音交互将从”按键说话”升级为”随时开口”。
在MAI模型家族中的位置
MAI Realtime 是微软自研MAI系列模型的重要补充。截至目前,MAI家族已涵盖:
表格
| 模型 | 方向 | 状态 |
|---|---|---|
| MAI-Thinking-1 | 通用推理(MoE架构,万亿参数) | 已发布 |
| MAI-Voice-1 / Voice-2 / Voice-2-Flash | 语音合成 | 已发布 |
| MAI-Transcribe-1 / 1.5 | 语音识别/转录 | 已发布 |
| MAI-Image-2 / 2.5 / 2.5-Pro | 图像生成与编辑 | 已发布 |
| MAI-Cyber-1-Flash | 网络安全 | 已发布 |
| MAI Realtime | 全双工实时语音对话 | 测试中 |
MAI Realtime 填补了MAI家族在实时双向语音交互领域的空白,使微软在语音赛道上具备了与OpenAI GPT-Realtime、Google Gemini Live直接竞争的能力。
MAI Realtime当前状态与展望
- 测试阶段:目前仅向部分合作伙伴在MAI Playground平台开放测试;
- 上线时间未定:尚不清楚何时正式上线Microsoft Foundry或扩展到Copilot;
- 战略意义:微软CEO纳德拉已明确表示,MAI系列模型的目标是逐步降低并最终消除对OpenAI等外部模型的付费调用依赖,MAI Realtime是这一”模型主权”战略在语音交互领域的关键落子。
最后想说
MAI Realtime 是微软在实时语音AI领域迈出的关键一步。它通过全双工架构+端点检测+原生语音到语音处理,将AI语音交互从”对讲机式”的一问一答,升级为”面对面式”的自然对话。支持16种语言和自动语言切换的能力使其具备全球化应用潜力,而其在MAI Playground的测试也预示着微软正加速构建不依赖外部技术的完整AI语音交互体系。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



