Microsoft Azure AI Foundry里程碑新发布2025-08-01
Realtime API 音频模型正式 GA
Realtime API Audio Model Officially General Available (GA)
低延迟Tool UseAgent Runtime
EVENT SUMMARY
事件摘要
OpenAI GPT Realtime API 及其底层 Audio 模型现已正式商用(GA),标志着语音 Agent 进入生产级阶段。此次更新带来了多项关键能力增强:显著改进的指令遵循能力使语音交互更精准;新增多款高质量音色以满足不同场景需求;原生支持图片等多模态输入,拓宽了语音 Agent 的感知边界;更重要的是,引入了异步函数调用(Function Calling)与全新的对话模式,彻底解决了语音交互中工具调用的延迟与中断问题,为复杂企业级语音应用奠定了基础。
ANALYST VIEW
中立分析
为什么重要
实时音频模型正式商用标志着语音Agent进入生产级阶段,异步函数调用和多模态输入的引入解决了语音交互中的延迟和感知局限,推动了语音AI从简单对话向复杂企业级工具调用场景的演进。
影响对象
开发者能够构建具备多模态感知和低延迟工具调用能力的语音Agent,企业用户可以利用改进的指令遵循和新音色部署更自然、精准的语音交互应用,解决了以往语音调用工具时的中断问题。
证据说明
原文证明了OpenAI的「GPT RealTime」和「Audio」模型已在Microsoft Foundry中正式可用,支持图片输入、新音色、改进的指令遵循,并明确支持「Async function calling」以调用开发者自定义代码。
不确定性
原文未说明异步函数调用的具体延迟指标、多模态输入的处理速度,以及正式商用后的API计费标准和并发限制。
SOURCES