Microsoft Azure AI Foundry重要新发布2026-02-01
GPT-Realtime-1.5 和 GPT-Audio-1.5 模型发布
Release of GPT-Realtime-1.5 and GPT-Audio-1.5 Models
多模态低延迟Tool Use
EVENT SUMMARY
事件摘要
微软正式上线 gpt-realtime-1.5 与 gpt-audio-1.5 两款新一代实时语音模型。此次更新重点强化了 Voice Agent 落地所需的核心能力:大幅提升了指令遵循的精准度,确保模型在复杂对话中不偏离预设人设与规则;增强了多语言环境下的理解与生成表现;并深度优化了工具调用(Function Calling)的稳定性与响应速度。在实现上述能力跃升的同时,模型依然保持了毫秒级的超低延迟实时交互体验,为构建高拟真、强执行力的企业级语音助手奠定了坚实基础。
ANALYST VIEW
中立分析
为什么重要
实时语音模型的迭代提升了Voice Agent在复杂对话中的指令遵循和工具调用能力,同时保持低延迟,这将推动企业级语音助手和实时交互应用的技术门槛提高,加剧实时语音AI市场的竞争。
影响对象
开发者和企业用户受影响,他们可以利用增强的多语言支持和工具调用稳定性,构建更精准、不偏离人设的实时语音应用,终端用户将获得更流畅、拟真的语音交互体验。
证据说明
原文直接证明了「gpt-realtime-1.5」和「gpt-audio-1.5」模型已发布,并在指令遵循、多语言支持和工具调用方面有所改进,同时保留了低延迟的实时交互特性。
不确定性
原文未提供具体的延迟毫秒数、工具调用成功率提升的具体指标,以及新模型的定价和可用性区域。
SOURCES