信号图谱
Microsoft Azure AI Foundry重要新发布2025-10-01

GPT-4o 音频转录分离模型发布

gpt-4o-transcribe-diarize Model Released

多模态低延迟

EVENT SUMMARY

事件摘要

微软发布全新的 gpt-4o-transcribe-diarize 自动语音识别(ASR)模型,专为复杂多说话人场景设计。该模型不仅支持超过 100 种语言的实时高精度转录,更核心的是内置了强大的说话人分离(Diarization)能力,能够精准区分并标记不同发言者的语音片段。凭借超低延迟的流式处理性能,它能将非结构化的会议或客服录音实时转化为包含角色标签的结构化数据,为会议纪要自动生成、智能客服质检及多轮对话分析等 B2B 场景提供了关键的基础设施支撑。

ANALYST VIEW

中立分析

为什么重要

提供了针对复杂多说话人场景的专用ASR基础设施。内置说话人分离能力并支持多语言和超低延迟流式处理,提升了非结构化语音数据结构化的效率,为会议纪要、智能客服质检等B2B场景提供了强有力的底层技术支撑。

影响对象

影响需要处理多说话人音频的B2B场景用户,如会议纪要生成服务商、智能客服质检团队及多轮对话分析开发者。这些用户能够利用该模型实时获取包含角色标签的高精度结构化转录数据。

证据说明

原文直接证明了「gpt-4o-transcribe-diarize」模型已发布,具备说话人分离(「Diarization」)功能,支持超过100种语言,并强调其超低延迟的流式处理性能。

不确定性

未提供该模型在不同口音、嘈杂环境下的具体识别准确率,也未说明说话人分离的精度指标及具体的API调用价格。

SOURCES

来源