信号图谱
Gemini重要新发布3 个来源印证2026-08-26

Google 正式发布 Gemini 3.5 Transcribe 语音转文字模型

Google officially launches Gemini 3.5 Transcribe speech-to-text models

多模态低延迟SDK

EVENT SUMMARY

事件摘要

Google 正式发布两款基于 Gemini 音频理解的专用语音转文字模型:Gemini 3.5 Transcribe 和 Gemini 3.5 Transcribe Live。支持 85+ 语言的语句级语言检测、说话人分离、词级时间戳和自定义词汇偏置。流式转录 Live API 进一步瞄准实时会议、客服等场景,标志着 Gemini 正式进入语音转文字市场,与 Whisper 等专业 ASR 服务竞争。

ANALYST VIEW

中立分析

为什么重要

Gemini 正式进入语音转文字市场,直接与 Whisper、Deepgram 等专业 ASR 服务竞争,且以企业级特性作为差异化。流式转录 Live API 进一步瞄准实时会议、客服等场景。

影响对象

面向需要语音转录的开发者与企业,尤其是多语言会议转录、实时客服、语音分析等场景的用户,获得了一个原生集成 Gemini 生态的 ASR 选项。

证据说明

来源为 Google 官方 Gemini API 更新日志及博客,直接证明了 GA 发布、模型名称、功能特性及文档链接。

不确定性

定价信息未在更新日志中披露;与其他 ASR 服务的准确率对比基准未提供;模型支持的语言完整列表未列出。

SOURCES

3 个来源 · 4 条记录