2026-09-30 月报 AI 行业竞争情报
执行摘要
2026 年 9 月,全球 AI 行业在模型能力、平台架构和商业化模式上出现显著的结构性变化。OpenAI 发布 GPT-6 系列(Astra/Sol/Luna)及 Agents API,标志着其从单一模型提供商向“模型矩阵+托管 Agent 运行时”的全面转型;Google 推出 Gemini 3.8 系列(Flash、Live、TTS),在实时多模态和语音合成领域建立新的产品基线,并明确了 Agent 平台的资源定价结构。在中国市场,阿里百炼发布 AgentStudio 并推出 Night Plan 分时定价,同时接入 DeepSeek 和 Kimi 的旗舰模型,显示国内 MaaS 平台正加速向全栈 Agent 基础设施和跨平台模型聚合方向演进。DeepSeek 发布 V4.1-Flash 并首创峰谷分时定价,进一步加剧了推理成本与调度策略的竞争。整体而言,行业正从“提供大模型 API”向“提供生产级 Agent 运行环境”跨越,同时通过分时、分层和缓存等精细化定价手段挖掘算力利用率与商业价值。
关键事件
1. OpenAI 发布 GPT-6 模型矩阵与 Agents API 托管运行时
- 发生了什么:OpenAI 在 DevDay 2026 期间集中发布了 GPT-6 系列模型,包括定位旗舰与商业场景的 GPT-6 Astra(支持 Computer Use 和网络安全 Critical 级别能力,Standard 输出定价 $50/1M tokens,新增 6 倍价格的 Ultrafast 低延迟模式)、定位中端性价比的 GPT-6 Sol(输入 $2/1M tokens)以及定位轻量高吞吐的 GPT-6 Luna(输入 $0.10/1M tokens)。同时,OpenAI 发布 Agents API 公开测试版,基于 Codex harness 提供持久会话、上下文压缩、MCP 服务器连接及托管沙箱,并新增 Computer Use 工具支持在托管浏览器中执行任务。此外,发布了 dots 主动助手和 GPT-Live 1 全双工语音 API。
- 为什么重要:GPT-6 系列通过 Astra/Sol/Luna 三层布局覆盖了从高端推理到轻量批处理的完整价格带。Agents API 的发布标志着 OpenAI 正式将 Agent 的会话管理、工具编排和沙箱运行作为平台级托管服务提供,降低了企业构建生产级 Agent 的工程门槛。
- 影响哪些用户/市场:面向企业开发者、Agent 构建者和对延迟/成本敏感的不同层级用户。Agents API 和 Computer Use 将直接改变企业自动化工作流的开发范式。
- 证据是什么:OpenAI 官方 Changelog、定价页面 diff 及官方博客直接确认了模型名称、能力边界、定价结构(含 Ultrafast 和 FedRAMP 10% 溢价)及 Agents API 的功能细节。
- 还有哪些不确定性:GPT-6 Astra 的具体参数规模、Computer Use 的底层实现机制(本地或云端浏览器)、Agents API 的正式 GA 时间及 SLA 承诺尚未披露。
2. Google 推出 Gemini 3.8 家族并确立 Agent 平台资源定价
- 发生了什么:Google 正式发布 Gemini 3.8 Flash(面向长周期软件工程与自主代理)、Gemini 3.8 Live 及 Extended Thinking 变体(实时多模态与深度推理),并推出 Gemini 3.8 Flash TTS 和 Flash-Lite TTS(定位录音室级语音合成,支持上下文缓存及四种服务层级,2026 年底前享 50% 折扣)。在平台层面,Gemini Enterprise Agent Platform 推出统一的三资源定价结构(Compute/Memory/Storage),含免费层且空闲不计费,同时语义治理策略支持 VPC Service Controls。
- 为什么重要:Gemini 3.8 系列在实时语音交互(Live Avatar)和专业 TTS 领域直接对标 OpenAI 和 ElevenLabs。Agent Platform 的统一资源定价解决了以往 Agent 运行成本难以预测的问题,空闲不计费机制对长时挂起的 Agent 极为友好。
- 影响哪些用户/市场:语音 AI 开发者、内容创作者、企业 Agent 构建者及注重数据合规(VPC 控制)的金融/医疗客户。
- 证据是什么:Google AI 定价页面、DeepMind 官方博客及 Google Cloud Release Notes 直接证实了产品发布、定价层级(Standard/Batch/Flex/Priority)及 VPC 安全功能。
- 还有哪些不确定性:TTS 模型的实际音质表现、Live Avatar 的具体技术实现(3D 还是视频流)、Agent Compute 与 vCPU 的具体映射关系及各层级的具体延迟 SLA 未披露。
3. 阿里百炼发布 AgentStudio 并推进分时定价与模型聚合
- 发生了什么:阿里百炼发布 AgentStudio 企业级平台,集成 Managed Agent、Flow Agent、MCP、Skill、RAG、Memory 六大能力模块,并上线“万有无界”多 Agent 协作平台。商业化方面,推出 Token Plan 订阅制(Lite/Standard/Team)及 Night Plan(22:00 后 Qwen3.8-Max/Flash 限时 4 折)。模型生态上,百炼接入了 DeepSeek-V4-Pro 和 Kimi-K3 等第三方旗舰模型,并将云市场升级为包含 MCP 分类的“AI 应用市场”。
- 为什么重要:百炼从单纯的模型 API 服务升级为全栈 Agent 基础设施,MCP 和 Memory 的独立模块化反映了对 Agent 开发范式的深度适配。Night Plan 是国内 MaaS 平台首次尝试时段差异化定价,而接入竞品模型则表明其向“模型聚合与分发平台”转型的战略。
- 影响哪些用户/市场:国内企业级 Agent 开发者、对成本敏感的批处理任务用户,以及需要在单一平台对比调用多家模型的 ISV。
- 证据是什么:阿里云百炼控制台页面、官方 Changelog 及定价文档直接展示了六大模块、Token Plan 价格、Night Plan 规则及第三方模型上架信息。
- 还有哪些不确定性:AgentStudio 的具体 SLA、Night Plan 4 折优惠的长期持续性、MCP 应用市场的入驻规则及第三方模型在百炼上的具体并发限制未明确。
4. DeepSeek 发布 V4.1-Flash 并首创峰谷分时定价
- 发生了什么:DeepSeek 发布全新架构的 V4.1-Flash 模型,具备原生多模态视觉理解,在 GPQA Diamond、Codeforces 等基准测试中表现突出。同时,DeepSeek 推出 API 峰谷分时定价(Off-Peak 价格为 Peak 的一半),并引入 Cache Hit/Miss 差异化计价,Flash 模型 Off-Peak 输入 Cache Hit 低至 $0.003/1M tokens。
- 为什么重要:V4.1-Flash 提升了轻量级模型的多模态与推理基线。峰谷分时定价是 AI API 市场首次引入类似电力市场的调度定价模式,极低的价格($0.003)将迫使开发者重新设计任务调度逻辑和缓存策略。
- 影响哪些用户/市场:API 开发者、成本敏感型企业及从事离线数据处理、批量推理的客户。
- 证据是什么:DeepSeek 官方 API 文档 Changelog 及定价页面直接提供了模型基准分数、峰谷时段定义及精确到小数点后三位的 Cache Hit 价格。
- 还有哪些不确定性:新架构的具体参数规模、Cache Hit 的判定粒度与有效期、峰谷定价的具体生效日期及 V4 Pro 模型的后续策略未详细说明。
5. AWS Bedrock 与 Vertex AI 加速前沿模型聚合
- 发生了什么:AWS Bedrock 陆续上线 OpenAI GPT-6 Astra/Sol/Luna、Anthropic Claude Opus 5.5 及 Claude Fable 5.1,并扩展智能提示路由以支持 Nova Pro/Lite 组合。Google Vertex AI (Gemini Enterprise Agent Platform) 的 Model Garden 上线了 Claude Sonnet 5.5 和 Meta Muse Spark 1.3 推理模型。
- 为什么重要:OpenAI 旗舰模型登陆 AWS Bedrock,打破了此前 Bedrock 主要依赖 Anthropic/Meta 的格局,也意味着 OpenAI 与 Azure 的独家绑定关系进一步松动。云厂商正通过聚合所有前沿模型来巩固其作为企业 AI 统一入口的地位。
- 影响哪些用户/市场:多云战略的企业客户、需要灵活切换模型的开发者,以及面临云厂商渠道竞争的基础模型提供商。
- 证据是什么:AWS 官方博客周报及 Google Cloud Release Notes 直接确认了上述模型在 Bedrock 和 Model Garden 的上线状态。
- 还有哪些不确定性:部分模型(如 GPT-6 Sol/Luna 在 Bedrock 上)的具体定价、区域可用性及是否支持微调等深度集成功能尚未公布。
主要趋势
趋势一:从“模型 API”向“全托管 Agent 运行时(Agent Runtime)”演进
行业正经历从提供无状态模型推理 API 向提供有状态、长时运行的 Agent 基础设施的范式转移。本月,OpenAI 发布 Agents API(基于 Codex harness,支持持久会话、上下文压缩和托管沙箱),阿里百炼推出 AgentStudio(集成 Managed Agent、Memory、MCP 等六大模块)及万有无界协作平台,Kimi 开放平台上线托管智能体(Hosted Agents)Beta 版,Microsoft Azure AI Foundry 的 Foundry Routines 正式 GA(支持事件驱动和持续执行),Google Agent Platform 则明确了基于 Compute/Memory/Storage 的 Agent 资源定价且空闲不计费。 这一趋势表明,头部平台已意识到企业落地 Agent 的核心痛点在于会话管理、工具集成、沙箱隔离和状态恢复。平台方通过接管这些底层工程复杂度,将 Agent 运行时作为新的利润中心。这不仅降低了开发门槛,也增加了用户对特定平台基础设施的粘性。
趋势二:推理算力与 API 服务的精细化、分时与分层定价普及
随着模型推理成本成为企业规模化应用的主要障碍,平台方开始通过精细化的价格杠杆来优化算力分配并挖掘不同场景的商业价值。本月出现了多种创新定价模式:DeepSeek 首创峰谷分时定价(Off-Peak 半价),阿里百炼推出 Night Plan(22:00 后 4 折),两者均旨在利用夜间闲置算力降低批处理成本;OpenAI 为 GPT-6 Astra 新增 Ultrafast 模式(Standard 价格的 6 倍)以变现极低延迟需求,并为 FedRAMP 端点加收 10% 合规溢价;Google 为 TTS 模型提供 Standard/Batch/Flex/Priority 四种层级,并对上下文缓存输入提供 75% 折扣。 这种趋势反映出 AI API 市场正从单一的“按 Token 计费”走向类似云计算和电信行业的复杂定价体系。开发者需要建立更复杂的成本优化和任务调度策略(如错峰调用、缓存优化、降级路由)以控制支出。
趋势三:实时多模态与语音合成(TTS)成为平台级核心能力
语音和实时交互正从大模型的“附加插件”升级为由底层架构原生支持的“核心能力”。本月,OpenAI 发布 GPT-Live 1 全双工语音 API(支持语音与后端 Agent 推理并行及按秒计费),Google 推出 Gemini 3.8 Live(支持 Extended Thinking 和 Live Avatar 视觉交互)及录音室级 Gemini 3.8 Flash TTS(支持上下文缓存),阿里百炼上线 Qwen3.8-Omni-Flash-Realtime 替代旧版实时对话模型。 这一趋势意味着 AI 助手正在从“异步文本交互”向“低延迟、具身化、全双工”的自然人类交互方式演进。TTS 能力的平台化(如 Google 提供多定价层级和缓存)也直接切入了专业内容生产和实时语音代理(Voice Agent)市场,对传统的独立 TTS 服务商形成降维竞争。
用户与市场影响
对开发者与企业用户的影响: Agent 开发门槛显著降低,但架构锁定风险增加。OpenAI Agents API 和阿里百炼 AgentStudio 提供了开箱即用的会话和沙箱管理,开发者无需自建复杂基础设施,但这也意味着核心业务逻辑将更深地绑定在特定平台的运行时上。此外,精细化定价(如 DeepSeek 峰谷、阿里 Night Plan、OpenAI 缓存降价)要求开发团队具备更强的成本工程能力,通过优化 Prompt 缓存命中率和任务调度时间来控制预算。多模态实时 API 的成熟(GPT-Live 1, Gemini 3.8 Live)将加速语音客服、实时翻译和教育辅导等场景的产品化落地。
对市场竞争格局的影响: 云厂商的“模型超市”策略进一步巩固。AWS Bedrock 引入 OpenAI GPT-6 系列,Vertex AI 引入 Claude 和 Meta 模型,表明云巨头正通过聚合所有前沿模型来确保企业客户不流失,基础模型提供商(如 OpenAI、Anthropic)对云渠道的依赖加深,独家绑定关系被打破。在中国市场,阿里百炼接入 DeepSeek-V4-Pro 和 Kimi-K3,并将云市场升级为包含 MCP 的 AI 应用市场,显示国内 MaaS 平台正从“自研模型封闭生态”转向“开放聚合与工具生态分发”,MCP 协议已成为应用市场的重要分发标准。
生态与合规信号: 智谱 GLM-4.6 从 HuggingFace zai-org 组织下架,可能暗示其开源策略调整或版本迭代,依赖该权重的开发者需关注迁移路径。火山方舟将版权视频生成计费从固定倍数改为“IP 单价×时长”,反映了版权合规成本的精细化核算。OpenAI 向乌克兰扩展 Daybreak 网络防御计划、Sam Altman 在联合国安理会发表 AI 安全讲话,以及 GPT-6 Astra 达到网络安全 Critical 级别,表明前沿 AI 能力正深度介入地缘政治与国家级安全基础设施,AI 安全治理已从理论讨论进入实质性的高风险能力管控阶段。
证据与不确定性
证据强度说明: 本报告的核心事实(如模型发布、定价结构、API 功能)均直接来源于各厂商的官方 Changelog、定价页面 diff、官方博客及 Release Notes,证据确凿。例如,OpenAI GPT-6 系列的定价、Google Agent Platform 的资源计费公式、DeepSeek 的峰谷价格均通过官方页面直接抓取验证。
主要不确定性与数据盲区:
- 性能基准与对比缺失:多数新发布模型(如 GPT-6 Astra/Sol/Luna、Gemini 3.8 Flash、Kimi K3、Qwen3.8 系列)的官方公告中缺乏第三方复现的基准测试数据,或与竞品的直接对比数据。厂商自述的“最智能”、“录音室级”等定位尚需独立评测验证。
- SLA 与生产级限制未明:Agents API、Foundry Routines、Kimi 托管智能体等 Agent 运行时服务多处于 Beta 或 Preview 阶段,其正式的 SLA 承诺、并发限制、沙箱资源上限及故障恢复机制尚未完全公开。
- 安全与科研突破的验证状态:OpenAI 发布的 Navier-Stokes 千禧年难题 AI 解答及 DeepMind 的 AlphaGenome Atlas 属于重大科研声明,但目前均缺乏数学界或生物学界的独立同行评审和官方验证,其实际科学贡献程度存在不确定性。
- 定价策略的长期性:阿里百炼的 Night Plan 4 折、Google TTS 的 50% 折扣均标注为“限时”或特定时间段(2026 年底前),这些价格是否为长期战略还是短期获客促销,尚待后续观察。
数据来源
- OpenAI 官方 Blog (https://openai.com/news/rss.xml)
- OpenAI 开发者 Changelog (https://developers.openai.com/api/docs/changelog.md)
- OpenAI API 定价页面 (https://developers.openai.com/api/docs/pricing.md)
- Google AI 定价页面 (https://ai.google.dev/pricing)
- Google Gemini API Changelog (https://ai.google.dev/gemini-api/docs/changelog)
- Google DeepMind 官方 Blog (https://deepmind.google/blog/rss.xml)
- Google Cloud Gemini Enterprise Agent Platform Release Notes (https://docs.cloud.google.com/feeds/gemini-enterprise-agent-platform-release-notes.xml)
- AWS 官方博客 AI/Machine Learning 分类 (https://aws.amazon.com/blogs/aws/category/artificial-intelligence/amazon-machine-learning/amazon-bedrock/feed/)
- AWS Bedrock 定价页面 (https://aws.amazon.com/bedrock/pricing/)
- 阿里云百炼控制台 (https://bailian.console.aliyun.com)
- 阿里云模型工作室 Release Notes (https://help.aliyun.com/zh/model-studio/release-notes)
- 阿里云百炼计费文档 (https://help.aliyun.com/zh/model-studio/billing-of-model-studio)
- DeepSeek API 文档更新 (https://api-docs.deepseek.com/updates)
- DeepSeek 定价页面 (https://api-docs.deepseek.com/quick_start/pricing)
- Kimi 开放平台 Changelog (https://platform.kimi.com/docs/changelog)
- Moonshot 官方文档 (https://platform.moonshot.cn/docs)
- Microsoft Foundry 官方 Blog (https://devblogs.microsoft.com/foundry/feed/)
- 智谱 HuggingFace 组织页面 (https://huggingface.co/api/models?author=zai-org)
- 火山方舟定价文档 (https://www.volcengine.com/docs/82379/1099320)