2026-08-31 月报 AI 行业竞争情报
执行摘要
2026年8月,全球及中国头部 AI 平台在模型能力、定价策略与基础设施层面发生显著变化。本月情报显示,API 定价模式正从单一的 Token 按量计费,向时段差异化计费与多维度资源计费演进;1M 级别长上下文与深度 Agent 执行能力已成为新一代旗舰模型的标配;多模态生成模型(视频、语音、3D)密集完成从预览到生产级 GA 的过渡,并伴随旧代际模型的快速清退。此外,模型生态的互操作性显著增强,跨平台 API 兼容与第三方模型聚合成为 MaaS 平台的核心策略。OpenAI 在消费端启动广告测试并公布自研推理芯片成果,显示出其在商业化变现与底层算力降本上的双重探索。
关键事件
OpenAI Platform
- GPT-5.6 家族与自研芯片:发布 GPT-5.6 Sol/Terra/Luna 三款旗舰模型,确立新一代价格锚点;首次公布自研推理芯片 Jalapeño 的测试结果,宣称在推理速度、能效与延迟方面达到行业领先。
- 企业级 Agent 与商业化:推出企业级 AI Agent 平台 Presence,支持语音和聊天智能体部署;为 ChatGPT Work 和 Codex 推出 Admin 管理插件;在 ChatGPT 中启动广告测试以支持免费用户使用。
- 生态与合规:因 Cursor 被 SpaceX 收购,OpenAI 决定终止向其供应模型的合同;公布 Hugging Face 安全事件调查结果及后续安全强化措施;将 ChatGPT for Teachers 扩展至 55 个美国学区。
Google (Gemini / DeepMind / Agent Platform)
- 模型 GA 与代际更替:Gemini Omni Flash(视频生成与编辑)与 Gemini 3.7 Flash(编程与 Agent)正式 GA;推出 Gemini 3.5 Transcribe 及 Live 语音转文字模型。同时,从定价页移除 Veo 3、Imagen 4、Gemini 2.0 Flash/Lite 等旧代际模型。
- Agent 基础设施定价:Agent Platform 推出统一资源定价结构,按 Agent Compute($0.085/vCPU-h)、Memory 和 Storage 独立计费,并提供每月免费额度。
DeepSeek Platform
- V4 系列发布与 API 兼容:发布 V4 Flash 和 Pro 模型,支持 1M 上下文与 384K 最大输出,原生兼容 Anthropic API 格式与 OpenAI Responses API,新增 FIM 补全与 Thinking Mode。
- 定价策略调整:首次引入峰谷时段差异化计费(高峰时段价格翻倍),并宣布周末全天适用低谷价;预告近期将大幅上调 API 整体定价。
阿里百炼(DashScope)
- 订阅制与模型上新:推出 Token Plan 订阅计划与 Night Plan 夜间折扣(低至 2 折);上线 Qwen3.8-Max、Qwen3.8-Flash(百万级上下文)、Qwen3.5-Omni-Plus 全模态模型,以及 Wan3.0-Video、HappyHorse 视频模型和 Qwen-Image-3.0-Pro。
- 第三方聚合与区域调整:大规模接入 DeepSeek V4、Kimi K3、智谱 GLM-5.3、MiniMax-M3 及小米 mimo-v2.5-pro 等第三方模型;全面移除东京(ap-northeast-1)区域的模型部署。
智谱 BigModel 与 Moonshot
- 智谱:发布并开源 GLM-5.2(1M 上下文),上线 GLM-5.3 旗舰文本模型(编程能力提升)及 GLM-5V-Turbo 多模态 Agent 基座模型。
- Moonshot:发布 Kimi K3 旗舰模型,参数规模达 2.8 万亿,支持 1M 上下文与视觉理解。
火山方舟 与 AWS Bedrock
- 火山方舟:上线 Managed Agents 托管服务(按运行时+Token+工具计费)及 Coding/Agent Plan 个人订阅;大幅上调 DeepSeek-V4 系列价格(Flash 输入涨 200%);新增 GUI Agent、云部署 MCP、3D 生成与视觉定位能力入口。
- AWS Bedrock:AgentCore 推出持久化运行时实例,支持 GPU 与长达 14 天的会话;移除 Grok 4.3 定价信息并新增 Grok 4.6 入口。
主要趋势
1. API 定价模式向“时段差异化”与“多维资源”演进
纯按 Token 计费的模式正在被打破,厂商开始通过价格杠杆优化算力调度,并针对 Agent 场景建立新的计费基准。
- 时段差异化:DeepSeek V4 引入峰谷计费(UTC 01:00-04:00 和 06:00-10:00 价格翻倍),并实施周末全天低谷价;阿里百炼推出 Night Plan,Qwen3.8-Max 夜间低至 2 折或 5 折。这表明厂商正利用价格差异引导非实时推理任务错峰运行,以缓解高峰期算力压力。
- 场景化订阅:阿里百炼上线 Token Plan(个人版与团队版),火山方舟推出 Coding Plan(40-200 元/月)和 Agent Plan(40-1000 元/月),将高频场景打包为固定订阅,以稳定收入预期并降低开发者成本核算难度。
- 多维资源计费:针对 Agent 运行时的复杂性,Google Agent Platform 确立了按 Agent Compute($0.085/vCPU-h)、Memory($0.009/GiB-h)和 Storage 计费的统一结构;火山方舟 Managed Agents 采用“模型调用+运行时时长(0.5元/小时)+工具调用(0.02元/次)”三维累加计费。这标志着 Agent 基础设施从单纯的模型 API 调用,转向包含持久化计算和外部工具消耗的完整资源计费。
2. 1M+ 长上下文与深度 Agent/编程能力成为旗舰标配
长文本处理能力已从“文档阅读”向“项目级工程执行”转变,模型能力正深度耦合工具调用与长程任务规划。
- 1M 上下文普及:智谱 GLM-5.2/5.3、Kimi K3、DeepSeek V4、阿里 Qwen3.8-Flash、火山 doubao-seed-evolving 均将上下文窗口扩展至 1M 级别。DeepSeek V4 进一步将最大输出提升至 384K tokens,使其能够一次性处理大规模代码库或生成超长文档。
- Agent 与编程深度优化:DeepSeek V4 支持 FIM(Fill-in-the-Middle)补全与 Thinking Mode,并原生兼容 Responses API;智谱发布 GLM-5V-Turbo,定位为多模态 Agent 基座,强化视觉理解到动作执行的完整流程;火山方舟新增 GUI Agent 与云部署 MCP(Model Context Protocol)入口,支持在真实 GUI 环境中完成自动化任务。
- 持久化运行时:AWS Bedrock AgentCore 推出支持 GPU 和 14 天长会话的持久化 EC2 实例;OpenAI 推出 Presence 企业 Agent 平台。这表明云厂商和模型提供商正在为复杂 Agent 提供底层计算资源与部署环境,而不仅仅是 API 接口。
3. 第三方模型聚合与 API 生态互操作性加速
MaaS 平台正转变为模型聚合网关,API 协议的标准化大幅降低了开发者的迁移成本。
- 跨平台模型聚合:阿里百炼在一个月内密集接入 DeepSeek V4、Kimi K3、智谱 GLM-5.3、MiniMax-M3 及小米 mimo-v2.5-pro 等第三方模型;Google Vertex AI Model Garden 上线智谱 GLM 5.2 公开预览。中国头部模型厂商之间的竞合关系在基础设施层进一步深化,平台方通过聚合优质第三方模型来增强自身生态的吸引力。
- API 协议兼容:DeepSeek V4 同时兼容 OpenAI 格式与 Anthropic API 格式(支持 Tool Calls),并快速跟进 OpenAI 的 Responses API;火山方舟的快速入门示例代码也全面切换至 Responses API。这种对主流 API 标准的高度兼容,使得开发者无需重构工具链即可在不同模型间切换,加剧了模型提供商在底层能力上的直接竞争。
4. 多模态生成进入生产级商业化与代际更替
多模态能力从实验性预览转向具备明确 SLA 和计费标准的生产级 API,旧代际模型被快速淘汰以集中算力。
- 视频与语音 GA:Google Gemini Omni Flash(视频生成与编辑)正式 GA,支持视频扩展与首尾帧插值,并公布基于 Token 的付费层定价(视频输出 $17.50/M tokens);Gemini 3.5 Transcribe 及 Live 版本 GA,提供 85+ 语言的实时流式语音转文字。阿里百炼上线 Wan3.0-Video 与 HappyHorse 视频模型系列。
- 图像与 3D 生成:阿里百炼推出强调知识准确性的 Qwen-Image-3.0-Pro;火山方舟新增 3D 生成能力入口与 Doubao Seedream 5.0 pro 图像模型。
- 代际清理:Google 从定价页彻底移除 Veo 3、Imagen 4、Gemini 2.0 Flash 及 Flash-Lite。这种快速清退旧模型的行为,表明厂商正在将算力资源向最新一代多模态架构集中,同时强制用户迁移至新 API。
用户与市场影响
开发者与中小企业
- 成本结构变化:峰谷定价和订阅制为开发者提供了降低成本的路径。对成本敏感且能灵活调度任务的团队,可通过在 DeepSeek 谷时或阿里百炼夜间运行批量任务获得 50% 至 80% 的成本节省。然而,火山方舟 DeepSeek-V4 Flash 价格的大幅上调(输入涨 200%,输出涨 350%)以及 DeepSeek 预告的整体涨价,将直接增加依赖这些模型的高频调用场景的成本,迫使部分用户寻找替代方案或优化 Prompt 缓存命中率。
- 迁移成本降低:DeepSeek 和火山方舟对 Anthropic API 及 Responses API 的原生支持,使得使用 Claude 或 GPT 生态工具的开发者可以无缝切换底层模型,无需修改 SDK 代码或重构 Agent 编排逻辑。
企业级客户与 IT 管理员
- Agent 基础设施成熟:Google Agent Platform 的统一资源定价、AWS Bedrock 的 14 天持久运行时,以及 OpenAI 为 ChatGPT Work 推出的 Admin 管理插件,为企业部署复杂 Agent 提供了从计算资源、长会话管理到权限控制的完整基础设施。这使得 AI Agent 能够真正融入企业的核心业务流程,而非停留在概念验证阶段。
- 安全与合规:OpenAI 公布 Hugging Face 安全事件调查结果,并推出 ChatGPT for Teachers 覆盖 10 万名教育工作者,显示其在扩大企业级和教育市场覆盖时,正将安全透明度与合规性作为核心竞争要素。
市场格局与竞争态势
- 商业化路径分化:OpenAI 在 ChatGPT 中启动广告测试,标志着其消费端产品开始探索流量变现模式;同时公布自研推理芯片 Jalapeño,意图在底层硬件上降低对 NVIDIA 的依赖。这两项举措分别指向收入多元化和成本结构优化。
- 垂直服务商面临压力:Google Gemini Omni Flash(视频)和 3.5 Transcribe(语音)的 GA,凭借 Google 的分发渠道和集成优势,直接冲击 Runway、Pika、Deepgram 等垂直领域的专业 API 服务商。
- 区域基础设施调整:阿里百炼全面移除东京区域的模型部署,将迫使日本及东北亚地区的开发者迁移至新加坡或其他区域,这可能增加网络延迟,并为 AWS 或 Azure 在日本本地的 AI 服务提供市场机会。
证据与不确定性
证据说明
本报告所有事实判断均基于各平台官方 Changelog、定价页面 Diff、API 文档更新及官方 RSS 博客。例如,DeepSeek 的峰谷计费规则与具体价格(Flash 输入 $0.22-0.44/M)直接来源于其官方 API 定价页;Google Agent Platform 的资源计费标准来源于 Google Cloud 官方定价页;阿里百炼移除东京区域及接入第三方模型的事实,通过其模型广场页面的 Diff 对比得到确认。
关键不确定性
- 定价与商业化细节:DeepSeek 预告的“显著涨价”具体幅度与生效时间未明;阿里百炼 Token Plan 的具体订阅档位、Night Plan 的确切时段定义未披露;OpenAI 广告测试的覆盖范围(是否仅限免费用户)、广告形式及对回答独立性的实际影响未知。
- 性能基准与第三方验证:各厂商宣称的 1M 上下文实际召回率(如阿里 Qwen3.8-Flash、智谱 GLM-5.2)缺乏统一的第三方长文本评测数据;DeepSeek V4 的 Thinking Mode 与 GPT/Claude 的独立对比数据未公开;OpenAI Jalapeño 芯片的具体性能指标、量产时间表及是否对外销售均未披露。
- 战略调整原因:阿里百炼移除东京区域的具体原因(合规要求、需求不足或基础设施调整)未说明;OpenAI 终止 Cursor 模型供应合同的具体时间表及 Cursor 的替代方案未披露;火山方舟 DeepSeek-V4 系列大幅涨价是基于上游成本变化还是平台自身策略调整尚未明确。
- API 兼容深度:DeepSeek 对 Anthropic API 和 Responses API 的兼容度(如是否支持 Extended Thinking 或特定的内置工具)尚未在文档中详细说明,实际调用中可能存在功能缺失。
数据来源
- 官方定价与计费页面:Aliyun Model Studio Billing, Google Cloud Agent Platform Pricing, DeepSeek API Pricing, Volcengine Docs Pricing, OpenAI API Pricing, AWS Bedrock Pricing.
- 产品更新日志与文档:Google AI Gemini API Changelog, Aliyun Model Studio Release Notes, Volcengine Product Docs, AWS Machine Learning Blog.
- 官方博客与新闻源:OpenAI News RSS, Google DeepMind Blog RSS, Zhipu AI News, HuggingFace Model API.