2026年8月最后一周 AI 行业管理层简报
执行摘要
本周(2026-08-24 至 2026-08-30),AI 模型即服务(MaaS)平台的定价策略从单一按量计费向订阅制、时段化及资源化演进。多模态与 Agent 能力向 3D 空间与 GUI 操作延伸。底层基础设施方面,OpenAI 披露自研推理芯片并拓展广告变现,行业在推理成本控制与商业化路径上出现实质性分化。
关键变化
定价与商业模式调整
- 阿里百炼:上线 Token Plan 订阅计划,针对 Qwen3.8-Max 推出“夜间低至 2 折”促销。Qwen3.8-Flash(百万级上下文)与 Qwen-Image-3.0-Pro 同步上线。
- 火山方舟:DeepSeek-V4 系列全面调价。Flash 版本输入涨价 200%、输出涨价 350%;Pro 版本输入降价 25%、缓存命中降价 70%、输出涨价 12.5%。
- Google Vertex AI:推出统一的 Agent 资源定价,按 vCPU、内存和存储计费,空闲时间免计费。
- OpenAI:在 ChatGPT 免费版中测试广告;推出 ChatGPT Business Premium 席位(5 倍使用量、取消 5 小时限制)。
产品能力与生态演进
- Google:Gemini Omni 1.1 Flash(视频生成)、Gemini 3.7 Flash(编码与 Agent)及 3.5 Transcribe(语音转文字)正式 GA。移除 Imagen 4、Veo 3 及 Gemini 2.0 Flash 等旧版模型。
- 火山方舟:新增视觉定位、3D 生成(多边形面片与 PBR 材质)、云部署 MCP 及 GUI Agent 能力入口。
- OpenAI:首次公布自研推理芯片 Jalapeño 测试结果;因 Cursor 被 SpaceX 收购终止向其供应模型的合同;将 Daybreak 网络安全模型上线 AWS Bedrock。
- 阿里百炼:模型广场接入小米 mimo-v2.5-pro、MiniMax-M3、智谱 GLM-5.3 和 Moonshot Kimi-K3。
用户与市场影响
成本结构与开发工具链 火山方舟 DeepSeek-V4 Flash 的大幅涨价将直接增加相关开发者的调用成本,可能促使流量向缓存优化(降价 70%)或其他平台转移。阿里百炼的夜间折扣为非实时推理任务提供了成本优化空间。Google Vertex AI 的 Agent 资源计费模式改变了长时运行 Agent 的成本核算方式。
系统迁移与兼容性压力 Google 移除了多款旧版多模态模型,并设定 Gemini Omni Flash 预览版于 9 月 30 日弃用;阿里百炼移除了东京区域的多模型部署。依赖上述接口和区域的开发者面临短期的代码修改与基础设施迁移需求。
基础设施与垂直市场竞争 OpenAI Jalapeño 芯片的披露使其在 AI 推理硬件层面与 NVIDIA、Google TPU 及 AWS Trainium 产生直接竞争。ChatGPT for Teachers 扩展至 55 个美国学区(覆盖超 10 万教育工作者),加速了 AI 在 K-12 教育场景的渗透。Gemini 原生视频与语音 API 的 GA 对 Runway、Deepgram 等垂直服务商形成替代压力。
证据与不确定性
证据来源 本报告基于各平台官方 Changelog、定价页面历史版本 Diff、产品文档及官方 RSS 提取。火山方舟调价数据源于定价页面 Diff;Google 模型 GA 与弃用时间线源于官方 Changelog;阿里百炼模型接入与区域调整源于模型广场页面记录。
主要不确定性
- 定价与配额细节:阿里百炼 Token Plan 的具体订阅价格档位及“夜间”的具体起止时间未披露;OpenAI 广告测试的投放范围及付费用户豁免机制未明确;火山方舟未说明 DeepSeek-V4 涨价是由于上游成本变化还是平台策略。
- 技术规格与基准:OpenAI Jalapeño 芯片缺乏与 NVIDIA H100/B200 的具体性能对比数据及量产时间表;火山方舟新增的 GUI Agent 和 3D 生成能力未披露底层模型版本、API 格式及精度基准。
- 后续动作:OpenAI 终止 Cursor 合同的具体过渡安排未知;阿里百炼移除东京区域部署的具体原因及替代方案未说明。