2026-09-06 周报 AI 行业竞争情报
执行摘要
本周 AI 行业竞争情报聚焦于代理(Agent)基础设施的商业化细分、前沿模型在网络安全领域的垂直化突破,以及 API 定价策略的分层与分时演进。OpenAI 发布旗舰模型 GPT-6 Astra,其输出定价达到 $50/1M tokens,并宣布 10 亿美元的 Daybreak 网络安全计划,同时正式关闭 Assistants API。Google 推进 Gemini 3.8 Flash 的正式发布,并为 Gemini Enterprise Agent Platform 的多个核心组件(如 Memory Bank、Sessions、Skill Registry)确立独立计费标准。中国市场方面,阿里百炼通过 Night Plan 和 Token Plan 调整 Qwen3.8 系列的定价策略,Kimi 发布 2.8 万亿参数的 K3 模型并兼容 OpenAI 与 Anthropic 双 API 格式,火山方舟则上调 DeepSeek-V4 系列价格并上线 GUI Agent 能力。
关键事件
OpenAI 发布 GPT-6 Astra 并重构代理 API 范式 OpenAI 正式发布 GPT-6 Astra,定位为支持推理、编码、计算机使用和文档创建的端到端模型。Standard 模式下输出定价为 $50.00/1M tokens,是前代旗舰的 2.5 倍。该模型在 Preparedness Framework 下达到网络安全 Critical 级别。配套发布的 Responses API 新增异步工具调用、WebSocket 中途引导(mid-turn steering)和动态推理力度调整功能。同时,OpenAI 正式关闭 Assistants API,要求用户迁移至 Responses API 和 Conversations API,并宣布弃用 Whisper-1 及 GPT-4o 转录系列模型。
Google 推进 Gemini 3.8 Flash 及 Agent Platform 组件全面计费 Google 发布 Gemini 3.8 Flash 正式版(GA),主打长周期软件工程与自主代理场景,2026 年底前输入定价 $0.75/1M tokens,并新增 Priority 高优先级付费层级。Gemini Enterprise Agent Platform 确立了统一的三资源定价结构(Compute/Memory/Storage),并对 Sessions(对话历史)、Memory Bank(长期记忆)、Skill Registry(技能注册表)、Semantic Governance Policy(语义治理)和 Agent Gateway 等组件公布独立计费标准,多数于 2026 年 9 月生效。此外,Gemini 2.0 Flash 和 Flash-Lite 被正式停用。
阿里百炼更新 Qwen3.8 系列并调整定价策略 阿里百炼上线 Qwen3.8-Flash(支持百万级上下文)和 Qwen3.8-Max 0902 快照版本。在定价方面,百炼推出 Token Plan 个人版并下调团队版价格,同时 Night Plan 夜间折扣从 5 折降至 4 折(22:00 后生效),覆盖 Qwen3.8-Max 和 Flash 模型。此外,平台上线 Qwen3-TTS-Flash 离线语音合成模型和 Qwen-Image-3.0-Pro 图像生成模型。
Kimi 发布 K3 旗舰模型并兼容双 API 格式 Moonshot 发布 Kimi K3 模型,拥有 2.8 万亿参数和 1M token 上下文窗口,支持视觉理解,成为平台默认推荐模型。Kimi API 新增 Responses API 端点(兼容 OpenAI 格式),并新增 Anthropic API 兼容格式及 Messages API 端点,支持通过 Anthropic SDK 和 Claude Code 等工具直接接入。
火山方舟上调 DeepSeek-V4 价格并扩展 Agent 能力 火山方舟对 DeepSeek-V4 系列(pro/flash 预览版和正式版)全面上调价格,flash 正式版输入价格从 1 元涨至 3 元/百万 token。产品简介页新增 GUI Agent 能力入口、上下文缓存、批量推理和云部署 MCP(Model Context Protocol)能力,并展示 Doubao Seedance 2.5、Seed Evolving 和 Seedream 5.0 pro 三款新模型。
主要趋势
AI 代理(Agent)基础设施的模块化与独立计费 Agent 系统的构建正从单一的模型 API 调用转向复杂的分布式工程,云厂商开始对 Agent 的运行时、状态管理和工具调用进行精细化计费。Google Agent Platform 将 Compute、Memory、Storage 作为基础资源计费,并将 Sessions、Memory Bank、Skill Registry、Agent Gateway 和 Semantic Governance Policy 作为独立 SKU 收费。OpenAI 则在 Responses API 中引入异步工具调用和 mid-turn steering,将代理交互从“请求-等待-响应”推向实时流式控制。火山方舟上线 GUI Agent 和云部署 MCP,进一步扩展了 Agent 与外部环境交互的标准化接口。这一趋势表明,Agent 平台的竞争焦点已从单纯的模型能力延伸至底层状态管理、工具编排和运行时环境的商业化设计。
前沿模型向垂直专业化与网络安全领域深度渗透 网络安全成为前沿模型能力突破和商业化落地的关键垂直领域。OpenAI 宣布 GPT-6 Astra 是首个在预备框架下达到网络安全 Critical 级别的模型,并投入 10 亿美元启动 Daybreak 计划,推出专用的 GPT-5.6-Cyber 模型,同时将其上线 AWS Bedrock 并开放给授权合作伙伴。Google DeepMind 也发布了面向网络安全的 Gemini 3.8 Flash Cyber 变体及主动网络防御方案。这反映出随着模型能力逼近或超越人类专家水平,厂商正通过垂直专业化模型和受控分发渠道来平衡高风险能力的商业化与安全合规要求。
API 定价策略的分层化与分时化 为优化算力分配并最大化收益,平台正通过时间、SLA 和用量分层来重构 API 定价体系。阿里百炼通过 Night Plan 将夜间(22:00 后)推理价格降至 4 折,并推出 Token Plan 订阅制以锁定高频用户。Google 为 Gemini 3.8 Flash 引入 Priority 高优先级层级,与 Standard、Batch、Flex 形成基于延迟和吞吐保障的 SLA 分级定价。OpenAI 则在 ChatGPT Business 中推出 Premium 席位,提供 5 倍用量并取消 5 小时限制。这种多维度的定价策略表明,API 市场正从单一的按量计费向基于服务质量(QoS)、时间窗口和订阅承诺的复杂收益管理模式演进。
用户与市场影响
开发者面临 API 代际更替的迁移成本 OpenAI 正式关闭 Assistants API 并弃用 Whisper-1 及 GPT-4o 转录系列,Google 停用 Gemini 2.0 Flash 和 Flash-Lite(包括 Provisioned Throughput)。依赖这些旧版 API 和模型的开发者必须在有限的过渡期内重构工具调用流程、迁移会话状态管理逻辑或更换底层模型,短期内将产生显著的工程迁移成本。
Agent 开发者获得更细粒度的控制与成本结构 Google Agent Platform 的组件独立计费为构建有状态、长周期运行的 Agent 提供了明确的成本预算模型,开发者可按需组合 Memory Bank 和 Sessions 而无需为捆绑的冗余算力付费。OpenAI Responses API 的异步工具调用和 mid-turn steering 允许开发者在长时任务中实现人工干预和并发处理,提升了复杂 Agent 工作流的吞吐效率和容错率。
企业安全团队获得专用的 AI 防御工具 OpenAI 的 Daybreak 计划和 GPT-5.6-Cyber 模型,以及 Google 的 3.8 Flash Cyber,为政府机构、关键基础设施运营者和企业安全团队提供了专门针对漏洞研究、威胁分析和主动防御的 AI 工具。通过授权合作伙伴分发,这些能力将加速 AI 在企业安全运营中心(SOC)的集成。
证据与不确定性
证据说明
- OpenAI GPT-6 Astra 的发布、定价($50/1M tokens)、Responses API 新功能及 Assistants API 关闭均来自其官方 Changelog 和定价页面。
- Google Agent Platform 的组件定价、Gemini 3.8 Flash GA 及 Gemini 2.0 Flash 停用信息直接来源于 Google Cloud 官方发布说明和定价表。
- 阿里百炼的 Qwen3.8 系列更新、Night Plan 4 折及 Token Plan 调整基于其官方帮助中心的发布记录和计费页面。
- Kimi K3 的参数规模(2.8T)、上下文窗口(1M)及双 API 兼容格式来自 Moonshot 官方开发者文档。
- 火山方舟 DeepSeek-V4 涨价及 GUI Agent、MCP 等新能力入口基于其官方产品简介页和定价文档。
不确定性
- GPT-6 Astra 的技术细节:官方未披露该模型的架构、参数量、训练数据截止日期,以及 Computer Use 的具体实现方式(本地或云端浏览器)。其 misalignment monitoring 的检测机制和误报率也未说明。
- Google Agent 组件的 SLA 与区域限制:Gemini 3.8 Flash Priority 层级的具体延迟保证和吞吐量上限未披露;Agent Platform 新增的 N4/A4 实例及 H200 GPU 在哪些区域可用尚未完全明确。
- 火山方舟 DeepSeek-V4 涨价原因:官方未说明此次价格大幅上调(flash 输入涨幅达 3 倍)是由于底层算力成本变化、DeepSeek 官方调价,还是平台自身的策略调整。
- Kimi API 兼容度:虽然 Kimi 宣布兼容 Anthropic Messages API,但具体的参数映射细节及是否完全支持所有 Anthropic 原生特性(如复杂的工具调用结构)尚未明确。
数据来源
- OpenAI Platform 官方 Changelog、定价页面及新闻 RSS (developers.openai.com, openai.com)
- Google Cloud Gemini Enterprise Agent Platform 发布说明及定价页面 (cloud.google.com, docs.cloud.google.com)
- Google DeepMind 官方博客 RSS (deepmind.google)
- Google Gemini API 官方 Changelog 及定价页面 (ai.google.dev)
- 阿里百炼(DashScope)官方帮助中心发布记录及计费页面 (help.aliyun.com)
- Kimi Platform(Moonshot)官方开发者文档 (platform.moonshot.cn)
- 火山方舟官方产品简介页及定价文档 (volcengine.com)
- 智谱 BigModel Hugging Face 模型卡 (huggingface.co)