2
里程碑
6
重要更新
1
常规动态
Moonshot V1 经典生成模型系列预计 8 月 31 日全平台下线
Kimi Platform 定价页面明确公告 Moonshot V1 经典生成模型系列将于 8 月 31 日全平台下线,标志着该厂商正式淘汰旧一代模型家族,全面转向 K2/K3 新架构。
Kimi 开放平台提供开发工作台(Playground)
Kimi 开放平台提供开发工作台,无需写代码即可快速测试提示词、模型效果和业务样例。
MoonshotAI 在 HuggingFace 发布 Kimi-K3 多模态模型
MoonshotAI 于 2026 年 6 月 13 日在 HuggingFace 平台上发布了 Kimi-K3 模型。该模型任务类型为 image-text-to-text,具备多模态(图像与文本输入,文本输出)能力。此次发布标志着 Kimi 系列模型在开源或公开平台上的进一步扩展,从 K2 系列跨越到 K3,标志着 MoonshotAI 模型代际升级。多模态能力使其直接对标 GPT-4o、Claude 3.5 等多模态旗舰模型,可能改变国内大模型竞争格局。为开发者提供图像理解和图文对话等场景的支持。具体参数规模、架构细节、性能基准、API 定价及训练数据截止日期尚未披露。
Kimi 发布 K3/K2.7 Code/K2.6 模型并全面升级 API 能力
Moonshot 于 2026-08-12 一次性发布三款新模型及全面 API 升级。旗舰模型 K3 拥有 2.8 万亿参数、支持 1M token 上下文与视觉理解,面向 Coding Agent 和深度推理场景;K2.7 Code 面向代码场景并提供高速变体;K2.6 为通用基座模型,支持 256K 上下文。API 层面新增思考模式(Thinking Mode)及 reasoning_effort 参数(low/high/max)控制推理强度,支持多模态输入(图片与视频)、工具调用(Function Calling)、JSON Mode、流式输出,并完全兼容 OpenAI API 格式,开发者可直接使用 OpenAI 官方 Python/Node.js SDK 调用。
MoonshotAI 发布 Kimi-K2.5 多模态模型
MoonshotAI 于 2026 年元旦发布 Kimi-K2.5,这是 K2 系列从纯文本推理向多模态过渡的标志。该模型支持图像与文本输入,使 Kimi 平台用户首次获得 K2 系列的多模态能力,扩展了模型在视觉理解与图文交互场景中的应用边界。
MoonshotAI 发布 Kimi-K2-Thinking 推理模型
MoonshotAI 发布 Kimi-K2-Thinking,这是 K2 系列首个具备思维链与复杂推理能力的纯文本模型。该模型对标 OpenAI o1 和 DeepSeek-R1,标志着 MoonshotAI 正式进入推理模型赛道,适用于数学、逻辑等高复杂度任务,为开发者和企业用户提供专用推理能力。
MoonshotAI 发布 Kimi-Linear-48B-A3B 系列模型
MoonshotAI 推出 Kimi-Linear-48B-A3B 系列,包含 Instruct 和 Base 两个版本。其命名暗示可能采用 MoE 架构(48B 总参/3B 激活)或线性注意力机制,旨在提供高性价比、低延迟的推理方案,对中小型企业部署友好。Base 版本可用于微调,Instruct 版本可直接用于推理。
MoonshotAI 发布 Kimi-K2-Instruct-0905 模型
MoonshotAI 发布 Kimi-K2-Instruct-0905 文本生成模型,这是 K2 系列中较早的指令微调版本。该模型的发布表明 MoonshotAI 在 2025 年 9 月已启动 K2 系列的研发与发布工作,先于后续的 K2-Thinking 模型,为 K2 系列的演进奠定了基础。
Moonshot AI 发布 Moonlight 模型及 Muon 优化器全套开源方案
2025年3月3日,Moonshot AI(月之暗面)同步发布了 Moonlight 系列模型及配套 Muon 优化器的完整开源方案。核心产品 Moonlight 是基于 Muon 优化器训练的 16B 总参数/3B 激活参数 MoE 模型,训练数据量达 5.7T tokens,采用与 DeepSeek-V3 相同的架构,兼容 VLLM 和 SGLang 等主流推理引擎,同时提供预训练版本(Moonlight)和指令微调版本(Moonlight-Instruct),上下文长度均为 8K。技术层面,团队公开了两项关键可扩展性改进:引入权重衰减和精确调整参数级更新比例以保持 RMS 一致性,使 Muon 可直接用于大规模训练而无需额外超参数调优,声称相比 AdamW 仅需约 52% 计算量即可达到同等性能。工程层面,开源了基于 ZeRO-1 风格的分布式 Muon 实现,在保持算法数学特性的同时实现最优内存效率和更低通信开销。此外,还罕见地发布了 Moonlight 和 Moonlight-A(AdamW 对照版本)的中间检查点,供研究者分析不同优化器在训练过程中的动态差异(如 SVD Entropy 和 Srank 指标变化)。完整技术报告已上传 arXiv(2502.16982),代码开源于 GitHub。