阿里百炼(DashScope)重要能力增强2026-09-11
阿里百炼训练功能支持 SFT、CPT 和 DPO 微调
效果提升
EVENT SUMMARY
事件摘要
百炼训练平台扩展支持 SFT(监督微调)、CPT(继续预训练)和 DPO(直接偏好优化)三种主流训练范式,并配有代码示例和指标展示。DPO 的加入表明平台支持偏好对齐/RLHF 类训练,提升了在企业级模型定制场景中的竞争力。
ANALYST VIEW
中立分析
为什么重要
百炼训练平台覆盖三种主流训练范式,DPO 的加入表明支持偏好对齐,提升了平台在企业级模型定制场景中的竞争力。
影响对象
面向需要定制模型的企业和开发者,提供从监督微调到偏好对齐的完整训练工具链。
证据说明
控制台训练页面明确展示了 SFT、CPT、DPO 三个训练选项卡及各自的代码和指标。
不确定性
DPO 是否需要参考模型由平台自动管理还是用户自行提供、各训练方式的 GPU 资源和价格未披露。
SOURCES