信号图谱
阿里百炼(DashScope)重要能力增强2026-09-11

阿里百炼训练功能支持 SFT、CPT 和 DPO 微调

效果提升

EVENT SUMMARY

事件摘要

百炼训练平台扩展支持 SFT(监督微调)、CPT(继续预训练)和 DPO(直接偏好优化)三种主流训练范式,并配有代码示例和指标展示。DPO 的加入表明平台支持偏好对齐/RLHF 类训练,提升了在企业级模型定制场景中的竞争力。

ANALYST VIEW

中立分析

为什么重要

百炼训练平台覆盖三种主流训练范式,DPO 的加入表明支持偏好对齐,提升了平台在企业级模型定制场景中的竞争力。

影响对象

面向需要定制模型的企业和开发者,提供从监督微调到偏好对齐的完整训练工具链。

证据说明

控制台训练页面明确展示了 SFT、CPT、DPO 三个训练选项卡及各自的代码和指标。

不确定性

DPO 是否需要参考模型由平台自动管理还是用户自行提供、各训练方式的 GPU 资源和价格未披露。

SOURCES

来源