信号图谱
Microsoft Azure AI Foundry常规能力增强2024-12-01

偏好微调(DPO)预览版上线

Preference Fine-Tuning (DPO) Preview Launched

效果提升SDK

EVENT SUMMARY

事件摘要

直接偏好优化(DPO)现已对 gpt-4o-2024-08-06 开放公测,提供比 RLHF 更轻量的对齐技术。

ANALYST VIEW

中立分析

为什么重要

在 Azure OpenAI 中引入 DPO 微调技术,丰富了平台提供的模型定制化工具。提供更轻量的对齐技术降低了模型微调的门槛和计算成本,有助于吸引更多需要进行模型对齐和定制化开发的企业客户。

影响对象

影响在 Azure OpenAI 平台上进行模型微调的开发者、AI 研究人员和企业。用户可以使用计算成本更低的 DPO 技术对特定模型进行偏好对齐,从而更高效地定制符合特定业务需求的模型。

证据说明

原文直接证明 Azure OpenAI 针对「gpt-4o-2024-08-06」模型推出了「DPO」的公测版本,并指出这是一种比「RLHF」计算上更轻量的对齐技术。

不确定性

原文未说明 DPO 微调的具体定价、训练数据格式要求、微调后模型的性能表现、与 RLHF 在实际效果上的具体差异以及正式版的发布时间。

SOURCES

来源