信信号图谱
Microsoft Azure AI Foundry重要能力增强2025-01-01

Azure OpenAI 公开预览直接偏好优化(DPO)微调功能

Azure OpenAI Public Previews Direct Preference Optimization (DPO) Fine-Tuning

效果提升

EVENT SUMMARY

事件摘要

Microsoft Azure AI Foundry 推出直接偏好优化(DPO)微调功能的公开预览,首批支持 gpt-4o-2024-08-06 模型。DPO 是一种基于人类偏好调整模型权重的新型对齐技术,无需训练奖励模型,仅使用更简单的二元偏好数据即可实现模型对齐。相比传统的 RLHF,DPO 提供了更轻量、高效的微调方案,显著降低了企业定制模型风格、语调或内容偏好的技术门槛,使 Azure OpenAI 在模型定制领域与 Anthropic 等平台看齐。预览阶段的定价、区域可用性及正式 GA 时间尚未公布。

ANALYST VIEW

中立分析

为什么重要

DPO 微调能力使 Azure OpenAI 在模型定制对齐领域与 Anthropic 等采用类似技术的平台看齐,降低了企业微调门槛。

影响对象

需要定制模型风格、语调或内容偏好的 Azure OpenAI 企业客户可获得比 RLHF 更轻量高效的微调方案。

证据说明

原文详细说明 DPO 技术原理、与 RLHF 对比优势,并明确公开预览从 gpt-4o-2024-08-06 开始。

不确定性

DPO 微调定价未披露;预览阶段区域可用性和正式 GA 时间未定。

SOURCES

来源