DPO (прямая оптимизация предпочтений)
EN · DPO (Direct Preference Optimization)DPO (Direct Preference Optimization) — метод дообучения модели на парах «предпочтительный / нежелательный ответ» без отдельной модели вознаграждения.Определение на английскомA training technique that aligns AI models with human preferences by directly optimizing on preference data (pairs of responses where one is preferred over the other) without requiring a separate reward model. DPO is simpler and more stable than RLHF while achieving similar alignment quality. It's increasingly used to train models that follow instructions accurately, refuse harmful requests, and maintain helpful behavior—all of which directly affect AI agent quality and safety.
Часто задаваемые вопросы
- Чем DPO отличается от RLHF?
- RLHF обучает отдельную модель вознаграждения на данных о предпочтениях, а затем обучением с подкреплением оптимизирует языковую модель под неё — сложный многоэтапный процесс. DPO пропускает модель вознаграждения и напрямую оптимизирует языковую модель на данных о предпочтениях с более простой функцией потерь. Результат — сопоставимое качество выравнивания при меньшей инженерной сложности и более стабильном обучении.