---
title: Uni-DPO
canonical_url: "https://www.modelscope.cn/datasets/pspdada/Uni-DPO"
md_url: "https://www.modelscope.cn/datasets/pspdada/Uni-DPO.md"
repository: pspdada/Uni-DPO
chinese_name: Uni-DPO
last_updated: 2026-02-22
license: "Apache License 2.0"
storage_size: "2.1 GB"
downloads: 2147
stars: 1
---

# Uni-DPO

> Uni-DPO - pspdada 在 ModelScope 开源的数据集。Uni-DPO 提出一种统一的动态偏好优化范式，用于基于偏好数据训练大语言模型。不同于以往将所有偏好样本等同处理的 DPO 方法，Uni-DPO 同时考虑：偏好数据自身质量与模型学习动态，从而实现更有效、更稳健的偏好学习。

pspdada/Uni-DPO 是 ModelScope 魔搭社区上的数据集，存储大小 2.1 GB，采用 Apache License 2.0 许可。

- **Repository**: pspdada/Uni-DPO
- **License**: Apache License 2.0
- **Storage size**: 2.1 GB
- **Downloads**: 2147
- **Stars**: 1
- **Last updated**: 2026-02-22

Source: https://www.modelscope.cn/datasets/pspdada/Uni-DPO

---

# ICLR 2026 | Uni-DPO 数据集卡片: <br> A Unified Paradigm for Dynamic Preference Optimization of LLMs <!-- omit in toc -->

<a href='https://arxiv.org/abs/2506.10054'>
<img src='https://img.shields.io/badge/论文-Arxiv-purple'></a>
<a href='https://huggingface.co/datasets/psp-dada/Uni-DPO'>
<img src='https://img.shields.io/badge/数据集-HF-Green'></a>
<a href='https://huggingface.co/collections/psp-dada/uni-dpo'>
<img src='https://img.shields.io/badge/模型-HF-orange'></a>
<a href='https://huggingface.co/papers/2506.10054'>
<img src='https://img.shields.io/badge/讨论区-HF-blue'></a>
<a href='https://github.com/pspdada/Uni-DPO/blob/main/LICENSE'>
<img src='https://img.shields.io/badge/许可证-Apache_2.0-yellow'></a>

<a href='https://modelscope.cn/datasets/pspdada/Uni-DPO'>
<img src='https://img.shields.io/badge/数据集-🤖ModelScope-pink'></a>
<a href='https://modelscope.cn/collections/pspdada/Uni-DPO'>
<img src='https://img.shields.io/badge/模型-🤖ModelScope-red'></a>

## 摘要

直接偏好优化（Direct Preference Optimization，DPO）因其简洁性和高效性，已成为基于人类反馈的强化学习（RLHF）中的核心方法之一。然而，现有基于 DPO 的方法通常将所有偏好样本对等同对待，忽略了数据质量和学习难度之间的显著差异，从而导致数据利用效率低下和性能次优。

为了解决这一局限性，我们提出了 Uni-DPO，一种统一的动态偏好优化框架，同时考虑：（a）偏好样本对的内在质量，以及（b）模型在训练过程中的性能演化。通过基于这两个因素对样本进行自适应重加权，Uni-DPO 能够更高效地利用偏好数据，并取得更优性能。

在多个模型和基准上的大量实验表明，Uni-DPO 具有良好的有效性和泛化能力。在文本任务上，使用 Uni-DPO 微调的 Gemma-2-9B-IT 在 Arena-Hard 上的成绩比当前领先的大语言模型 Claude 3 Opus 高出 6.7 分。在数学与多模态任务中，Uni-DPO 在多个基准测试中始终优于基线方法，有力证明了其有效性与鲁棒性。

## 🎊 新闻 <!-- omit in toc -->

- [2026.02.16] 📖 代码、数据与模型已发布！
- [2026.01.26] 🎉 我们的 Uni-DPO 被 **ICLR 2026** 接收！

## 🚀 概览 <!-- omit in toc -->

**Uni-DPO** 提出一种统一的动态偏好优化范式，用于基于偏好数据训练大语言模型。不同于以往将所有偏好样本等同处理的 DPO 方法，Uni-DPO 同时考虑：**偏好数据自身质量**与**模型学习动态**，从而实现更有效、更稳健的偏好学习。

**核心优势：**

- **数据质量感知**：自适应地提升高质量样本权重，降低模糊样本影响
- **训练动态感知**：动态地关注模型尚未学会的样本，缓解过拟合
- **统一且轻量**：无缝将双视角动态加权机制和校准 NLL 损失集成到标准 DPO 训练流程，额外开销极小

## 📚 数据集

我们发布 [🤗](https://huggingface.co/datasets/psp-dada/Uni-DPO) [🤖](https://modelscope.cn/datasets/pspdada/Uni-DPO) **Uni-DPO 数据集**，包含三类训练数据：_文本理解_、_数学推理_、_多模态理解_。

### 文本理解

数据集目录下的 [🤗](https://huggingface.co/datasets/psp-dada/Uni-DPO/tree/main/Textual) `Textual` 文件夹包含*文本理解*任务的训练数据，涵盖 v0.1 和 v0.2 两个训练设置。若想要自己生产这些训练数据，可参考此[文档](https://github.com/pspdada/Uni-DPO/blob/main/Textual/on_policy_data_gen/README_zh.md)。

<details>
<summary>生成数据流程</summary>

1. 下载 [🤗](https://huggingface.co/datasets/HuggingFaceH4/ultrafeedback_binarized) `HuggingFaceH4/ultrafeedback_binarized` 数据集；
2. 使用 `decode.py` 生成输出并使用 `post_process.py` 清理；
3. 使用 `reward_model_annotate.py` 进行打分。

</details>

### 数学推理

*数学推理*训练数据位于数据集目录下的 [🤗](https://huggingface.co/datasets/psp-dada/Uni-DPO/tree/main/Math) `Math` 文件夹。若想要自己生产这些训练数据，可参考此[文档](https://github.com/pspdada/Uni-DPO/blob/main/Math/README_zh.md)并使用此[脚本](https://github.com/pspdada/Uni-DPO/blob/main/Math/data_generation/generate_data.sh)。

<details>
<summary>生成数据流程</summary>

1. 下载数学问题数据集 [🤗](https://huggingface.co/datasets/RLHFlow/numia_prompt_dpo1) `RLHFlow/numia_prompt_dpo1`；
2. 运行 `gen_samples.py` 以获得模型输出；
3. 使用规则奖励 `verifiable_reward_labeling.py` 与过程奖励模型 `progress_reward_labeling.py` 打分；
4. 运行 `get_uni_dpo_data.py` 构建偏好对。

</details>

评测数据位于 [🤗](https://huggingface.co/datasets/psp-dada/Uni-DPO/blob/main/Math_eval_data.zip) `Math_eval_data.zip`。评测细节见[文档](https://github.com/pspdada/Uni-DPO/blob/main/Math/README_zh.md)。

### 多模态理解

*多模态理解*的训练数据位于 [🤗](https://huggingface.co/datasets/psp-dada/Uni-DPO/tree/main/Multimodal) `Multimodal` 文件夹。使用方式请参考[文档](https://github.com/pspdada/Uni-DPO/blob/main/Multimodal/README_zh.md)。

### 下载方法

:modelscope-code[]{type="sdk"}

:modelscope-code[]{type="git"}

## 📝 引用

如果我们的模型/代码/数据/论文对您有帮助，请引用我们的论文并为我们点 ⭐️！

```bibtex
@inproceedings{peng2026unidpo,
  title     = {Uni-{DPO}: A Unified Paradigm for Dynamic Preference Optimization of {LLM}s},
  author    = {Shangpin Peng and Weinong Wang and Zhuotao Tian and Senqiao Yang and Xing W and Haotian Xu and Chengquan Zhang and Takashi Isobe and Baotian Hu and Min Zhang},
  booktitle = {The Fourteenth International Conference on Learning Representations},
  year      = {2026},
  url       = {https://openreview.net/forum?id=G7DBGlgjjp}
}
```

## 📧 联系我们 <!-- omit in toc -->

如果您有任何问题、意见或建议，欢迎提交 issue 或 PR，共同推动该方向的研究进展。

## 许可证 <!-- omit in toc -->

[Apache License 2.0](/LICENSE)
