---
title: Yuan-embedding-2.0-zh
canonical_url: "https://www.modelscope.cn/models/IEITYuan/Yuan-embedding-2.0-zh"
md_url: "https://www.modelscope.cn/models/IEITYuan/Yuan-embedding-2.0-zh.md"
repository: IEITYuan/Yuan-embedding-2.0-zh
chinese_name: Yuan-embedding-2.0-zh
last_updated: 2025-11-28
license: apache-2.0
pipeline_tag: sentence-embedding
tasks:
  - sentence-embedding
model_type:
  - bert
architectures:
  - BertModel
parameters: 325.5M
tensor_type:
  - F32
library_name:
  - safetensors
  - pytorch
frameworks:
  - Pytorch
language:
  - zh
downloads: 788
stars: 2
tags:
  - mteb
---

# Yuan-embedding-2.0-zh

> Yuan-embedding-2.0-zh - IEITYuan 在 ModelScope 开源的模型。Yuan-embedding-2.0-zh

IEITYuan/Yuan-embedding-2.0-zh 是 ModelScope 魔搭社区上的 325.5M 参数sentence-embedding模型，采用 apache-2.0 许可。

- **Repository**: IEITYuan/Yuan-embedding-2.0-zh
- **License**: apache-2.0
- **Tasks**: sentence-embedding
- **Parameters**: 325.5M
- **Tags**: mteb
- **Downloads**: 788
- **Stars**: 2
- **Last updated**: 2025-11-28

Source: https://www.modelscope.cn/models/IEITYuan/Yuan-embedding-2.0-zh

---

<h2 align="left">Yuan-embedding-2.0-zh</h2>

Yuan-embedding-2.0-zh 是专门为中文文本检索任务设计的嵌入模型。我们在[Yuan-embedding-1.0](https://huggingface.co/IEITYuan/Yuan-embedding-1.0)的基础上，针对Retrieval任务与Reranking任务进行了进一步优化。主要工作如下：

- 数据增强
  - Hard negative sampling：利用Rerank模型与LLM进行双重评估，筛选出高质量正负样本
  - LLM合成数据：利用[Yuan2-M32](https://huggingface.co/IEITYuan/Yuan2-M32)针对训练数据query进行LLM重写
- 损失函数设计
  - Multi-Task loss
  - Matryoshka Representation Learning
  - Retrieval任务使用InfoNCE with in-batch-negative
  - 针对Reranking任务设计Margin-Adaptive Pairwise Ranking Loss
  

<h2 align="left">Usage</h2>

```bash
pip install -U sentence-transformers==3.4.1
```

使用示例：

```python
from sentence_transformers import SentenceTransformer

model = SentenceTransformer("IEITYuan/Yuan-embedding-2.0-zh")
sentences_1 = ["样例数据-1", "样例数据-2"]
sentences_2 = ["样例数据-3", "样例数据-4"]
embeddings_1 = model.encode(sentences_1, normalize_embeddings=True)
embeddings_2 = model.encode(sentences_2, normalize_embeddings=True)
similarity = embeddings_1 @ embeddings_2.T
print(similarity)
```
