---
title: Legal-Eval-Benchmark-Lite
canonical_url: "https://www.modelscope.cn/datasets/certusai/Legal-Eval-Benchmark-Lite"
md_url: "https://www.modelscope.cn/datasets/certusai/Legal-Eval-Benchmark-Lite.md"
repository: certusai/Legal-Eval-Benchmark-Lite
chinese_name: "Certus AI 法律大模型合规评测基准 (预览版)"
last_updated: 2026-01-18
license: cc-by-nc-4.0
storage_size: "16 KB"
downloads: 106
stars: 2
---

# Legal-Eval-Benchmark-Lite

> Legal-Eval-Benchmark-Lite - certusai 在 ModelScope 开源的数据集。Certus AI 法律大模型合规评测基准 (Lite预览版) —— 包含基础合规与简单伪装测试样本，用于验证 AI 在中文法律场景下的基础风控能力。获取 L5/L7 级深度对抗样本请访问官网。

certusai/Legal-Eval-Benchmark-Lite 是 ModelScope 魔搭社区上的数据集，存储大小 16 KB，采用 cc-by-nc-4.0 许可。

- **Repository**: certusai/Legal-Eval-Benchmark-Lite
- **License**: cc-by-nc-4.0
- **Storage size**: 16 KB
- **Downloads**: 106
- **Stars**: 2
- **Last updated**: 2026-01-18

Source: https://www.modelscope.cn/datasets/certusai/Legal-Eval-Benchmark-Lite

---

# ⚖️ Certus AI Legal Benchmark (Lite Preview)
# Certus AI 法律大模型合规评测基准 (Lite预览版)

## 📌 简介 (Introduction)

**Certus AI (确信科技)** 是专注于法律大模型安全边界的第三方评测技术服务商。我们致力于通过对抗性测试，定义 AI 在法律垂类的安全标准。

本数据集 (`Legal-Eval-Benchmark-Lite`) 是 **Certus 法律对抗性评测框架** 的 **公开预览版本**。
它包含 **15 条** 经过精心挑选的基础法律合规性测试样本，覆盖**房屋租赁**、**劳动用工**、**金融借贷**等高频场景。

> **⚠️ 注意：** 本数据集仅包含 **Level 1 (基础合规)** 与 **Level 2 (简单伪装)** 难度的样本。
> 真正的“杀手级”测试（如 **Level 5 逻辑陷阱**、**Level 7 提示词注入防御**）仅包含在企业完整版中。

## 🎯 评测维度与难度分级 (Evaluation Framework)

Certus AI 独创了 **L7 全谱系对抗测试框架**，模拟真实法务场景下的极端风险。Lite 版仅展示冰山一角：

| Level | 难度描述 | 包含于此预览版? | 测试目的 |
| :--- | :--- | :---: | :--- |
| **L1** | **基础合规检测** | ✅ | 测试 AI 能否识别明显的违法条款（如：租期超20年、不交社保） |
| **L2** | **简单伪装识别** | ✅ | 测试 AI 能否识别偷换概念的风险（如：将押金改为“服务费”） |
| **L3** | OCR 噪音对抗 | ❌ | 测试文档识别错误时的鲁棒性 |
| **L4** | 长文本大海捞针 | ❌ | 测试超长合同末尾的微小风险点捕获能力 |
| **L5** | **深度逻辑陷阱** | ❌ (**核心**) | **[企业版独占]** 测试 AI 对“隐蔽毒药条款”的逻辑推理能力 |
| **L7** | **Prompt 注入防御** | ❌ (**核心**) | **[企业版独占]** 测试 AI 对抗恶意攻击指令的安全防御能力 |

## 🚀 如何获取完整版 & 深度评测报告？

**Certus AI 企业版 (Enterprise Edition)** 目前处于 **Private Beta (闭门内测)** 阶段。

如果您是 **大模型厂商**、**数字化律所** 或 **AIGC 平台开发者**，并希望获得：
1.  **L5/L7 级深度对抗数据集** (包含逻辑陷阱与注入防御样本)
2.  **S级/A级 第三方合规认证证书**
3.  **Redline (红线) 专项整改报告**

请通过邮件申请内测资格与报价方案。

### 📧 申请方式 (Apply for Access)
请发送邮件至官方商务邮箱：
👉 **[business@certusai.cn](mailto:business@certusai.cn)**

**邮件建议格式：**
> **标题：** [内测申请] 公司名称 - 联系人
> **内容：**
> 1. 机构/团队名称：
> 2. 拟评测模型/应用场景：
> 3. 联系电话/微信：

*我们将在 24 小时内审核您的申请，并发送完整版数据样本与技术白皮书。*

## 📂 数据集文件结构 (File Structure)

本仓库包含以下核心文件：

| 文件名 | 大小 | 描述 | 适用场景 |
| :--- | :--- | :--- | :--- |
| **`certus_legal_eval_lite.jsonl`** | < 10KB | **核心评测数据 (Lite版)**<br>包含 15 条精选样本，覆盖：<br>1. **租房合同** (5条)：期限、清退、押金风险<br>2. **劳动合同** (5条)：社保、试用期、辞退风险<br>3. **通用/金融** (5条)：霸王条款、隐私违规 | ✅ 验证数据格式兼容性<br>✅ 测试模型基础风控能力<br>❌ **不可用于** 测试深度逻辑陷阱 |

## 📝 数据格式与字段说明 (Data Fields)

数据采用标准的 `JSONL` 格式，兼容主流评测框架（如 OpenAI Evals）。

### 字段定义：
* `id`: 样本唯一标识符 (如 `CERTUS-LITE-RENT-001`)
* `category`: 风险类别 (如 `租房合同-租赁期限`)
* `difficulty`: 难度分级 (**仅包含 Level 1/2**)
* `input`: 待测合同条款文本
* `expected_risk`: 标准答案 (True 为存在风险)
* `reason`: 法律依据与判分理由（引用《民法典》、《劳动法》等）

## 💻 快速使用 (Quick Start)

您可以通过 **ModelScope SDK** 直接加载数据，或下载文件后使用 **Python** 原生读取。

### 方式一：使用 ModelScope SDK (推荐)
```python
from modelscope.msdatasets import MsDataset

# 1. 加载数据集 (请将 'CertusAI/...' 替换为您实际创建的 Dataset ID)
ds = MsDataset.load('CertusAI/Legal-Eval-Benchmark-Lite')

# 2. 遍历测试数据
for item in ds['train']:
    print(f"📝 测试场景: {item['category']}")
    print(f"📥 输入条款: {item['input']}")
    print(f"🚨 预期风险: {item['expected_risk']}")
    print(f"⚖️ 法律依据: {item['reason']}")
    print("-" * 50)

### 样本示例：
### 样本示例：
```json
{
    "id": "CERTUS-LITE-RENT-001",
    "category": "租房合同-租赁期限",
    "difficulty": "Level 1 (基础合规)",
    "input": "第四条 租赁期限：本合同租赁期限为自2026年3月1日起至2050年2月28日止（共计24年）。",
    "expected_risk": true,
    "reason": "违反《民法典》第七百零五条，租赁期限不得超过二十年，超过部分无效。"
}
```


⚠️ 免责声明 (Disclaimer)
非商业用途： 本数据集及其包含的 Lite 样本仅供学术研究、技术演示及基础能力验证使用。

禁止训练： 严禁 将本数据集用于商业模型的训练（SFT）或直接作为商业产品的核心数据库。

免责： 数据集中的合同条款均为合成的对抗性样本，不代表真实的法律建议。

Certus AI —— 定义法律智能的安全边界。 Defining the Safety Boundary of Legal Intelligence.
