---
title: Agent_Experience_Data
canonical_url: "https://www.modelscope.cn/datasets/zhenwenxing/Agent_Experience_Data"
md_url: "https://www.modelscope.cn/datasets/zhenwenxing/Agent_Experience_Data.md"
repository: zhenwenxing/Agent_Experience_Data
chinese_name: "智能体经验数据"
last_updated: 2026-08-23
license: "Apache License 2.0"
downloads: 79
stars: 1
---

# Agent_Experience_Data

> Agent_Experience_Data - zhenwenxing 在 ModelScope 开源的数据集。传统的语言模型数据通常关注：Input ➡ Outpu 例如：Question ➡ Answer。但智能体在完成真实任务时，可能需要：理解任务 ➡ 分析问题 ➡ 制定计划 ➡ 调用工具 ➡ 观察环境反馈 ➡ 判断执行结果 ➡发现错误 ➡调整策略 ➡ 重新尝试 ➡ 总结经验 ➡ 评价任务完成情况 ➡ 最终交付结果。Agent Experience Data…

zhenwenxing/Agent_Experience_Data 是 ModelScope 魔搭社区上的数据集，采用 Apache License 2.0 许可。

- **Repository**: zhenwenxing/Agent_Experience_Data
- **License**: Apache License 2.0
- **Downloads**: 79
- **Stars**: 1
- **Last updated**: 2026-08-23

Source: https://www.modelscope.cn/datasets/zhenwenxing/Agent_Experience_Data

---

#### 下载方法 
:modelscope-code[]{type="sdk"}
:modelscope-code[]{type="git"}

# Agent Experience

**从任务、推理、工具调用到反思与记忆**

---

## 1. 什么是 Experience?

传统的语言模型数据通常关注输入与输出：

```text
Input → Output
```

Agent 在真实任务中的行为则更加复杂，一个 Agent 可能需要理解任务、制定计划、调用工具、观察环境变化、发现错误、调整策略、重新执行并最终验证任务是否完成。因此，仅保存最终答案会丢失大量有价值的执行信息。

**Agent Experience** 关注的是：

> Agent 在特定任务和环境中，如何理解问题、制定计划、采取行动、获得反馈、调整策略，并最终完成任务。

原始 Agent Runtime 通常产生的是执行轨迹（Trajectory），Experience 在此基础上进一步对执行过程进行结构化和语义化：

```text
Raw Trajectory
      ↓
Semantic Structuring
      ↓
Agent Experience
```

---

## 2. 为什么不仅保存 Question / Answer？

考虑以下两个 Agent。

Agent A：

```text
Question
↓
大量无效操作
↓
错误
↓
重复尝试
↓
偶然得到正确结果
```

Agent B：

```text
Question
↓
正确理解任务
↓
制定计划
↓
选择合适工具
↓
执行
↓
验证
↓
Answer
```

如果只保存 Question 和 Answer，两条数据可能看起来几乎相同，如果保存 Experience，则可以进一步研究：

- Agent 如何解决问题
- Tool Use 是否合理
- Observation 如何影响下一步决策
- Agent 如何从错误中恢复
- Reflection 是否有效
- 最终结果是否经过验证
- 哪些经验值得形成 Memory

这也是Experience 保存执行过程而不仅仅保存最终答案的主要原因。

---

## 3. 从轨迹到经验

Agent Runtime 通常能够记录执行轨迹。例如：

```text
User Request
↓
Browser Open
↓
Snapshot
↓
Click
↓
Observation
↓
Type
↓
Observation
↓
Submit
↓
Final Answer
```

这些 Trajectory 非常重要，因为它们记录了 Agent 实际执行过的行为。但原始 Trajectory 更接近：**发生了什么?** 也就是 Runtime Log。Experience 希望进一步表达：**这次执行意味着什么?** 例如：

```text
browser.open
```

可能表示 Agent 正在进入任务环境。

```text
browser.snapshot
```

可能表示 Agent 正在获取当前页面状态。一次：

```text
browser.click
```

可能是计划中的正常操作，也可能是一次错误尝试。而随后出现的：

```text
Observation
↓
Reflection
↓
Retry
```

Experience不只是保存日志，而是尝试表达agent完成任务过程中形成的执行经验。

## 4. Experience 与训练数据

Agent Experience 本身并不等同于某一种模型训练格式，Experience 首先保存 Agent 完成任务的执行经验：

```text
Agent Experience
        │
        ├── SFT Dataset
        ├── Tool-Use Dataset
        ├── Reasoning Dataset
        ├── Preference Dataset
        ├── Reward / RL Dataset
        └── Agent Evaluation Dataset
```

例如：

### Tool-Use Training

可以重点提取：

```text
Context
↓
Action
↓
Observation
```

### Error-Recovery Training

可以重点提取：

```text
Failed Action
↓
Error Observation
↓
Reflection
↓
Retry
↓
Successful Action
```

不同训练目标可以从同一份 Experience 中提取不同的数据表示，可以认为：

> **Experience 为上游数据资产，Training Dataset 视为针对具体训练目标生成的下游表示。**

---

## 5. Schema 示例

简化的 Experience 可以表示为：

```json
{
  "schema_version": "experience-v1.0",

  "sample_id": "browser-exp-000001",

  "question": {},

  "thinking": {},

  "plan": {},

  "tool_use": [],

  "observation": [],

  "reflection": {},

  "retry": {},

  "memory_update": {},

  "self_evaluation": {},

  "answer": {},

  "raw_trajectory": {}
}
```

并不是必须包含所有字段，简单的Experience 可能只有：

```text
Question
↓
Open
↓
Snapshot
↓
Observation
↓
Answer
```

复杂的 Experience 则可能包含多个循环：

```text
Action
↓
Observation
↓
Reflection
↓
Retry
```

---

## 6. 加载数据

```python
import json

with open("xxx-xxx.jsonl", "r", encoding="utf-8") as f:
    for line in f:
        experience = json.loads(line)

        print(experience["question"])
        print(experience["thinking"])
        print(experience["tool_use"])
        print(experience["observation"])
        print(experience["reflection"])
        print(experience["answer"])
```

---

## 7. 生成环境

- **任务环境**：受控 Browser / Web / Workspace / ......
- **任务类型**：
  - Filesystem
  - Browser
  - Code
  - ......

- **Agent 行为**：
  - Thinking
  - Planning
  - Observation
  - ......

- **工具调用**：相关工具
  
- **难度分级**：自定义
  
- **生成模型**：基于 MiniMax-M3
