---
title: AgenticArXiv-RL-Qwen2.5-1.5B-SFT
canonical_url: "https://www.modelscope.cn/models/Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-SFT"
md_url: "https://www.modelscope.cn/models/Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-SFT.md"
repository: Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-SFT
last_updated: 2026-09-22
license: mit
pipeline_tag: text-generation
tasks:
  - text-generation
model_type:
  - qwen2
architectures:
  - Qwen2ForCausalLM
base_model:
  - Qwen/Qwen2.5-1.5B-Instruct
base_model_relation: finetune
parameters: 1.5B
tensor_type:
  - F32
library_name:
  - transformer
  - safetensors
downloads: 6
stars: 0
tags:
  - agent
  - reinforcement-learning
  - tool-use
  - react
  - arxiv
---

# AgenticArXiv-RL-Qwen2.5-1.5B-SFT

> AgenticArXiv-RL-Qwen2.5-1.5B-SFT - Algorineko 在 ModelScope 开源的模型。AgenticArXiv-RL-Qwen2.5-1.5B-SFT

Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-SFT 是 ModelScope 魔搭社区上的 1.5B 参数text-generation模型，采用 mit 许可，基于 Qwen/Qwen2.5-1.5B-Instruct 构建。

- **Repository**: Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-SFT
- **License**: mit
- **Tasks**: text-generation
- **Parameters**: 1.5B
- **Base model**: Qwen/Qwen2.5-1.5B-Instruct
- **Tags**: agent, reinforcement-learning, tool-use, react, arxiv
- **Downloads**: 6
- **Stars**: 0
- **Last updated**: 2026-09-22

Source: https://www.modelscope.cn/models/Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-SFT

---

# AgenticArXiv-RL-Qwen2.5-1.5B-SFT

[AgenticArXiv-RL](https://github.com/Algorineko/AgenticArXiv-RL) 训练环境的**阶段 1 SFT 产物**：
把 Qwen2.5-1.5B-Instruct 微调成一个会用 9 个 arXiv 工具的 ReAct 策略。

## 这是什么

策略在每一步输出 `Thought + Action`，`Action` 是严格 JSON 的工具调用：

```json
{"name": "get_recently_submitted_cs_papers", "args": {"aspect": "AI", "days": 7, "max_results": 5}}
```

可用工具（动作空间）：

| 工具 | 作用 |
|---|---|
| `get_recently_submitted_cs_papers` | 按子领域 + 时间窗浏览 arXiv |
| `search_arxiv_papers` | 按关键词 / 篇名 / 作者检索 |
| `download_arxiv_pdf` | 下载 PDF |
| `translate_arxiv_pdf` | 整篇翻译 |
| `get_paper_cache_status` | 查询缓存状态 |
| `get_paper_content` | 读取摘要或 method/result/conclusion 章节 |
| `summarize_paper` | 生成摘要（tldr / structured / bullet） |
| `extract_paper_figures` | 抽出内嵌图表与 caption |
| `analyze_figure` | 对某张图表提问（describe / axes / trend） |

任务完成后输出 `FINISH`。

## 训练

| 项 | 值 |
|---|---|
| 基座 | `Qwen/Qwen2.5-1.5B-Instruct` |
| 方法 | 全参监督微调（非 LoRA / 非 QLoRA） |
| 数据 | `data/sft/sft_v5_parametric_linguistic.jsonl`，**2628 条**参数化专家轨迹（覆盖 11 个任务类目、81 条基准任务） |
| 数据 sha256 | `66079e9015780f8e1a76837999df8f9a37b77d5a284e587affb22d84d0dfc793` |
| epoch | 2 |
| 有效 batch | 8 |
| 学习率 | 1e-4 |
| max_length | 2560 |
| 训练 loss | 0.0787 |
| 训练框架 | trl 0.29.1 / transformers 4.57.3 |

完整超参见 `training_manifest.json`。

## 怎么用

单独加载（模型只会输出动作，工具由你执行）：

```python
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-SFT"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id)

prompt = "检索最近7天人工智能(cs.AI)论文5篇"
messages = [{"role": "system", "content": "你是 arXiv 论文检索 Agent，用 JSON 工具调用回答。"},
            {"role": "user", "content": prompt}]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer(text, return_tensors="pt")
out = model.generate(**inputs, max_new_tokens=128, do_sample=False)
print(tokenizer.decode(out[0][inputs["input_ids"].shape[-1]:], skip_special_tokens=True))
```

放进完整环境（离线快照回放 + 可验证奖励）请按
[AgenticArXiv-RL](https://github.com/Algorineko/AgenticArXiv-RL) 的 README 操作：

```bash
python -m AgenticArxiv.rl.train_grpo --model <本模型路径> --no-qlora
```

## 已知边界

- **只是阶段 1**。这条链路的后续是 DPO → GRPO（或 OPD 教师蒸馏），本仓库只发布了 SFT 产物。
- **`analyze_figure` 没有训练覆盖**：参数化 SFT 数据生成器当时还没有该工具的派生规则，模型没学过它。其余 8 个工具都有覆盖。
- **动作空间是收窄的**：`summarize_paper` 的 `style`、`analyze_figure` 的 `question` 都是小枚举，`max_words` 会被向上归到档位。这是为了让离线快照的键空间有限、回放可复现，对小模型也更好学。
- 数据由规则化专家轨迹生成（非人工标注），任务描述是中文。

## License

MIT，与原项目一致。
