---
title: AgenticArXiv-RL-Qwen2.5-1.5B-GRPO
canonical_url: "https://www.modelscope.cn/models/Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-GRPO"
md_url: "https://www.modelscope.cn/models/Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-GRPO.md"
repository: Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-GRPO
last_updated: 2026-09-25
license: mit
pipeline_tag: text-generation
tasks:
  - text-generation
model_type:
  - qwen2
architectures:
  - Qwen2ForCausalLM
base_model:
  - Qwen/Qwen2.5-1.5B-Instruct
base_model_relation: finetune
parameters: 1.5B
tensor_type:
  - F32
library_name:
  - transformer
  - safetensors
downloads: 6
stars: 0
tags:
  - agent
  - reinforcement-learning
  - tool-use
  - react
  - arxiv
  - grpo
---

# AgenticArXiv-RL-Qwen2.5-1.5B-GRPO

> AgenticArXiv-RL-Qwen2.5-1.5B-GRPO - Algorineko 在 ModelScope 开源的模型。AgenticArXiv-RL-Qwen2.5-1.5B-GRPO

Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-GRPO 是 ModelScope 魔搭社区上的 1.5B 参数text-generation模型，采用 mit 许可，基于 Qwen/Qwen2.5-1.5B-Instruct 构建。

- **Repository**: Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-GRPO
- **License**: mit
- **Tasks**: text-generation
- **Parameters**: 1.5B
- **Base model**: Qwen/Qwen2.5-1.5B-Instruct
- **Tags**: agent, reinforcement-learning, tool-use, react, arxiv, grpo
- **Downloads**: 6
- **Stars**: 0
- **Last updated**: 2026-09-25

Source: https://www.modelscope.cn/models/Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-GRPO

---

# AgenticArXiv-RL-Qwen2.5-1.5B-GRPO

**中文** · [English](#english)

## 中文

[AgenticArXiv-RL](https://github.com/Algorineko/AgenticArXiv-RL) 阶段 3（GRPO）的发布权重：在阶段 1 SFT 模型上用**可验证奖励（verifiable reward）**做在线 GRPO 训练，让 1.5B 的 arXiv ReAct Agent 学会按任务要求真正把工具链执行完整。

- **基座**：[AgenticArXiv-RL-Qwen2.5-1.5B-SFT](https://www.modelscope.cn/models/Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-SFT)（Qwen2.5-1.5B-Instruct 全参 SFT）
- **训练任务**：冻结策略探测（lr=0，每任务 8 组 × 4 条生成）从 v3_81 训练集 51 条任务中选出 33 条「组内奖励有方差」的信号任务（`data/splits/v6_grpo_train.json`）；全程离线快照回放，不请求 arXiv
- **配方**：GRPO，`num_generations=4`、`beta=0.1`、`lr=5e-6`、`batch_size=16`（每步 4 个 prompt）、`max_turns=6`、无奖励课程（项目 P1 对照结论：SFT 起点用 `--reward_curriculum_steps 0`）、seed 42、60 步
- **奖励**：项目五分量可验证奖励（格式 / 工具 / 参数 / 过程 / 结果），工具执行走离线快照回放
- **阶段验证**：通过（canary 平均奖励 0.295，阈值 -0.2；SFT 起点同口径 0.107）

### 离线评测（seed 45 / repeat 3 / 离线快照回放 / regex agent）

严格成功率（pass^3）：

| 切分 | 样本 | SFT | GRPO | 说明 |
|---|---|---|---|---|
| rl_train（训练任务诊断） | 99 | 0.081 | **0.636** | 33 条信号任务 |
| dev | 24 | 0.000 | **0.375** | 8 条留出 |
| iid_test | 54 | 0.056 | **0.444** | 同模板换参数 |
| ood_test | 12 | 0.000 | **0.500** | 留出模板（全部 multi_*） |

工具调用准确率：rl_train 0.111 → 0.848；iid_test 0.056 → 0.500；ood_test 0.000 → 0.583。虚假完成率（false_finish）从 0.89–1.00 降到 0.15–0.50。

GRPO 产物的生成更长、迭代更多——它在真正执行完整工具链而不是提前收尾，token 用量相应上升（rl_train 4512 → 6462）。

### 用法

```python
from transformers import AutoModelForCausalLM, AutoTokenizer
tok = AutoTokenizer.from_pretrained("Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-GRPO")
model = AutoModelForCausalLM.from_pretrained("Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-GRPO")
```

推荐在项目环境里使用（带工具与离线快照，评测口径一致）：

```bash
python -m AgenticArxiv.benchmark.run_benchmark \
  --backend transformers --model <本模型路径> \
  --agents regex --repeat 3 --seed 45 \
  --offline --task-set expanded --split data/splits/v3_81.json:iid_test
```

复现代价：单卡约 35 分钟训练（60 步，峰值 34.8 GB 显存）；前置冻结探测（51 任务 × 8 组）约 1 小时。

### 限制

- 训练与评测都走**离线快照回放**，不代表连接真实 arXiv 的在线表现
- 训练集是 33 条信号带任务子集（按组内奖励方差筛选），覆盖范围以项目任务模板为准
- dev / ood 样本量小（24 / 12 条），数字置信区间宽
- 一次更激进的配方（lr 1e-5、beta 0.04、每步 1 个 prompt、240 步）实测策略塌缩（组内方差归零、奖励跌回失败地板）；本权重来自更稳的档位，细节见 `data/splits/v6_grpo_train.json` 的 `formal_run`
- 基座为 Qwen2.5-1.5B-Instruct（Apache-2.0），能力上限继承自该基座；本项目以 MIT 许可发布，在 [AgenticArXiv](https://github.com/Algorineko/AgenticArXiv) 基础上改造

## English

Stage-3 (GRPO) release of [AgenticArXiv-RL](https://github.com/Algorineko/AgenticArXiv-RL): online GRPO with verifiable rewards on top of the stage-1 SFT checkpoint, teaching a 1.5B arXiv ReAct agent to actually execute complete tool chains.

- Base: [Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-SFT](https://www.modelscope.cn/models/Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-SFT) (full-parameter SFT of Qwen2.5-1.5B-Instruct)
- Train split: 33 signal tasks selected by a frozen-policy probe (lr=0; 8 groups × 4 generations per task) from the 51 v3_81 train tasks (`data/splits/v6_grpo_train.json`); fully offline snapshot replay
- Recipe: GRPO, num_generations=4, beta=0.1, lr=5e-6, batch_size=16 (4 prompts/step), max_turns=6, no reward curriculum, seed 42, 60 steps
- Stage verification: passed (canary mean reward 0.295 vs threshold -0.2; SFT reference 0.107)

Strict success rate (pass^3; offline, seed 45, repeat 3):

| split | n | SFT | GRPO |
|---|---|---|---|
| rl_train (diagnostic) | 99 | 0.081 | **0.636** |
| dev | 24 | 0.000 | **0.375** |
| iid_test | 54 | 0.056 | **0.444** |
| ood_test | 12 | 0.000 | **0.500** |

Tool-call accuracy: 0.111 → 0.848 on rl_train; false-finish rate drops from 0.89–1.00 to 0.15–0.50. Evaluations replay an offline arXiv snapshot and do not reflect live-API behaviour; held-out sample sizes are small (dev 24, ood 12). Released under MIT; the Qwen2.5-1.5B-Instruct base is Apache-2.0.
