---
title: AgenticArXiv-RL-Qwen2.5-1.5B-GRPO-DrGRPO
canonical_url: "https://www.modelscope.cn/models/Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-GRPO-DrGRPO"
md_url: "https://www.modelscope.cn/models/Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-GRPO-DrGRPO.md"
repository: Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-GRPO-DrGRPO
last_updated: 2026-10-01
license: mit
model_type:
  - qwen2
architectures:
  - Qwen2ForCausalLM
base_model:
  - Qwen/Qwen2.5-1.5B-Instruct
base_model_relation: finetune
parameters: 1.5B
tensor_type:
  - F32
library_name:
  - safetensors
downloads: 4
stars: 0
tags:
  - agent
  - reinforcement-learning
  - tool-use
  - react
  - arxiv
  - grpo
  - dr-grpo
---

# AgenticArXiv-RL-Qwen2.5-1.5B-GRPO-DrGRPO

> AgenticArXiv-RL-Qwen2.5-1.5B-GRPO-DrGRPO - Algorineko 在 ModelScope 开源的模型。AgenticArXiv-RL-Qwen2.5-1.5B-GRPO-DrGRPO

Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-GRPO-DrGRPO 是 ModelScope 魔搭社区上的 1.5B 参数机器学习模型，采用 mit 许可，基于 Qwen/Qwen2.5-1.5B-Instruct 构建。

- **Repository**: Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-GRPO-DrGRPO
- **License**: mit
- **Parameters**: 1.5B
- **Base model**: Qwen/Qwen2.5-1.5B-Instruct
- **Tags**: agent, reinforcement-learning, tool-use, react, arxiv, grpo, dr-grpo
- **Downloads**: 4
- **Stars**: 0
- **Last updated**: 2026-10-01

Source: https://www.modelscope.cn/models/Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-GRPO-DrGRPO

---

# AgenticArXiv-RL-Qwen2.5-1.5B-GRPO-DrGRPO

**中文** · [English](#english)

## 中文

[AgenticArXiv-RL](https://github.com/Algorineko/AgenticArXiv-RL) 的 Dr.GRPO 变体发布权重：在与 [GRPO 基线](https://www.modelscope.cn/models/Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-GRPO)完全相同的配方上，改用 **Dr.GRPO 无偏目标**（`--loss_type dr_grpo --scale_rewards none`：去掉组内 std 归一化与长度偏置），是项目「新方法训练与对比」路线图的一部分。

- **基座**：[AgenticArXiv-RL-Qwen2.5-1.5B-SFT](https://www.modelscope.cn/models/Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-SFT)（与基线同一起点）
- **训练任务**：`data/splits/v6_grpo_train.json` 的 33 条信号任务，离线快照回放
- **配方**：与 GRPO 基线一致（`num_generations=4`、`beta=0.1`、`lr=5e-6`、`batch_size=16`、`max_turns=6`、无奖励课程、seed 42、60 步），**唯一差异：Dr.GRPO 损失 + 不做奖励标准差缩放**
- **奖励**：项目五分量可验证奖励（格式 / 工具 / 参数 / 过程 / 结果）

### 离线评测（seed 45 / repeat 3 / 离线快照回放 / regex agent）

严格成功率（pass³）：

| 切分 | SFT | GRPO 基线 | **Dr.GRPO** |
|---|---|---|---|
| rl_train（训练任务诊断） | 0.081 | 0.636 | **0.657** |
| dev | 0.000 | 0.375 | **0.375** |
| iid_test | 0.056 | 0.444 | **0.444** |
| ood_test | 0.000 | 0.500 | **0.500** |

泛化侧辅助指标更优：iid_test 工具准确率 0.56（基线 0.50）、ood_test 工具准确率 0.67 / 虚假完成率 0.33（基线 0.58 / 0.42），rl_train 工具准确率 0.84 与基线（0.85）持平。去掉 std 缩放后有效更新更大但 60 步内未见失稳（阶段验证 mean_reward 0.295，阈值 -0.2）。结论：**Dr.GRPO 在训练切分小幅领先、泛化辅助指标占优，其余与基线持平**——在三变体中综合表现最好。

### 限制

- 同基线：离线回放口径、33 条信号任务子集、dev/ood 样本量小（24/12）、单种子单次运行；rl_train 的 +0.021 在该样本量下属于弱信号
- `scale_rewards` 取值需从发布说明与 run_name 追溯（manifest 未记录该键）

## English

Dr.GRPO variant of [AgenticArXiv-RL](https://github.com/Algorineko/AgenticArXiv-RL): identical recipe to the [GRPO baseline](https://www.modelscope.cn/models/Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-GRPO) with the **unbiased Dr.GRPO objective** (`--loss_type dr_grpo --scale_rewards none`, removing group-std normalization and length bias). Part of the repo's "new-paradigm training & comparison" roadmap item.

- Base: [Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-SFT](https://www.modelscope.cn/models/Algorineko/AgenticArXiv-RL-Qwen2.5-1.5B-SFT)
- Recipe: identical to baseline except the Dr.GRPO loss + no reward-std scaling

Strict success (pass³, offline, seed 45, repeat 3): rl_train **0.657** (baseline 0.636) / dev 0.375 / iid 0.444 / ood 0.500. Generalization-side aux metrics improve: iid tool accuracy 0.56 (vs 0.50), ood tool accuracy 0.67 / false-finish 0.33 (vs 0.58 / 0.42). Stage verification passed (0.295 vs threshold -0.2). Limitations as baseline: offline replay, 33-task subset, small held-out sets, single seed — the +0.021 on rl_train is a weak signal at this sample size.
