---
title: hands-on-modern-rl-experiment01-cartpole
canonical_url: "https://www.modelscope.cn/studios/walkinglab/hands-on-modern-rl-experiment01-cartpole"
md_url: "https://www.modelscope.cn/studios/walkinglab/hands-on-modern-rl-experiment01-cartpole.md"
repository: walkinglab/hands-on-modern-rl-experiment01-cartpole
chinese_name: "Hands-On Modern RL · 实验 01 · CartPole"
last_updated: 2026-08-20
sdk_type: gradio
sdk_version: 6.17.3
downloads: 0
stars: 0
---

# hands-on-modern-rl-experiment01-cartpole

> hands-on-modern-rl-experiment01-cartpole - walkinglab 在 ModelScope 创建的在线 Demo。《动手学现代强化学习》实验 01：浏览器使用 CPU 训练 CartPole PPO，实时查看奖励曲线、训练日志、策略动画并下载模型。

walkinglab/hands-on-modern-rl-experiment01-cartpole 是 ModelScope 魔搭社区上的在线可交互 Demo（创空间），基于 gradio 6.17.3 构建，中文名为「Hands-On Modern RL · 实验 01 · CartPole」。

- **Repository**: walkinglab/hands-on-modern-rl-experiment01-cartpole
- **SDK**: gradio
- **SDK version**: 6.17.3
- **Downloads**: 0
- **Stars**: 0
- **Last updated**: 2026-08-20

Source: https://www.modelscope.cn/studios/walkinglab/hands-on-modern-rl-experiment01-cartpole

---

# WalkingLab × Hands-On Modern RL · 实验 01 · CartPole

这是 **WalkingLab** 与开源课程 **Hands-On Modern RL（《动手学现代强化学习》）** 的 **第 1 章 · CartPole 入门 / 1.3 PPO 训练可视化** 配套实验。在页面中点击“开始训练”，即可使用 CPU 训练 PPO 智能体，并实时观察奖励曲线、PPO 输出和评估日志。训练结束后，页面会播放策略动画，并提供模型文件下载。

课程项目：<https://github.com/walkinglabs/hands-on-modern-rl>

课程网站：<https://walkinglabs.github.io/hands-on-modern-rl/>

WalkingLab：<https://modelscope.cn/organization/walkinglab>

## 训练入口

- [在当前创空间中训练](https://modelscope.cn/studios/walkinglab/hands-on-modern-rl-experiment01-cartpole)
- [阅读配套章节：1.3 PPO 训练可视化](https://walkinglabs.github.io/hands-on-modern-rl/chapter01_cartpole/training)
- [直接在 ModelScope 中运行配套 Notebook](https://modelscope.cn/notebook/share/github/walkinglabs/hands-on-modern-rl/blob/main/code/online-experiments/hands-on-modern-rl-experiment01-cartpole.ipynb)
- [查看可直接运行的 `train.py`](https://modelscope.cn/studios/walkinglab/hands-on-modern-rl-experiment01-cartpole/file/view/master/train.py)

## 本地运行

```bash
pip install -r requirements.txt
python app.py

# 不启动网页，直接运行训练脚本
python train.py --timesteps 30000
```

完整课程与本地实验代码：<https://github.com/walkinglabs/hands-on-modern-rl>
