---
title: OLMo-mix-0625-20Bsample
canonical_url: "https://www.modelscope.cn/datasets/AskerCXQ/OLMo-mix-0625-20Bsample"
md_url: "https://www.modelscope.cn/datasets/AskerCXQ/OLMo-mix-0625-20Bsample.md"
repository: AskerCXQ/OLMo-mix-0625-20Bsample
chinese_name: "OLMo预训练数据-21B tokens (Dolma3)"
last_updated: 2026-03-07
license: "Apache License 2.0"
storage_size: "79 GB"
downloads: 1489
stars: 1
---

# OLMo-mix-0625-20Bsample

> OLMo-mix-0625-20Bsample - AskerCXQ 在 ModelScope 开源的数据集。OLMo预训练数据-21B tokens (Dolma3)

AskerCXQ/OLMo-mix-0625-20Bsample 是 ModelScope 魔搭社区上的数据集，存储大小 79 GB，采用 Apache License 2.0 许可。

- **Repository**: AskerCXQ/OLMo-mix-0625-20Bsample
- **License**: Apache License 2.0
- **Storage size**: 79 GB
- **Downloads**: 1489
- **Stars**: 1
- **Last updated**: 2026-03-07

Source: https://www.modelscope.cn/datasets/AskerCXQ/OLMo-mix-0625-20Bsample

---

# OLMo预训练数据-21B tokens (Dolma3)

OLMo 预训练用数据，包含：
- **OLMo-mix-0625-20Bsample**: 训练数据（dolma2-tokenizer 预 tokenize 的 .npy 文件）
- **eval-data/perplexity/v3_small_dolma2-tokenizer**: 验证数据（v3_small_ppl_validation）

## 数据格式
- Tokenizer: allenai/dolma2-tokenizer
- 格式: numpy .npy 文件，uint16 或 uint32

## 使用方式
下载后设置 `--data-root` 指向解压目录，并确保目录结构为：
```
data_root/
├── OLMo-mix-0625-20Bsample/   # 训练 .npy 文件
└── eval-data/
    └── perplexity/
        └── v3_small_dolma2-tokenizer/   # 验证 .npy 文件（lm_evaluator 用）
```
