---
title: SAR-Compression-Dataset
canonical_url: "https://www.modelscope.cn/datasets/xxx0001/SAR-Compression-Dataset"
md_url: "https://www.modelscope.cn/datasets/xxx0001/SAR-Compression-Dataset.md"
repository: xxx0001/SAR-Compression-Dataset
chinese_name: "SAR图像压缩实验数据集"
last_updated: 2026-08-20
license: "Apache License 2.0"
downloads: 421
stars: 0
---

# SAR-Compression-Dataset

> SAR-Compression-Dataset - xxx0001 在 ModelScope 开源的数据集。本数据集用于 SAR 图像压缩模型的训练、测试及场景与尺度泛化实验，数据来源于 Sentinel-1 SAR 影像，采用 VV 极化通道。主实验数据包含 3710 张训练图像、461 张验证图像和 469 张测试图像，图像尺寸为 512×512；独立泛化数据包含 256×256、512×512 和 1024×1024 三种尺度，共 1084 张测试图像。此外提供从主测试集中确定性分层抽取的 18…

xxx0001/SAR-Compression-Dataset 是 ModelScope 魔搭社区上的数据集，采用 Apache License 2.0 许可。

- **Repository**: xxx0001/SAR-Compression-Dataset
- **License**: Apache License 2.0
- **Downloads**: 421
- **Stars**: 0
- **Last updated**: 2026-08-20

Source: https://www.modelscope.cn/datasets/xxx0001/SAR-Compression-Dataset

---

## 1. 数据集概述

数据来源于 Sentinel-1 SAR 数据。

实验仅使用：

```text
VV polarization
```

数据集划分为两部分：

```text
main/
    主实验数据
    长江三角洲场景

generalization/
    独立场景与尺度泛化数据
    珠江三角洲场景
```

其中：

- `main/` 用于模型训练、验证和主测试实验；
- `generalization/` 使用与主实验空间不重叠的独立 Sentinel-1 场景，用于验证场景与尺度泛化能力；
- `review_subset/` 从主测试集固定抽取 18 张图像，用于审稿、代码检查和快速复现。

---

## 2. 数据目录结构

正式发布版本的主要目录结构如下：

```text
SAR-Compression-Dataset/
├── README.md
├── SHA256SUMS.txt
│
├── main/
│   └── preprocess_output_hyperprior_512/
│       ├── train_data_opensar/
│       │   ├── train/
│       │   └── val/
│       ├── test_png/
│       └── csv/
│
├── generalization/
│   ├── preprocess_output_hyperprior_256/
│   │   ├── test_png/
│   │   └── csv/
│   │
│   ├── preprocess_output_hyperprior_512/
│   │   ├── test_png/
│   │   └── csv/
│   │
│   └── preprocess_output_hyperprior_1024/
│       ├── test_png/
│       └── csv/
│
└── review_subset/
    ├── test_*.png
    ├── review_subset.csv
    └── SHA256SUMS.txt
```

---

## 3. 主实验数据

主实验数据来自 3 景 Sentinel-1 SAR 数据。

预处理后统一生成：

```text
512 × 512
```

图像块。

正式划分为：

| 数据划分 | 图像数量 |
|---|---:|
| Train | 3710 |
| Validation | 461 |
| Test | 469 |
| 合计 | 4640 |

目录对应关系如下：

```text
main/preprocess_output_hyperprior_512/
├── train_data_opensar/
│   ├── train/          # 3710
│   └── val/            # 461
├── test_png/           # 469
└── csv/
```

论文中的主实验、方法比较、编码端与解码端联合实验以及主要消融结果均以该数据体系为基础。

论文正式主测试结果使用：

```text
main/preprocess_output_hyperprior_512/test_png/
```

中的全部 469 张测试图像。

---

## 4. 独立场景与尺度泛化数据

独立泛化数据来自另外 3 景 Sentinel-1 SAR 数据。

这些场景与主实验数据空间不重叠，仅用于独立场景和尺度泛化验证，不参与主模型训练。

发布以下三种图像块尺度：

| 尺度 | 图像数量 |
|---|---:|
| 256 × 256 | 492 |
| 512 × 512 | 476 |
| 1024 × 1024 | 116 |
| 合计 | 1084 |

目录如下：

```text
generalization/
├── preprocess_output_hyperprior_256/
│   ├── test_png/       # 492
│   └── csv/
│
├── preprocess_output_hyperprior_512/
│   ├── test_png/       # 476
│   └── csv/
│
└── preprocess_output_hyperprior_1024/
    ├── test_png/       # 116
    └── csv/
```

其中：

```text
512 × 512
```

与模型训练采用的图像块尺度一致。

论文中独立场景 512 × 512 数据在 q1—q8 八个质量等级下共构成：

```text
476 × 8 = 3808
```

个图像—质量等级组合。

---

## 5. 正式数据规模

不计算 `review_subset/` 中的重复副本时，本数据集包含：

```text
主训练集              3710
主验证集               461
主测试集               469
泛化 256               492
泛化 512               476
泛化 1024              116
--------------------------------
独立 PNG 样本总数     5724
```

因此：

```text
5724
```

是本数据集正式的独立图像样本数量。

`review_subset/` 中另外保存了主测试集中 18 张图像的副本，因此物理目录中的 PNG 文件总数为：

```text
5724 + 18 = 5742
```

但这 18 张不属于新增数据样本。

---

## 6. 原始 Sentinel-1 场景

### 6.1 主实验场景

主实验所使用的 VV measurement 文件对应：

```text
s1a-iw-grd-vv-20240127t100403-20240127t100428-052291-065279-001.tiff

s1a-iw-grd-vv-20240122t095446-20240122t095511-052218-065001-001.tiff

s1a-iw-grd-vv-20240127t100338-20240127t100403-052291-065279-001.tiff
```

### 6.2 独立泛化场景

独立泛化实验使用：

```text
s1a-iw-grd-vv-20240517t102602-20240517t102627-053910-068d72-001.tiff

s1a-iw-grd-vv-20240527t104159-20240527t104224-054056-06928b-001.tiff

s1a-iw-grd-vv-20240527t104224-20240527t104249-054056-06928b-001.tiff
```

本数据集不重新发布上述原始 measurement TIFF 文件或完整 SAFE 产品。

发布版 CSV/JSON 中使用：

```text
source_scene_1
source_scene_2
source_scene_3
```

作为逻辑场景标识，用于替代作者本地文件系统中的绝对路径。

---

## 7. SAR 数据预处理

原始 Sentinel-1 数据主要经过以下处理流程：

```text
Apply-Orbit
      ↓
ThermalNoiseRemoval
      ↓
Calibration
      ↓
Terrain-Correction
      ↓
LinearToFromdB
      ↓
图像块生成
      ↓
PNG 数据集
```

主实验统一生成：

```text
512 × 512
```

图像块。

独立场景分别生成：

```text
256 × 256
512 × 512
1024 × 1024
```

三种尺度的数据。

相关预处理和数据组织代码请参见 GitHub：

```text
dataset/
```

以及：

```text
dataset/preprocessing/
```

具体处理参数以 GitHub 仓库中公开的冻结版本代码和配置为准。

---

## 8. CSV 与 JSON 文件说明

各数据目录中的 `csv/` 保存数据生成与评价所需的辅助信息。

### 8.1 patch_index.csv

记录图像块的来源场景、裁剪位置、图像尺寸、输出文件名以及相关预处理统计信息。

正式发布版本已经删除作者本机绝对路径。

对于：

```text
generalization/
```

中的数据，发布版 `patch_index.csv` 仅保留实际公开的测试图像条目。

### 8.2 preprocess_summary.csv

记录对应尺度数据预处理过程的汇总信息。

### 8.3 enl_auto_rois.csv

记录自动选择的 ENL 评价区域。

该文件主要用于 SAR 图像局部均匀区域的统计特性评价。

### 8.4 enl_auto_rois_val.csv

仅主实验数据提供。

用于验证集上的 ENL 区域记录。

### 8.5 preprocess_config.json

部分尺度保留预处理配置文件，用于记录数据生成时的重要参数和源场景逻辑标识。

发布版本中的本地绝对路径已经统一替换为相对路径或：

```text
SOURCE_DATA_ROOT
source_scene_x
```

等逻辑标识。

---

## 9. 未发布的数据

为了避免将作者本地实验硬盘完整镜像到公开数据集，本仓库未发布以下内容：

```text
原始 Sentinel-1 SAFE 产品
原始 measurement TIFF
VH 极化数据
annotation/
preview/
support/
failed_patches.csv
预处理失败图像块
ENL ROI 可视化检查图片
临时文件
缓存文件
训练输出
模型重建结果
```

本仓库主要提供论文实验实际使用的预处理后数据。

如需原始 Sentinel-1 数据，请通过相应的 Sentinel/Copernicus 官方或授权数据平台获取。

---

## 10. ENL 数据说明

本数据集保留：

```text
enl_auto_rois.csv
enl_auto_rois_val.csv
```

用于支持 ENL 指标计算和相关统计分析。

用于人工检查 ROI 选择结果的：

```text
enl_roi_visualizations/
enl_roi_visualizations_val/
```

仅属于开发和审计辅助文件，因此未纳入正式发布版本。

---

## 11. 审稿与快速复现子集

为便于论文审稿、代码检查和快速复现，本数据集额外提供：

```text
review_subset/
```

其中包含从主测试集 469 张图像中固定抽取的 18 张代表图像。

### 11.1 抽样规则

该子集不依据本文方法的压缩性能、PSNR 增益或重建结果进行人工挑选。

抽样采用确定性的分层规则：

```text
3 个主实验来源场景
×
3 个纹理复杂度等级
×
每个等级 2 张
=
18 张
```

具体过程为：

1. 按来源场景将主测试集划分为 3 组；
2. 对每张原始测试图像计算 8 bit 灰度像素标准差；
3. 每个场景内部按照灰度标准差排序；
4. 划分为低、中、高 3 个纹理复杂度区间；
5. 每个区间确定性选择 2 张代表图像。

因此任何人在相同数据和脚本条件下重新执行均可得到相同的 18 张图像。

### 11.2 子集目录

```text
review_subset/
├── test_*.png
├── review_subset.csv
└── SHA256SUMS.txt
```

其中：

```text
review_subset.csv
```

记录：

- `review_index`：快速复现子集编号；
- `filename`：图像文件名；
- `source_scene`：来源场景；
- `original_test_index`：原主测试集编号；
- `texture_group`：纹理复杂度等级；
- `gray_std`：灰度标准差；
- `gray_mean`：灰度均值；
- `source_relative_path`：原 test469 图像路径；
- `sha256`：图像 SHA-256。

### 11.3 子集用途

该子集仅用于降低快速复现和审稿验证所需的计算量。

它不构成新的测试集。

18 张图像全部来自：

```text
main/preprocess_output_hyperprior_512/test_png/
```

中的正式 469 张主测试图像。

论文中的正式统计结果仍基于完整：

```text
469
```

张测试图像。

如果对该快速复现子集执行 q1—q8 全部质量等级测试，则共包含：

```text
18 × 8 = 144
```

个图像—质量等级组合。

如果需要完整复现论文主实验，应使用全部 469 张主测试图像，而不是仅使用 `review_subset/`。

---

## 12. Review Subset SHA-256 校验

`review_subset/` 自带独立的：

```text
SHA256SUMS.txt
```

用于快速验证 18 张审稿子集图像。

Linux 或 WSL 下执行：

```bash
cd review_subset

sha256sum -c SHA256SUMS.txt
```

正式发布版本应得到：

```text
18 / 18 OK
```

---

## 13. 与代码和模型仓库的关系

本项目采用代码、模型和数据分离的发布方式。

### GitHub

```text
XXX-nyx/SAR-Joint-RDO-Compression
```

主要保存：

```text
源代码
训练脚本
测试脚本
配置文件
ERDOQ 轻量辅助模型
环境配置
```

### ModelScope Model

```text
xxx0001/SAR-Joint-RDO-Compression
```

主要保存：

```text
SAR Hyperprior q1-q8
Cheng2020-Attention q1-q6
V4.2-tail Attention q1-q8
解码端消融模型
```

### ModelScope Dataset

```text
xxx0001/SAR-Compression-Dataset
```

保存：

```text
主实验数据
独立场景数据
尺度泛化数据
ENL ROI
快速复现子集
数据索引与预处理元数据
```

---

## 14. 下载数据集

首先安装 ModelScope：

```bash
pip install -U modelscope
```

下载完整数据集：

```bash
modelscope download \
  --dataset xxx0001/SAR-Compression-Dataset \
  --local_dir ./SAR-Compression-Dataset
```

下载完成后的主要目录为：

```text
SAR-Compression-Dataset/
├── README.md
├── SHA256SUMS.txt
├── main/
├── generalization/
└── review_subset/
```

---

## 15. 数据完整性校验

根目录提供：

```text
SHA256SUMS.txt
```

用于校验正式发布的数据集文件。

Linux 或 WSL 下执行：

```bash
cd SAR-Compression-Dataset

sha256sum -c SHA256SUMS.txt
```

所有文件均应显示：

```text
OK
```

若出现：

```text
FAILED
```

说明下载文件损坏、内容发生变化，或文件与正式发布版本不一致。

为了只查看异常项，可以使用：

```bash
sha256sum -c SHA256SUMS.txt 2>&1 | grep -v ': OK$'
```

正常情况下该命令应：

```text
无输出
```

---

## 16. 数据使用方式

### 16.1 主模型训练

训练集：

```text
main/preprocess_output_hyperprior_512/train_data_opensar/train/
```

验证集：

```text
main/preprocess_output_hyperprior_512/train_data_opensar/val/
```

### 16.2 主测试实验

```text
main/preprocess_output_hyperprior_512/test_png/
```

包含：

```text
469
```

张图像。

### 16.3 快速复现

```text
review_subset/
```

包含：

```text
18
```

张主测试图像的固定副本。

### 16.4 独立场景与尺度泛化

```text
generalization/preprocess_output_hyperprior_256/test_png/

generalization/preprocess_output_hyperprior_512/test_png/

generalization/preprocess_output_hyperprior_1024/test_png/
```

---

## 17. 数据来源与使用说明

本数据集基于 Sentinel-1 SAR 数据生成。

使用本数据集时，请同时遵守 Sentinel/Copernicus 原始数据相应的使用条款、版权和来源标注要求。

本仓库公开的是作者基于原始 Sentinel-1 数据生成的预处理后科研数据及相关元数据，不主张对 Sentinel-1 原始数据本身拥有版权。

使用或再分发相关数据时，应保留对 Sentinel/Copernicus 数据来源的适当说明。

对于经过处理的 Sentinel 数据，建议按照原始数据提供方的相关要求进行来源标注。

---

## 18. 数据版本与冻结原则

当前版本对应论文正式实验使用的数据发布版本。

正式独立数据规模为：

```text
5724 PNG
```

其中：

```text
主实验：4640
独立泛化：1084
```

另外：

```text
review_subset/
```

中保存主测试集 18 张图像的重复副本。

因此物理目录中 PNG 数量为：

```text
5742
```

但独立图像样本数量仍为：

```text
5724
```

正式发布后，原则上保持：

- 数据划分不变；
- 图像内容不变；
- 文件名不变；
- review subset 不变；
- ENL ROI 不变。

如果未来更新任何数据文件，应同步更新：

```text
README.md
SHA256SUMS.txt
```

并在版本记录中说明具体修改内容。

---

## 19. 运行环境

数据预处理和论文实验主要使用：

```text
Python 3.10
PyTorch
CompressAI
NumPy
pandas
Pillow
scikit-image
```

完整实验环境请参考 GitHub：

```text
environment/
├── README.md
├── environment.yml
├── requirements.txt
└── verify_environment.py
```

---

## 20. 论文

本数据集用于支撑以下 SAR 图像压缩研究：

**《SAR图像压缩的潜变量量化取值优化与固定码流重建》**

正式论文发表后，将在此补充：

```text
作者
期刊
卷期
页码
DOI
BibTeX
```

等引用信息。

---

## 21. 许可证与第三方说明

项目原创代码许可证详见 GitHub：

```text
LICENSE
```

第三方软件、模型和相关版权说明见：

```text
THIRD_PARTY_NOTICES.md
```

数据集本身同时涉及 Sentinel/Copernicus 原始数据来源，因此数据使用者还应遵守对应原始数据的使用条件。

---

## 22. 联系与问题反馈

如发现以下问题：

- 数据文件缺失；
- SHA-256 校验失败；
- 数据划分与 README 不一致；
- 图像与 CSV 索引无法对应；
- review subset 无法复现；
- 代码与数据目录接口不一致；

请通过 GitHub Issue 反馈：

https://github.com/XXX-nyx/SAR-Joint-RDO-Compression/issues
