---
title: U-MERE-Research-Data-20260804
canonical_url: "https://www.modelscope.cn/datasets/StudyAI123123/U-MERE-Research-Data-20260804"
md_url: "https://www.modelscope.cn/datasets/StudyAI123123/U-MERE-Research-Data-20260804.md"
repository: StudyAI123123/U-MERE-Research-Data-20260804
chinese_name: "U-MERE 研究数据归档 20260804"
last_updated: 2026-08-05
license: Other
storage_size: "971 MB"
downloads: 256
stars: 0
---

# U-MERE-Research-Data-20260804

> U-MERE-Research-Data-20260804 - StudyAI123123 在 ModelScope 开源的数据集。Private U-MERE conference-original and clean-fixed research archive.

StudyAI123123/U-MERE-Research-Data-20260804 是 ModelScope 魔搭社区上的数据集，存储大小 971 MB，采用 Other 许可。

- **Repository**: StudyAI123123/U-MERE-Research-Data-20260804
- **License**: Other
- **Storage size**: 971 MB
- **Downloads**: 256
- **Stars**: 0
- **Last updated**: 2026-08-05

Source: https://www.modelscope.cn/datasets/StudyAI123123/U-MERE-Research-Data-20260804

---

# U-MERE research data archive (2026-08-04)

本仓库是 U-MERE 会议版数据、修复后的期刊实验数据和两版共用图像的私有研究归档。它用于服务器复现和扩刊实验，不代表已经获得公开再分发推文文本与图像的许可；在完成平台条款、数据来源、伦理与法务审查前，请保持仓库为 `private`。

远端状态（2026-08-04）：全部数据和图像归档已提交；上传后的递归文件树已与本地文件清单比较，缺失文件为 0。服务器下载后仍需使用 `MANIFEST_SHA256.txt` 做内容级校验。

## 版本说明

- `conference_original/`：会议投稿时使用的数据。主数据共 9473 条，原切分为训练池 6631、测试 2842；LVLM 实际训练取训练池前 5000 条，BERT+CRF 使用余下 1131 条训练和 500 条验证。
- `clean_fixed/`：人工清洗候选数据再经过结构审计和确定性修复后的版本，共 9473 条。它与会议版的样本顺序和图像 ID 相同，但 550 条记录的 token 或标注发生过变化。
- `shared_images/`：两版共用的 9473 张图，只保存一次。`twitter2015_images_9473.tar` 解压后直接得到图片文件。
- `docs/`：逐条修复审计报告、已被替代的设计记录，以及当前 FICL-OSM 服务器实施与实验手册。
- `server_handoff/`：可直接传到服务器的实施包压缩文件；解压后从 `README_先读.md` 和 `SERVER_CODEX_TASK.md` 开始，在包内 clone 最新 LLaMAFactory。

不要再使用含义不清的 `v1/v2` 称呼。论文中建议称为 `conference-original`、`clean-fixed-20260804`，切分名称另行写明。

## 目录结构

```text
.
├── README.md
├── MANIFEST_SHA256.txt
├── conference_original/
│   ├── data/umere_conference_original_full_9473.json
│   ├── splits/{train70_6631,test30_2842}.json
│   ├── direct_tasks/
│   ├── cm_tasks/
│   └── bert_crf_legacy_splits/
├── clean_fixed/
│   ├── data/umere_clean_fixed_full_9473.json
│   ├── splits/conference_legacy/
│   ├── splits/journal_grouped_70_10_20/
│   ├── audit/
│   └── scripts/
├── shared_images/
│   ├── twitter2015_images_9473.tar
│   └── image_filenames_9473.txt
├── docs/
│   ├── 数据修复与审计报告.md
│   ├── 期刊课程学习方法与实验实施方案.md  # 已被替代
│   └── 期刊冻结候选课程学习完整方案.md      # 当前唯一推荐
└── server_handoff/
    └── U-MERE_服务器实施包_20260805.tar.gz
```

## 应该用哪套切分

会议结果历史对齐使用 `clean_fixed/splits/conference_legacy/`：

- `lvlm_train_first5000.json`：5000 条；
- `cm_train_1131.json`：BERT+CRF 训练；
- `cm_dev_500.json`：BERT+CRF 验证与选参；
- `shared_test_2842.json`：所有会议方法共用测试集。

期刊主结果使用 `clean_fixed/splits/journal_grouped_70_10_20/`：

- train/dev/test = 6631/947/1895；
- 完全相同 token 序列或完全相同图像内容不会跨集合；
- BERT+CRF 在 6631 条 train 内做 5 折 group-aware cross-fitting，为 LVLM 训练集生成 out-of-fold 文本候选；最终 BERT 在全部 train 上重训后只为 dev/test 生成候选。

清洗后重跑 CM/CM+OSM 时必须重训 BERT+CRF并重新生成文本候选。FMNERG 开源材料已经生成的 VinVL 离线视觉候选可以按不变的图像 ID 复用和重新对齐，无需自行重新运行 VinVL。

## 下载与校验

使用服务器自己的 ModelScope 凭据登录，不要把 token 写进脚本、配置、Git 历史或作业日志。

```bash
python -m pip install -U modelscope-hub
ms-hub login
ms-hub download StudyAI123123/U-MERE-Research-Data-20260804 \
  --repo-type dataset \
  --local-dir /data/umere/U-MERE-Research-Data-20260804

cd /data/umere/U-MERE-Research-Data-20260804
sha256sum -c MANIFEST_SHA256.txt

mkdir -p /data/umere/images
tar -xf shared_images/twitter2015_images_9473.tar -C /data/umere/images
```

校验图像数量：

```bash
find /data/umere/images -type f | wc -l
# 预期：9473
```

## 研究与发布限制

1. 本归档可用于内部复现、期刊实验和人工复核。
2. 数据“机器质量检查通过”不等于推文与图片“可以合法公开发布”。
3. 对外公开前需要补齐数据卡、来源、许可/平台条款、隐私与伦理说明。
4. `race`、`siblings` 等极少样本关系不能通过复制到测试集来制造类别指标；无测试实例时应报告 `N/A`。
5. 详细方法与全部实验协议以 `docs/期刊冻结候选课程学习完整方案.md` 为准；旧课程文档仅保留为设计演化记录。
