---
title: Chinese_medicine_image
canonical_url: "https://www.modelscope.cn/datasets/Lihuahua2022/Chinese_medicine_image"
md_url: "https://www.modelscope.cn/datasets/Lihuahua2022/Chinese_medicine_image.md"
repository: Lihuahua2022/Chinese_medicine_image
chinese_name: "kaggle中草药数据集"
last_updated: 2026-08-12
license: unknown
storage_size: "8.7 GB"
downloads: 19823
stars: 1
---

# Chinese_medicine_image

> Chinese_medicine_image - Lihuahua2022 在 ModelScope 开源的数据集。Chinese Medicine Image Dataset（中草药图像数据集）

Lihuahua2022/Chinese_medicine_image 是 ModelScope 魔搭社区上的数据集，存储大小 8.7 GB，采用 unknown 许可。

- **Repository**: Lihuahua2022/Chinese_medicine_image
- **License**: unknown
- **Storage size**: 8.7 GB
- **Downloads**: 19823
- **Stars**: 1
- **Last updated**: 2026-08-12

Source: https://www.modelscope.cn/datasets/Lihuahua2022/Chinese_medicine_image

---

# Chinese Medicine Image Dataset（中草药图像数据集）

基于深度学习的中草药细粒度识别研究数据集，覆盖 **879 类中草药**，共 **167,017 张**药材图像，包含药材饮片、根茎、花叶、果实种子、皮、茎、全草、矿物与动物药等多种形态。

- **标签数**：879 类（中文类别名）
- **图片数**：167,017 张
- **类别形态**：药材饮片 / 根茎 / 花叶 / 果实种子 / 皮 / 茎 / 全草 / 矿物 / 动物药
- **发布**：2026-08-04 更新
- **原数据来源**：[Kaggle chinese-medicine-image 竞赛](https://www.kaggle.com/competitions/chinese-medicine-image)
- **许可**：数据集原出处为 Kaggle 竞赛（chinese-medicine-image），使用时请遵守 [Kaggle 竞赛条款](https://www.kaggle.com/competitions/chinese-medicine-image/rules)

---

## 数据集文件

| 文件 | 大小 | 说明 |
|:---|:---|:---|
| `dataset_kaggle.zip` | 9.38 GB | 原始数据集（train/valid 目录式切分，含标签噪声） |
| `dataset_kaggle_clean.zip` | 9.42 GB | **清洗后数据集**（train/valid/conflict_holdout，推荐使用） |
| `dataset_infos.json` | 138 B | 数据集元信息 |
| `README.md` | — | 本说明 |

### 目录结构

```
dataset_kaggle/（原始）
├── train/            # 训练集（目录名即类别名）
└── valid/            # 验证集

dataset_kaggle_clean/（清洗后，推荐）
├── train/               # 训练集 145,537 张
├── valid/               # 验证集 16,244 张
└── conflict_holdout/    # 冲突图隔离区（5,236 张，不参与训练/验证）
```

---

## 为什么提供两个版本？

原始 `dataset_kaggle` 存在两类**数据质量问题**，会严重污染训练与评估：

1. **同图异标签**：同一张图片出现在 ≥2 个不同类别目录（如一张图同时标为"七叶一枝花"与"甘遂"、"丝瓜络"与"粤丝瓜络"），共 **2,522 组 / 5,236 张**。
2. **跨切分泄漏**：同一内容图片同时存在于训练集与验证集且标签互相矛盾，共 **461 组 / 1,017 张**——验证集中约 6% 的样本在训练阶段已被"见过"却标注为不同类别，导致评估失真。

`dataset_kaggle_clean` 通过 **MD5 全量比对** 处理：
- 冲突图（同一内容跨 ≥2 类别）整体隔离到 `conflict_holdout/`，不进入任何训练/验证集合
- 以"图组"（MD5 分组）为单位重建 90/10 无泄漏切分，彻底消除跨切分泄漏

**实测收益**：在 ConvNeXt-Base 上，脏切分基线 Top-1 为 74.87%，干净切分基线提升至 **76.34%（+1.47）**——数据质量是识别精度的首要杠杆。

---

## 数据特性与难点

- **长尾分布**：每类图片数从个位数到数百张不等，平均约 190 张/类；训练样本 <30 张的类别仅 5 类。
- **标签体系重叠**：存在大量**同物异名/产地变体**（如 丹参↔甘肃丹参、石斛↔铁皮石斛、七叶一枝花↔重楼）与**外观近同但非同物**（玄参↔苦玄参、川贝母↔平贝母）。
- **细粒度挑战**：部分矿物药/饮片（青礞石、玄明粉等）视觉高度相似，单类识别率可低至 0%。

---

## 使用示例

### 加载（PyTorch ImageFolder）
```python
from torchvision.datasets import ImageFolder
from torchvision import transforms

transform = transforms.Compose([
    transforms.Resize(384),
    transforms.CenterCrop(384),
    transforms.ToTensor(),
])
train_ds = ImageFolder("dataset_kaggle_clean/train", transform=transform)
valid_ds = ImageFolder("dataset_kaggle_clean/valid", transform=transform)
print(f"训练集: {len(train_ds)} 张 / {len(train_ds.classes)} 类")
# 训练集: 145537 张 / 879 类
```

### 数据清洗复现（可选）
如需从原始数据重建干净切分，可运行清洗脚本（MD5 去重 → 冲突隔离 → 无泄漏切分）。

---

## 基准结果（供参考）

在干净切分上的代表性结果（ConvNeXt 系列，ImageNet-22K 预训练）：

| 模型 | Top-1 | 说明 |
|:---|:---|:---|
| ConvNeXt-Base（干净基线） | 76.34% | 数据清洗后基线 |
| ConvNeXt-Base（最优配方） | 76.49% | 去掉加权采样 |
| 7 模型集成（logits 平均） | 77.46% | 配方消融模型集成 |
| **ConvNeXt-V2-L（197M）** | **77.49%** | 单模型上限 |
| 按"药材组"合并评估 | 78.31% | 同物异名按组评估 |

> 对标 [Kaggle chinese-medicine-image 公开榜](https://www.kaggle.com/competitions/chinese-medicine-image/leaderboard)，ConvNeXt-V2-L 干净验证集 0.77490 处于榜单高分区。

---

## 声明

本数据集仅供学术研究与学习使用。中草药识别结果不能替代专业人员的现场鉴别与用药判断。如需商用或医疗用途，请核实数据来源与许可条款。
