---
title: omniglot
canonical_url: "https://www.modelscope.cn/datasets/codexie/omniglot"
md_url: "https://www.modelscope.cn/datasets/codexie/omniglot.md"
repository: codexie/omniglot
chinese_name: "omniglot(字符小样本数据集)"
last_updated: 2025-03-17
license: "Apache License 2.0"
storage_size: "68 MB"
downloads: 120
stars: 0
---

# omniglot

> omniglot - codexie 在 ModelScope 开源的数据集。一些少样本字符分类的数据集，提供demo代码。来源github:https://github.com/brendenlake/omniglot，

codexie/omniglot 是 ModelScope 魔搭社区上的数据集，存储大小 68 MB，采用 Apache License 2.0 许可。

- **Repository**: codexie/omniglot
- **License**: Apache License 2.0
- **Storage size**: 68 MB
- **Downloads**: 120
- **Stars**: 0
- **Last updated**: 2025-03-17

Source: https://www.modelscope.cn/datasets/codexie/omniglot

---

#### 来源

https://github.com/brendenlake/omniglot

#### 介绍
Omniglot 数据集旨在开发更像人类的学习算法。它包含来自 50 种不同字母的 1623 个不同的手写字符。这 1623 个字符中的每一个都是由 20 个不同的人通过亚马逊的 Mechanical Turk 在线绘制的。每幅图像都与笔画数据配对，即 [x,y,t] 坐标序列与时间 (t)（以毫秒为单位）。

#### 引用（来自数据集提供者）
请引用以下论文：
Lake, BM、Salakhutdinov, R. 和 Tenenbaum, JB (2015)。通过概率程序感应实现人类水平的概念学习。Science ， 350(6266)，1332-1338。

并查看我们关于挑战的进度报告：
https://arxiv.org/abs/1902.03477

#### 致谢
我们非常感谢Omniglot书写系统百科全书帮助实现这个数据集，也感谢Jason Gross对这个数据集的开发和收集起到了至关重要的作用。

#### 下载方法 
:modelscope-code[]{type="sdk"}
:modelscope-code[]{type="git"}

#### 使用方法
Python 2.*
需要 scipy、matplotlib 和 numpy

通过解压目录并运行 python/demo.py 来了解数据集的结构。这将生成如下图形，其中不同的颜色表示不同的笔画：demo_strokes.png

关键数据文件（图像和笔画）：  
images_background.zip  
strokes_background.zip  
images_evaluation.zip  
strokes_evaluation.zip  

两个“最小”分割的关键数据文件：  
images_background_small1.zip  
strokes_background_small1.zip  
images_background_small2.zip  
strokes_background_small2.zip  
评估集与上面相同。  

字符是一系列以“START”开头的笔坐标 (x,y,time)。笔划之间的中断表示为“BREAK”（表示笔抬起动作）。笔划数据是原始的。它具有不均匀的空间和时间采样间隔，因为数据是从许多不同的 Web 浏览器和计算机收集的。对于大多数应用程序，您需要进行插值以获得均匀的空间或时间采样间隔。

我们的一次性分类任务需要字母表内的区分，这比其他地方使用的字母表间的区分任务更具挑战性。要与我们论文中的一次性分类结果进行比较，请进入“one-shot-classification”目录并解压缩“all_runs.zip”，并将所有文件夹“run01”、“run20”放在当前目录中。运行“demo_classification.py”以演示使用改进的豪斯多夫距离的基线模型。
