---
title: JARVIS-MeloTTS-Voice-dataset
canonical_url: "https://www.modelscope.cn/datasets/rubintry/JARVIS-MeloTTS-Voice-dataset"
md_url: "https://www.modelscope.cn/datasets/rubintry/JARVIS-MeloTTS-Voice-dataset.md"
repository: rubintry/JARVIS-MeloTTS-Voice-dataset
chinese_name: "贾维斯-Melotts-语音数据集"
last_updated: 2026-07-25
license: "Apache License 2.0"
storage_size: "5.8 GB"
downloads: 235
stars: 0
---

# JARVIS-MeloTTS-Voice-dataset

> JARVIS-MeloTTS-Voice-dataset - rubintry 在 ModelScope 开源的数据集。该数据集可基于melotts进行tts模型微调训练

rubintry/JARVIS-MeloTTS-Voice-dataset 是 ModelScope 魔搭社区上的数据集，存储大小 5.8 GB，采用 Apache License 2.0 许可。

- **Repository**: rubintry/JARVIS-MeloTTS-Voice-dataset
- **License**: Apache License 2.0
- **Storage size**: 5.8 GB
- **Downloads**: 235
- **Stars**: 0
- **Last updated**: 2026-07-25

Source: https://www.modelscope.cn/datasets/rubintry/JARVIS-MeloTTS-Voice-dataset

---

# JARVIS MeloTTS Voice Pack

## 数据集简介

JARVIS MeloTTS Voice Pack 是一套面向中英文语音合成训练与研究的角色化语音数据集。

该数据包保存了本次 MeloTTS 训练过程中具有长期复用价值的核心资产，包括原始 WAV 音频、文本标注、训练集与验证集划分、训练配置、模型权重以及推理测试样本。

为了降低存储和传输成本，数据包主动排除了 Python 虚拟环境、BERT 特征缓存、频谱缓存、历史训练日志、旧测试结果和其他可以重新生成的临时文件。

## 主要用途

本数据集可用于：

* 中英文语音合成训练
* 中英文混合语音合成研究
* MeloTTS 模型训练、继续训练和效果复现
* 角色化语音助手原型开发
* TTS 数据清洗与标注流程研究
* 向其他语音合成框架迁移音频和文本数据
* 对不同训练步数和模型方案进行效果比较

## 数据包结构

```text
JARVIS-MeloTTS-Voice-Pack/
├── README.md
├── dataset/
│   ├── wavs/
│   │   └── *.wav
│   ├── manifest.jsonl
│   ├── metadata.list
│   ├── metadata.list.cleaned
│   ├── metadata.tsv
│   ├── train.list
│   ├── val.list
│   ├── config.json
│   └── config.before_training.json
├── pretrained/
│   ├── G_325000.pth
│   ├── D_325000.pth
│   └── DUR_325000.pth
└── samples/
    └── test_output_30000/
```

实际目录可能根据导出时保留的模型权重和测试样本略有差异。

## 数据内容

### 音频文件

原始训练音频位于：

```text
dataset/wavs/
```

该目录仅保留 `.wav` 音频文件。

MeloTTS 在数据预处理和训练过程中会在音频目录中生成以下缓存：

```text
*.bert.pt
*.spec.pt
```

这些文件分别属于文本特征缓存和频谱缓存，不属于原始语音资产，因此未包含在本数据包中。

重新运行 MeloTTS 数据预处理流程后，可以再次生成这些缓存。

### 文本标注

数据包包含以下一种或多种标注文件：

* `metadata.list`：原始 MeloTTS 文本标注
* `metadata.list.cleaned`：完成文本清洗后的标注
* `metadata.tsv`：TSV 格式的音频与文本映射
* `manifest.jsonl`：JSON Lines 格式的数据清单
* `train.list`：训练集划分
* `val.list`：验证集划分

其中，`metadata.list.cleaned`、`train.list` 和 `val.list` 是本次 MeloTTS 训练实际使用的重要数据资产。

不同 TTS 框架对数据清单格式的要求不同。迁移至其他训练框架时，应以原始 WAV 音频和对应文本为基础重新转换。

## 语言范围

数据集主要包含：

* 中文
* 英文
* 中英文混合内容

部分文本可能包含：

* 专有名词
* 技术术语
* 英文缩写
* 数字和时间表达
* 系统提示语
* 角色化助手用语
* 中英文自然切换语句

## 数据特点

该数据集主要面向单一角色化声音方向，强调中英文表达的一致性以及语音助手场景中的自然播报效果。

样本可能覆盖：

* 普通陈述
* 系统状态汇报
* 任务完成提示
* 技术分析
* 风险提醒
* 中英文混合表达
* 长句与短句
* 不同复杂度的文本内容

当前版本主要以音频、文本和语言信息为核心，未必包含完整的情绪、语气强度或场景标签。

## 模型与配置

数据包中可能包含以下内容：

* MeloTTS 训练配置
* 训练前配置备份
* MeloTTS 基础预训练权重
* 本次训练生成的模型权重
* 最终阶段的推理测试音频

模型权重与原始语音数据属于不同类型的资产。

使用模型权重时，应同时确认对应 MeloTTS 项目、基础预训练模型以及其他依赖组件的许可证和使用范围。

## 推理样本

最终阶段的推理测试样本位于：

```text
samples/test_output_30000/
```

这些样本可用于快速试听：

* 英文普通语句
* 英文复杂语句
* 英文较长表达
* 中文普通语句
* 中文复杂语句
* 中文较长表达
* 中英文混合语句

这些测试音频也可作为后续模型升级时的对比基准。

## 未包含内容

为控制数据包体积，本数据包不包含：

* `.venv` Python 虚拟环境
* `*.bert.pt` BERT 文本特征缓存
* `*.spec.pt` 频谱缓存
* 完整训练日志
* TensorBoard 日志
* 数据修复前的完整备份
* 历史阶段测试输出
* Python `__pycache__`
* Git 仓库元数据
* 可重新安装的第三方依赖
* 可重新生成的中间训练文件

## MeloTTS 复用说明

如需继续进行 MeloTTS 训练，应准备与原训练环境兼容的 Python 环境和依赖。

建议优先使用以下文件恢复数据流程：

```text
dataset/wavs/*.wav
dataset/metadata.list.cleaned
dataset/train.list
dataset/val.list
dataset/config.json
```

重新执行文本和音频预处理后，会生成训练所需的：

```text
*.bert.pt
*.spec.pt
```

因此，这些缓存不需要随数据集长期保存。

如果训练代码在文本前处理、中英文混合处理或数据路径方面做过自定义修改，还需要同步恢复对应代码。

## 迁移至其他 TTS 框架

迁移至其他语音合成框架时，建议优先使用：

```text
dataset/wavs/*.wav
dataset/manifest.jsonl
dataset/metadata.tsv
dataset/metadata.list.cleaned
```

不同框架可能要求重新处理以下内容：

* 音频采样率
* 音频声道
* 音频响度
* 音频时长范围
* 文本规范化
* 标点符号
* 语言标签
* 说话人标签
* 情绪标签
* 训练集和验证集划分

`.bert.pt` 和 `.spec.pt` 属于 MeloTTS 当前训练流程的中间缓存，不建议直接迁移到其他模型。

## 建议的数据扩展方向

未来可以在现有音频和文本基础上补充以下标签：

* `language`
* `emotion`
* `style`
* `intensity`
* `scene`
* `sentence_length`
* `speech_rate`
* `speaker_state`

例如：

```json
{
  "audio": "wavs/sample_000001.wav",
  "text": "Good evening, sir. All systems are operating normally.",
  "language": "en",
  "emotion": "neutral",
  "style": "professional",
  "intensity": "low",
  "scene": "system_report"
}
```

这些标签有助于未来将数据迁移到支持情绪、语气和风格控制的语音生成模型。

## 已知限制

* 本数据集主要面向单一角色化声音，不是通用多说话人数据集。
* 中文、英文和中英文混合样本的数量可能不完全均衡。
* 不同长度和不同表达风格的样本分布可能不完全均衡。
* 当前数据未必包含统一、完整的情绪标签。
* 部分文本可能具有明显的虚拟助手或科幻助手表达风格。
* 模型效果会受到文本前处理、训练步数、推理参数和代码版本影响。
* 基础预训练权重可能具有独立的许可证和使用要求。
* 本数据包不包含完整 Python 运行环境。

## 许可证与使用范围

本数据集当前使用：

```yaml
license: other
```

这表示数据集采用自定义或尚未完全明确的授权方式，而不代表其自动适用于商业使用、公开再分发或其他用途。

使用者在下载、复制、训练、分享、再发布或公开展示前，应自行确认以下内容的授权范围：

* 原始音频的来源和使用许可
* 文本内容的来源和使用许可
* 声音风格及相关知识产权
* 角色名称及相关知识产权
* MeloTTS 源代码许可证
* 基础预训练模型许可证
* 训练结果是否允许公开或商业使用

在授权范围未被明确确认前，建议仅将本数据集用于：

* 个人学习
* 技术研究
* 模型测试
* 非商业交流
* 语音合成实验

未经许可，不应使用本数据集进行：

* 身份冒充
* 欺诈
* 误导性传播
* 未经授权的真实人物声音生成
* 侵害他人合法权益的内容制作
* 违反适用法律法规的用途

## 免责声明

本数据集按现状提供，不保证适用于任何特定用途，也不保证所有音频、文本、模型权重或配置能够在不同软硬件环境中直接运行。

数据集维护者不对使用本数据集产生的以下问题承担责任：

* 模型输出错误
* 音频质量问题
* 训练失败
* 兼容性问题
* 版权或授权争议
* 身份混淆
* 商业损失
* 其他直接或间接后果

使用者应自行承担数据合规、模型训练、内容生成和发布行为的责任。
