---
title: YiZhao-FinDataSet
canonical_url: "https://www.modelscope.cn/datasets/CMB_AILab/YiZhao-FinDataSet"
md_url: "https://www.modelscope.cn/datasets/CMB_AILab/YiZhao-FinDataSet.md"
repository: CMB_AILab/YiZhao-FinDataSet
chinese_name: "一招金融数据集"
last_updated: 2024-12-10
license: other
storage_size: "2.1 TB"
domain:
  - text
tasks:
  - text-generation
language:
  - zh
downloads: 69082
stars: 194
---

# YiZhao-FinDataSet

> YiZhao-FinDataSet - CMB_AILab 在 ModelScope 开源的数据集。一招金融数据集旨在提供AI+金融行业模型训练数据集，致力于构建一个更金融、更干净且符合社会主义核心价值观的大规模金融领域数据集。数据集将不仅包含广泛的金融事件、市场动态，还涵盖各种金融产品和交易模式，以确保模型在复杂的金融环境中展现出卓越的泛化能力和预测准确性

CMB_AILab/YiZhao-FinDataSet 是 ModelScope 魔搭社区上的text-generation数据集，涉及 text 领域，存储大小 2.1 TB，采用 other 许可。

- **Repository**: CMB_AILab/YiZhao-FinDataSet
- **License**: other
- **Tasks**: text-generation
- **Domain**: text
- **Storage size**: 2.1 TB
- **Downloads**: 69082
- **Stars**: 194
- **Last updated**: 2024-12-10

Source: https://www.modelscope.cn/datasets/CMB_AILab/YiZhao-FinDataSet

---

# ***哈尔滨工业大学&招商银行 一招 金融数据集说明***
[Arxiv][[一招-12B-Chat](https://modelscope.cn/models/CMB_AILab/YiZhao-12B-Chat)][[清洗工具](https://github.com/HITsz-TMG/FinPile)]

---

**一招数据集**是一个2TB高质量多模态的大模型训练数据集，致力于构建一个更金融、更干净且符合社会主义核心价值观的大规模金融领域数据集。

本数据集将不仅包含广泛的金融事件、市场动态，还涵盖各种金融产品和交易模式，以确保模型在复杂的金融环境中展现出卓越的泛化能力和预测准确性。

本数据集重视数据合规性，坚决维护数据隐私、保护商业机密并要求数据符合社会主义核心价值观。借助专业的数据清洗方法，确保在不侵犯用户权益的前提下，安全、合法地利用这些数据，进而驱动行业知识探索和智能决策能力的增强。

## ***开源概况***

我们使用同步开源的清洗工具、金融数据分类器和安全风险识别分类器对原始数据集进行处理后，构建了更干净、具备金融特色、符合社会主义核心价值观的中、英文数据集。

本次开源的数据集包含**936GB**中文文本数据集，**100GB**英文文本数据集和**1TB**的高质量多模态数据集。

文本数据集涵盖金融领域各方面的内容，数据最终处理成具有统一字段的jsonl格式，每个文件大小不超过7GB。我们保留了数据经金融数据分类器后的金融得分和经安全风险识别分类器后的得分，以便后续根据分数获取不同质量、规模的数据集。同时，我们对数据集进行了人工抽检，从数据集中随机抽取4000个样本，要求标注人员从数据是否包含违反社会主义核心价值观的内容、是否包含歧视性内容、是否涉及商业违法违规、是否侵犯他人合法权益、是否涉黄涉暴涉赌等方面进行标注。

多模态大模型在金融领域中具有重要的地位。金融领域是一个涉及大量数据和复杂数学模型的领域，因此需要使用多模态大模型来处理和分析各种类型的数据，例如文本、图像和音频等。这些模型的主要优点是能够处理多种类型的数据，并且在训练和推理过程中能够利用多种模态的信息，从而提高模型的准确性和鲁棒性。在金融领域中，多模态大模型可以用于解决许多实际问题，例如信用评分、风险管理、金融欺诈检测和投资组合优化等。例如，在信用评分中，多模态大模型可以同时考虑文本和图像等信息，从而更好地评估借款人的信用风险。在金融欺诈检测中，多模态大模型可以分析多种类型的数据，例如交易记录、网络流量和图像等，从而更好地检测欺诈行为。为扩充数据的多样性，我们抽取上述金融数据分类器过滤出来的高质量文本，进一步通过工程技术和算法策略，生成适用于模型训练的**1TB**的高质量多模态数据集。


## ***数据字段说明***

* "meta"：【object】文本信息
  
  "id": 【string】文本唯一的ID
  
  "url": 【string】文本的原始页面的URL
  
  "title": 【string】标题
  
  "source_domain": 【string】来源网站的域名
  
  "dump": 【string】文本所属的CommonCrawl快照
  
  "fin_int_score":【int】金融分数四舍五入后的整数分数，分数范围为[1,5]
  
  "fin_score_model":【string】金融特性得分所使用的模型版本
  
  "risk_score":【float】安全风险识别分类器预测的分数
  
  "risk_score_model":【string】安全风险识别得分所使用的模型版本
  
  "language":【string】 en 英文, zh 中文
  
  "images":【list】 文本对应图片存放路径
* "text"：【string】文本
* "qa"：【list】基于文本的QA对

## ***数据开放协议***

我们根据Open Data Commons Attribution License(ODC-by) 1.0许可证协议发布此数据集。使用此数据集，您还需要遵守原始数据源的任何许可协议和使用条款。
