---
title: security-cve
canonical_url: "https://www.modelscope.cn/datasets/wanghy07/security-cve"
md_url: "https://www.modelscope.cn/datasets/wanghy07/security-cve.md"
repository: wanghy07/security-cve
chinese_name: "代码安全漏洞cve增强版数据集"
last_updated: 2025-05-13
license: "Apache License 2.0"
storage_size: "23 MB"
downloads: 1284
stars: 18
---

# security-cve

> security-cve - wanghy07 在 ModelScope 开源的数据集。security-cve 数据集描述 security-cve 数据集是对原始 ReposVul 数据集进行清洗和优化后的版本，是一个包含 6,134 条 CVE 条目的高质量集合，涵盖 C、C++、Java 和 Python 中的 1,491…

wanghy07/security-cve 是 ModelScope 魔搭社区上的数据集，存储大小 23 MB，采用 Apache License 2.0 许可。

- **Repository**: wanghy07/security-cve
- **License**: Apache License 2.0
- **Storage size**: 23 MB
- **Downloads**: 1284
- **Stars**: 18
- **Last updated**: 2025-05-13

Source: https://www.modelscope.cn/datasets/wanghy07/security-cve

---

数据集文件元信息以及数据文件，请浏览“数据集文件”页面获取。

security-cve 数据集描述 security-cve 数据集是对原始 ReposVul 数据集进行清洗和优化后的版本，是一个包含 6,134 条 CVE 条目的高质量集合，涵盖 C、C++、Java 和 Python 中的 1,491 个项目。它提供了多粒度漏洞信息，从仓库级到行级。清洗过程提高了数据质量，使其适合用于训练和评估用于漏洞检测的机器学习模型。数据结构 数据集中的每个条目都是一个包含以下字段的 JSON 对象：
instruction：包含代码片段和检测安全漏洞提示的字符串。
output：描述漏洞的字符串，包括：
漏洞类型：漏洞类型（例如，未验证的输入）。
严重性：严重性级别（例如，中等）。
摘要：漏洞的简要描述。
关键代码模式：与漏洞相关的模式。
修复：建议的修复方法。

示例 { "instruction": "作为 Java 安全专家，检测此代码中的安全漏洞：\n## 内容 1\n### 文件路径：\ncore/src/main/java/hudson/cli/CreateJobCommand.java\n### 代码内容：\npackage hudson.cli;\n\nimport hudson.model.ModifiableItemGroup;\nimport hudson.model.TopLevelItem;\nimport jenkins.model.Jenkins;\nimport hudson.Extension;\nimport hudsonમ:\n\n/_*\n * Creates a new job by reading stdin as a configuration XML file.\n * \n * @author Kohsuke Kawaguchi\n _/\n@Extension\npublic class CreateJobCommand extends CLICommand {\n @Override\n public String getShortDescription() {\n return Messages.CreateJobCommand_ShortDescription();\n }\n\n @Argument(metaVar="NAME",usage="Name of the job to create",required=true)\n public String name;\n\n protected int run() throws Exception {\n Jenkins h = Jenkins.getInstance();\n h.checkPermission(Item.CREATE);\n\n if (h.getItemByFullName(name)!=null) {\n stderr.println("Job '"+name+"' already exists");\n return -1;\n }\n\n ModifiableTopLevelItemGroup ig = h;\n int i = name.lastIndexOf('/');\n if (i > 0) {\n String group = name.substring(0, i);\n Item item = h.getItemByFullName(group);\n if (item == null) {\n throw new IllegalArgumentException("Unknown ItemGroup " + group);\n }\n\n if (item instanceof ModifiableTopLevelItemGroup) {\n ig = (ModifiableTopLevelItemGroup) item;\n } else {\n throw new IllegalArgumentException("Can't create job from CLI in " + group);\n }\n name = name.substring(i + 1);\n }\n\n ig.createProjectFromXML(name, stdin);\n return 0;\n }\n}\n\n\n", "output": "【漏洞类型】未验证的用户输入\n【严重性】Medium\n【漏洞摘要】此代码允许通过命令行接口（CLI）创建一个新作业，但未对输入的作业名称进行安全性验证。攻击者可以通过提交恶意的作业名称来利用此漏洞，可能导致路径遍历攻击或其他形式的目录遍历攻击。问题出现在代码的第 72 行，即 ig.createProjectFromXML(name, stdin);之前，攻击者可以利用未验证的作业名称参数进行恶意操作。\n【关键代码模式】未验证的用户输入、XML 配置文件读取、路径遍历攻击。\n【修复方法说明】修复方法通过调用 Jenkins.checkGoodName(name);来验证用户输入的作业名称，确保其符合 Jenkins 的安全标准。这有助于防止路径遍历攻击和其他形式的目录遍历攻击。" }

清洗过程

参考
https://arxiv.org/pdf/2401.13169
将该论文的数据集做增强，标记出漏洞代码特征

使用方法 security-cve 数据集可用于训练或评估用于漏洞检测的机器学习模型。它特别适合使用 LoRA（低秩自适应）等方法微调大型语言模型，如 QWen2.5-Coder-3B。Python 示例用法：import json
加载数据集
with open("security-cve.json", "r") as file: data = json.load(file)
访问样本
sample = data[0] print("Instruction:", sample["instruction"]) print("Output:", sample["output"])

#### 下载方法

:modelscope-code[]{type="sdk"}
:modelscope-code[]{type="git"}
