---
title: arxiv-machine-learning-search-200-20260709
canonical_url: "https://www.modelscope.cn/datasets/hzh12345678/arxiv-machine-learning-search-200-20260709"
md_url: "https://www.modelscope.cn/datasets/hzh12345678/arxiv-machine-learning-search-200-20260709.md"
repository: hzh12345678/arxiv-machine-learning-search-200-20260709
chinese_name: "arXiv机器学习论文检索结果数据集"
last_updated: 2026-07-09
license: "Apache License 2.0"
storage_size: "529 KB"
downloads: 36
stars: 0
---

# arxiv-machine-learning-search-200-20260709

> arxiv-machine-learning-search-200-20260709 - hzh12345678 在 ModelScope 开源的数据集。本数据集采集自 arXiv 搜索结果页，以 machine learning 为关键词，按 announced date 降序采集前 4 页共 200 条论文元数据。字段包括论文标题、作者、摘要、主分类、全部分类、发布时间、更新时间、arXiv 编号、详情页链接、PDF 链接、来源分页和采集时间等。数据可用于网页数据采集、文本元数据分析和学术论文主题分析练习。

hzh12345678/arxiv-machine-learning-search-200-20260709 是 ModelScope 魔搭社区上的数据集，存储大小 529 KB，采用 Apache License 2.0 许可。

- **Repository**: hzh12345678/arxiv-machine-learning-search-200-20260709
- **License**: Apache License 2.0
- **Storage size**: 529 KB
- **Downloads**: 36
- **Stars**: 0
- **Last updated**: 2026-07-09

Source: https://www.modelscope.cn/datasets/hzh12345678/arxiv-machine-learning-search-200-20260709

---

# arXiv机器学习论文检索结果数据集

## 数据集简介

本数据集采集自 arXiv 搜索结果页，以 `machine learning` 为关键词，按 announced date 降序采集前 4 页共 200 条论文元数据。数据可用于网页数据采集课程作业、文本元数据分析、学术论文主题分析等练习。

## 数据来源与筛选条件

- 数据来源：arXiv 搜索结果页
- 来源链接：https://arxiv.org/search/?abstracts=show&order=-announced_date_first&query=machine+learning&searchtype=all&size=50&start=0
- 筛选条件：关键词 `machine learning`；搜索范围 all fields；每页 50 条；采集 start=0、50、100、150 四个分页。
- 采集时间：2026-07-09 16:55:41 UTC+08:00
- 数据条数：200 条
- 字段数量：13 个

## 文件说明

- `arxiv_machine_learning_200.xlsx`：作业提交用 Excel 数据文件。
- `arxiv_machine_learning_200.csv`：与 Excel 内容一致的 CSV 版本，便于平台预览和程序读取。

## 字段说明

| 字段 | 说明 |
| --- | --- |
| 序号 | 数据记录序号 |
| arXiv编号 | 论文在 arXiv 平台上的唯一编号 |
| 论文标题 | 论文标题 |
| 作者 | 论文作者，多个作者用分号分隔 |
| 摘要 | 论文摘要文本 |
| 主分类 | arXiv 主分类，如 cs.LG、cs.AI 等 |
| 全部分类 | 论文涉及的全部 arXiv 分类 |
| 发布时间 | 源站给出的论文发布时间 |
| 更新时间 | 源站给出的最近更新时间 |
| 详情页链接 | 论文详情页 URL |
| PDF链接 | 论文 PDF 下载/阅读 URL |
| 来源分页 | 该记录对应的搜索结果分页 URL |
| 采集时间 | 本次数据采集的本地时间 |

## 完整性说明

本次共采集 200 条记录，满足不少于 200 条的要求；13 个字段均为 200 条非空，arXiv 编号无重复。未采集链家、豆瓣、我爱我家、微博等网站。

#### 下载方法 
:modelscope-code[]{type="sdk"}
:modelscope-code[]{type="git"}
