---
title: social-dialogue-zh
canonical_url: "https://www.modelscope.cn/datasets/Jimmyjin2/social-dialogue-zh"
md_url: "https://www.modelscope.cn/datasets/Jimmyjin2/social-dialogue-zh.md"
repository: Jimmyjin2/social-dialogue-zh
chinese_name: "中文社交对话数据集"
last_updated: 2026-08-28
license: Apache-2.0
downloads: 46
stars: 1
---

# social-dialogue-zh

> social-dialogue-zh - Jimmyjin2 在 ModelScope 开源的数据集。中文社交对话训练数据集，包含41748条多轮对话

Jimmyjin2/social-dialogue-zh 是 ModelScope 魔搭社区上的数据集，采用 Apache-2.0 许可。

- **Repository**: Jimmyjin2/social-dialogue-zh
- **License**: Apache-2.0
- **Downloads**: 46
- **Stars**: 1
- **Last updated**: 2026-08-28

Source: https://www.modelscope.cn/datasets/Jimmyjin2/social-dialogue-zh

---

# 社交对话训练数据集 (Social Dialogue Dataset)

## 数据集简介

本数据集是一个大规模中文社交对话数据集，包含来自中文互联网的多轮对话数据，可用于训练社交对话模型、聊天机器人等自然语言处理任务。

## 数据统计

| 指标 | 数值 |
|------|------|
| 总对话条数 | 41,748 |
| 总对话轮数 | 83,496 |
| 平均每条轮数 | ~2.0 |
| 数据格式 | JSONL (ShareGPT格式) |
| 语言 | 中文 |
| 文件大小 | ~10MB |

## 数据来源

数据来源于中文互联网人工生成内容，包括：

| 来源 | 数量 | 占比 |
|------|------|------|
| B站评论 | 30,062 | 72.0% |
| 小红书 | 7,333 | 17.6% |
| 抖音 | 3,853 | 9.2% |
| 问答对 | 500 | 1.2% |

## 数据格式

每条数据采用JSONL格式，包含以下字段：

```json
{
  "id": "dialogue_0",
  "conversations": [
    {"from": "user", "value": "用户消息"},
    {"from": "assistant", "value": "AI回复"}
  ]
}
```

### 字段说明

| 字段 | 类型 | 说明 |
|------|------|------|
| id | string | 唯一标识符 |
| conversations | list | 对话列表 |
| conversations.from | string | 角色（user/assistant） |
| conversations.value | string | 对话内容 |

## 数据特点

1. **真实对话**: 数据来源于真实用户在社交媒体上的互动
2. **多轮对话**: 平均每条包含2轮对话，支持多轮上下文理解
3. **多样场景**: 涵盖情绪安抚、日常聊天、观点表达、安慰朋友、幽默互动等多种社交场景
4. **高质量**: 经过清洗和格式化处理，确保数据质量

## 使用方法

### 方法一：使用ModelScope SDK

```python
from modelscope import MsDataset

# 加载数据集
dataset = MsDataset.load('Jimmyjin2/social-dialogue-zh', split='train')

# 查看数据
print(dataset[0])
```

### 方法二：使用HuggingFace Datasets

```python
from datasets import load_dataset

# 加载JSONL格式数据
dataset = load_dataset('json', data_files='social_dialogue_zh.jsonl')

# 查看数据
print(dataset['train'][0])
```

### 方法三：直接读取JSONL文件

```python
import json

# 读取数据
data = []
with open('social_dialogue_zh.jsonl', 'r', encoding='utf-8') as f:
    for line in f:
        data.append(json.loads(line.strip()))

# 查看第一条数据
print(json.dumps(data[0], ensure_ascii=False, indent=2))
```

### 用于模型微调

```python
from transformers import AutoTokenizer, AutoModelForCausalLM
from datasets import load_dataset

# 加载模型和分词器
model_name = "Qwen/Qwen2.5-7B-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name)

# 加载数据集
dataset = load_dataset('json', data_files='social_dialogue_zh.jsonl')

# 数据预处理
def preprocess_function(examples):
    texts = []
    for conversations in examples['conversations']:
        messages = []
        for conv in conversations:
            messages.append({"role": conv['from'], "content": conv['value']})
        text = tokenizer.apply_chat_template(messages, tokenize=False)
        texts.append(text)
    
    model_inputs = tokenizer(texts, max_length=2048, truncation=True, padding=True)
    model_inputs["labels"] = model_inputs["input_ids"].copy()
    return model_inputs

tokenized_dataset = dataset.map(preprocess_function, batched=True)
```

## 应用场景

1. **聊天机器人训练**: 用于训练社交对话模型
2. **情感分析**: 分析对话中的情感倾向
3. **意图识别**: 识别用户对话意图
4. **多轮对话系统**: 构建支持上下文的对话系统
5. **角色扮演**: 训练具有特定人格的AI角色

## 数据质量

- 经过格式化处理，确保数据一致性
- 去除重复和无效数据
- 保留原始对话的自然语言风格
- 支持多轮上下文理解

## 引用

如果您在研究或项目中使用了本数据集，请按以下格式引用：

```bibtex
@dataset{social_dialogue_2026,
  title={Social Dialogue Dataset: Chinese Social Conversation Training Data},
  author={Jimmyjin2},
  year={2026},
  publisher={ModelScope},
  url={https://modelscope.cn/datasets/Jimmyjin2/social-dialogue-zh}
}
```

## 许可证

本数据集采用 Apache License 2.0 开源协议。

## 联系方式

- **ModelScope**: https://modelscope.cn/datasets/Jimmyjin2/social-dialogue-zh
- **作者**: Jimmyjin2
