---
title: MMSA_data_qwen
canonical_url: "https://www.modelscope.cn/datasets/zen00003/MMSA_data_qwen"
md_url: "https://www.modelscope.cn/datasets/zen00003/MMSA_data_qwen.md"
repository: zen00003/MMSA_data_qwen
chinese_name: "(MMSA)用Qwen3_VL_Embedding_2B_model重提取文本特征"
last_updated: 2026-03-23
license: "Apache License 2.0"
storage_size: "13 GB"
downloads: 54
stars: 0
---

# MMSA_data_qwen

> MMSA_data_qwen - zen00003 在 ModelScope 开源的数据集。毕设自用。

zen00003/MMSA_data_qwen 是 ModelScope 魔搭社区上的数据集，存储大小 13 GB，采用 Apache License 2.0 许可。

- **Repository**: zen00003/MMSA_data_qwen
- **License**: Apache License 2.0
- **Storage size**: 13 GB
- **Downloads**: 54
- **Stars**: 0
- **Last updated**: 2026-03-23

Source: https://www.modelscope.cn/datasets/zen00003/MMSA_data_qwen

---

原始 MMSA 论文( [MMSA Google Drive](https://drive.google.com/drive/folders/1A2S4pqCHryGmiqnNSPLv7rEg63WvjCSk)。)：
```bibtex
@inproceedings{liu2022mmsa,
  title={MMSA: Multi-Modal Sentiment Analysis with Multi-View Learning},
  author={Liu, Y. and others},
  booktitle={Proceedings of the 30th ACM International Conference on Multimedia},
  year={2022}
}
本数据集是 **MMSA (Multi-Modal Sentiment Analysis)** 的衍生版本，原始数据来自 [MMSA Google Drive](https://drive.google.com/drive/folders/1A2S4pqCHryGmiqnNSPLv7rEg63WvjCSk)。\
我使用 **Qwen** 模型对文本进行了重编码，并整理了三个标准子数据集（MOSI、MOSEI、SIMS）的未对齐特征，方便直接用于多模态情感分析任务。
```
## 数据集目录结构

```
MMSA_data_qwen/
└── qwendata/
    ├── MOSEI/
    │   ├── label.csv
    │   └── Processed/(均max_len == 330)
    │       ├── train.pkl
    │       ├── valid.pkl
    │       └── test.pkl
    ├── MOSI/
    │   ├── label.csv
    │   └── Processed/
    │       └── unaligned_175_qwen.pkl   (包含 train/valid/test 三个拆分)
    └── SIMS/
        ├── label.csv
        └── unaligned_34_qwen.pkl        (包含 train/valid/test 三个拆分)
```

---

## 数据集详情

### 1. MOSEI (CMU-MOSEI)
- **原始数据**：CMU-Multimodal Opinion Sentiment and Emotion Intensity
- **处理方式**：（特征：只有文本）按标准划分生成 `train.pkl`、`valid.pkl`、`test.pkl`，每个文件为一个字典，包含以下字段：
  - `raw_text`：原始句子（list of str）
  - `text_qwen`：Qwen tokenized IDs，形状 `(样本数, 3, 序列长度)`，用于不同长度的截断/填充
  - `text`：Qwen 提取的文本嵌入，形状 `(样本数, 序列长度, 768)`，dtype=float16
  - `annotations`：情感类别（Positive/Neutral/Negative）
  - `regression_labels`：连续情感分数（范围 -3 到 3）
  - `id`：样本唯一标识

### 2. MOSI (CMU-MOSI)
- **原始数据**：CMU-Multimodal Opinion Sentiment Intensity
- **处理方式**：所有数据合并为一个 `unaligned_175_qwen.pkl` 文件，内部字典包含三个键：
  - `train`、`valid`、`test`，每个子字典的结构与 MOSEI 类似，但维度和长度略有不同：
    - `text_qwen`：形状 `(样本数, 3, 175)`
    - `text`：形状 `(样本数, 175, 768)`
    - `audio`：形状 `(样本数, 375, 5)`
    - `vision`：形状 `(样本数, 500, 20)`
    - 其他字段同原数据集

### 3. SIMS (Multimodal Sentiment Analysis in Chinese)
- **原始数据**：中文多模态情感分析数据集
- **处理方式**：同样合并为一个 `unaligned_34_qwen.pkl` 文件，内部字典包含 `train`、`valid`、`test` 三个键。每个子字典包含：
  - `raw_text`：中文原始文本（str）
  - `text_qwen`：Qwen tokenized IDs，形状 `(样本数, 3, 34)`
  - `text`：文本嵌入，形状 `(样本数, 34, 768)`
  - `audio`：声学特征，形状 `(样本数, 400, 33)`
  - `vision`：视觉特征，形状 `(样本数, 55, 709)`
  - 多任务标签：提供文本(T)、声学(A)、视觉(V) 的单模态标签及融合标签
    - `classification_labels_*` 和 `regression_labels_*`（* = T, A, V, 无后缀表示多模态融合）

---

## 下载方法

### 方法一：使用 ModelScope SDK

```python
from modelscope.msdatasets import MsDataset

ds = MsDataset.load(
    'zen00003/MMSA_data_qwen',   # 请替换为您的命名空间/数据集名称
    subset_name='default',
    split='train'
)
```

### 方法二：使用 Git LFS

```bash
git clone https://www.modelscope.cn/datasets/zen00003/MMSA_data_qwen.git
cd MMSA_data_qwen
# 确保已安装 git-lfs
git lfs pull
```

---

## 使用示例（Python）

加载 MOSEI 训练集：

```python
import pickle

# 加载 MOSEI 训练文件
with open('qwendata/MOSEI/Processed/train.pkl', 'rb') as f:
    data = pickle.load(f)

print(data.keys())
# 输出: dict_keys(['raw_text', 'text_qwen', 'text',  ...])

# 查看文本嵌入形状
print(data['text'].shape)       # (样本数, 175, 768)
```

加载 MOSI 数据集并提取验证集：

```python
import pickle

with open('qwendata/MOSI/Processed/unaligned_175_qwen.pkl', 'rb') as f:
    data = pickle.load(f)

train_data = data['train']
valid_data = data['valid']
test_data  = data['test']

print(train_data['regression_labels'].shape)  # (1284,)
```

加载 SIMS 测试集：

```python
import pickle

with open('qwendata/SIMS/unaligned_34_qwen.pkl', 'rb') as f:
    data = pickle.load(f)

test_data = data['test']
print(test_data['raw_text'][0])  # 第一条中文文本
```

---

## 许可证

本数据集基于原始 MMSA 数据整理，遵循 **Apache License 2.0** 开源协议。使用前请遵守原始数据的引用规范。

---

## 引用

如果您在研究中使用了本数据集，请引用（等弄完我毕设论文吧.....）\
南昌大学谢泽才（联系：xiezecai03@qq.com）

---

## 注意事项

- 所有 `.pkl` 文件均通过 **Git LFS** 管理，直接 clone 后需执行 `git lfs pull` 才能获取实际数据。
- 数据集总大小约 **12 GB**，请确保网络和存储空间充足。
- 若需处理数据，建议使用 `pickle.load()` 后转换为 NumPy/PyTorch 张量格式。
```

请将上述内容保存为 `README.md` 文件。如果您的仓库命名空间或数据集名称不是 `zen00003/MMSA_data_qwen`，请相应修改“下载方法”部分。
