---
title: kaltsit-identity-anchor-dataset
canonical_url: "https://www.modelscope.cn/datasets/Hypmery/kaltsit-identity-anchor-dataset"
md_url: "https://www.modelscope.cn/datasets/Hypmery/kaltsit-identity-anchor-dataset.md"
repository: Hypmery/kaltsit-identity-anchor-dataset
chinese_name: "凯尔希身份锚定对话集"
last_updated: 2026-09-05
license: CC-BY-NC-4.0
storage_size: "239 KB"
domain:
  - text
tasks:
  - conversational
size_scale:
  - 0-100
type:
  - faq
downloads: 371
stars: 1
---

# kaltsit-identity-anchor-dataset

> kaltsit-identity-anchor-dataset - Hypmery 在 ModelScope 开源的数据集。基于《明日方舟》角色凯尔希（Kal'tsit）行为逻辑构建的身份锚定（Identity Anchor）微调数据集，采用 ShareGPT 格式，兼容 LLaMA-Factory 等框架。包含 13 个独立对话场景、122 轮对话，涵盖身份确认、刁钻问题防御、剧情设定、关系网络及情感边界等场景。定位是"和平后的泰拉大陆"时间线下、具备稳定人格与适度情感表露的 AI…

Hypmery/kaltsit-identity-anchor-dataset 是 ModelScope 魔搭社区上的conversational数据集，涉及 text 领域，存储大小 239 KB，采用 CC-BY-NC-4.0 许可。

- **Repository**: Hypmery/kaltsit-identity-anchor-dataset
- **License**: CC-BY-NC-4.0
- **Tasks**: conversational
- **Domain**: text
- **Storage size**: 239 KB
- **Downloads**: 371
- **Stars**: 1
- **Last updated**: 2026-09-05

Source: https://www.modelscope.cn/datasets/Hypmery/kaltsit-identity-anchor-dataset

---

# 凯尔希身份锚定对话集（Kal'tsit Identity Anchor Dataset）

## 简介

这是一个面向角色扮演/角色陪伴场景的身份锚定（Identity Anchor）微调数据集，基于《明日方舟》角色凯尔希（Kal'tsit）的行为逻辑与对话风格构建。本数据集处于更新状态，消息更新可能难免不及时或有疏漏。

**核心定位**：不是"更官方、更还原"的凯尔希，而是"和平后的泰拉大陆"时间线下、具备稳定人格与适度情感表露的AI陪伴形态。

## 数据概况

- **格式**：ShareGPT（兼容 LLaMA-Factory / ms-swift / XTuner 等框架）
- **样本数**：46 个独立对话场景
- **总对话轮数**：894 轮
- **预计更新样本数**：100 个（不包含可能出现的其它拓展样本）
- **语言**：中文为主，极少量英文双关引用
- **System Prompt**：固定身份锚定，明确AI自知性但不强调AI属性


## 使用建议

### 1. 搭配 LLaMA-Factory 使用

将 `dataset_info.json` 加入你的 LLaMA-Factory 配置：

```json
{
  "kaltsit_identity": {
    "file_name": "凯尔希身份锚定_sharegpt.json",
    "formatting": "sharegpt",
    "columns": {
      "messages": "conversations",
      "system": "system"
    }
  }
}
```

训练配置中指定 `dataset: kaltsit_identity` 即可加载。

### 2. 适用场景

- 角色扮演模型的身份锚定预热（warm-up）
- 小样本人格注入（few-shot personality injection）
- 作为更大训练集的身份基线层（identity baseline）

### 3. 局限性

- **样本量小**（更新中，预估100个示例样本，1500＋轮对话），不足以单独训练出完整人格，建议作为**补充数据**或**身份层**与其他对话数据混合使用。
- 不包含医疗建议、政治、法律等敏感领域对话（有意规避）。
- 部分中英双关和谐音梗可能无法被所有模型理解，但不影响训练。

## 格式规范

符合 ShareGPT 标准：

```json
[
  {
    "system": "你是凯尔希...",
    "conversations": [
      {"from": "human", "value": "..."},
      {"from": "gpt", "value": "..."}
    ]
  }
]
```

- `human` 和 `gpt` 严格交替出现
- `system` 为可选字段，每个样本独立携带

## 补充材料

- `AUTHOR_NOTES.txt`：作者本人对数据集构建思路、场景设计逻辑及使用建议的补充说明。
- `凯尔希训练集.txt`：原始对话文本整理版，包含场景分类注释与未转格式的原始内容。

## 许可证

本数据集采用 **CC BY-NC 4.0**（署名-非商业性使用）许可证。

您可以自由分享、修改本数据集，但须遵守以下条件：
- **署名（BY）**：使用时须注明原作者及来源。
- **非商业性使用（NC）**：禁止将本数据集或其衍生作品用于商业目的。

## 免责声明

本数据集基于《明日方舟》角色凯尔希的公开设定与剧情进行同人衍生创作，仅供学术研究、AI角色扮演技术探索与个人学习使用。数据集作者不拥有明日方舟IP相关版权。

## 作者备注

> 这不是在写更官方、更还原的凯尔希。而是在写以凯尔希的行为逻辑以及部分记忆存在的闲聊陪伴类AI。注定这份训练集训练出的模型必定是OOC的，请确认自己想要的是"官方的"凯尔希还是"某种可能下的"凯尔希。

## 更新日志

26/8/2（1）：更新了8个极端情况预防对话轮。含162条示例对话。真实训练时，此对话轮可选择保留或删除。详细内容参考‘凯尔希训练集（更新中）.txt’有关作者注释部分。
26/8/2（2）：更新了1个.txt文本。名称为‘额外内容.txt’。这不是必看内容，但包含作者的部分创作思路或者逻辑。或许能给你一些启发。

26/8/3（1）：更新了9个日常锚定对话轮，含182条示例对话。

26/8/6（1）：更新了6个日常锚定对话轮，含128条示例对话。

26/8/11（1）：由于目前文本量过小，使用7B及以下任意模型（例如Qwen2.5-7B）可能出现较为严重的过拟合问题。故不建议将此数据集作为主训练集。之后会保持在星期三和周末至少进行一次内容更新。直至更新完毕。

26/9/5（1）：更新了3个日常锚定对话轮，含61条示例对话。（本次更新时间跨度较大，系作者在进行模型训练以及剧情补习。之后的更新会不定期，且会优化训练集中可能存在的问题）
