---
title: Moti-1-7B
canonical_url: "https://www.modelscope.cn/models/ericsjq/Moti-1-7B"
md_url: "https://www.modelscope.cn/models/ericsjq/Moti-1-7B.md"
repository: ericsjq/Moti-1-7B
chinese_name: Moti-1-7B
last_updated: 2026-10-11
pipeline_tag: task-oriented-conversation
tasks:
  - task-oriented-conversation
model_type:
  - rca_qwen2
architectures:
  - RCAModel
parameters: 8.5B
tensor_type:
  - F32
  - BF16
library_name:
  - transformer
  - safetensors
downloads: 12
stars: 0
---

# Moti-1-7B

> Moti-1-7B - ericsjq 在 ModelScope 开源的模型。一次面向注意力架构本身的重构实验：把"层内自注意力"换成"跨层波前注意力"

- **Repository**: ericsjq/Moti-1-7B
- **Tasks**: task-oriented-conversation
- **Parameters**: 8.5B
- **Downloads**: 12
- **Stars**: 0
- **Last updated**: 2026-10-11

Source: https://www.modelscope.cn/models/ericsjq/Moti-1-7B

---

# Moti-1（摩谛）模型卡片及技术概述

<div align="center">

**Moti-1 · 摩谛**

*一次面向注意力架构本身的重构实验：把"层内自注意力"换成"跨层波前注意力"*

</div>

---

## 1. 模型简介

**Moti-1（摩谛）** 是小思框架发布的 7B 因果语言模型。它不是又一次在原架构上做数据增量训练，而是对 Transformer 的核心算子——**注意力机制本身**——进行了一次结构性替换实验：

- **保留** Qwen2.5-7B-Instruct 的 FFN、Embedding、LayerNorm 等全部非注意力组件；
- **替换** 层内自注意力为自研的 **RCA（Recursive Cross-Attention，递归层间交叉注意力）** 波前执行器；
- **原始 Attention 的 q/k/v/o 权重并不丢弃**，而是作为 RCA 分支的**初始权重**（二者结构同构，可直接克隆起步），使模型从与基座完全等效的状态出发平滑演进。

因此 Moti-1 的参数量与 7B 基座同级（替换后的 RCA 分支约 822M，接替原 self-attn 的角色），但信息在层间的流动方式已彻底改变：**每层的注意力不再局限于本层历史，而是可以按可学习的深度配比直接回读更浅层级的"成品"键值**。

发布权重 18.57 GB（基座 bf16 + RCA 分支 fp32 的混合精度存储），推理显存峰值约 18.6 GB。RCA 分支以 fp32 运行并非冗余：实测其权重若为 bf16，注意力算子会落入 cuDNN 劣化路径（单层 63ms vs fp32 3.7ms，17 倍差距）；加载器会自动完成精度回填，用户按标准写法加载即可，无需手动干预。

## 2. 架构：RCA 波前执行器

### 2.1 核心思想

标准 Transformer 中，第 *l* 层只能看到第 *l* 层自己的 KV 历史——信息想跨层流动，只能一个 token 一个 token 地"爬"。RCA 把这件事反了过来：

> **把序列切成 64-token 的块（block），按"块0全部层 → 块1全部层 → …"的波前（wavefront）顺序推进。当第 *l* 层处理第 *b* 块时，*l..l+k* 层对更早块的 KV 均已就绪，浅层可以直接读深层的成品。**

这样，跨层依赖在块粒度上被并行兑现，依赖图是无环 DAG，训练与推理共用同一套确定性调度。

**计算深度：随上下文增长，而非封顶于层数。** 标准 Transformer 中，每个 token 最终表征的串行依赖深度恒等于层数 L（Moti-1 为 28），与上下文长度无关；且位置 *i* 能读到的位置 *j* 的 KV 永远是 *j* 在同一层的"中间态"——*j* 经更深层加工后的结果对 *i* 永远不可见。RCA 波前打破了这一封顶：第 *l* 层可直接回读第 *l+g* 层对更早块的成品 KV，深层加工信息随波前逐块向上"扩散"（每过一个块最多上涌 k 层）。随着序列变长，浅层可触及的信息加工链越来越深——**理论计算深度随上下文长度增长**，在 k_win=2、L=28 配置下约 14 个块（~900 token）后深层信息即可覆盖全深度，此后每个新块都叠加在"经全深度加工过的历史"之上。**计算深度的上限不再由网络层数决定，而是随上下文长度增长**——这是 RCA 区别于一切"仅改注意力实现、不改信息流拓扑"方案的本质特性。

### 2.2 一次 softmax，三组 Key

每层注意力的 logit 由**单次 softmax 内的三组 key 竞争归一化**：

| 组 | 内容 | 作用 |
|---|---|---|
| ① 本层历史组 | 本层对更早块与块内的 KV（*g=0* 即数学上等价标准 KV cache） | 保底语言建模能力 |
| ② 跨层成品组 | 源层 *m = l+g, g=1..k* 已固化的成品 KV，带逐头深度偏置 `−λ_h·g` | 直接回读浅层/深层成品 |
| ③ 施工态组 | 本块内 *j ≤ i* 的本层 KV（严格下三角）+ 自身槽位偏置 `b_σ` | 块内局部交互 |

配套的可学习组件：**逐头深度斜率 λ**（决定每层读多深）、**自身槽位偏置 b_σ**、**层编码 e_k / e_v / f_q**（写入与读取 KV 时标记来源层，零初始化）。

生产路径上，三组 key 全部合并为单条 KV 序列，深度偏置/下三角掩码/σ 槽位统一编码为**一个加性 attention mask**，用单次 `scaled_dot_product_attention` 完成——不物化注意力矩阵，保证工程可用性。

### 2.3 训练管线

1. **阶段一（等效起点 + 结构预调）**：RCA 的 q/k/v/o 从原 Attention 权重**克隆**，λ 大初始化（跨层通道近闭），层编码 e_k/e_v/f_q 与 σ 偏置置零——初始模型严格等效于基座，无分布崩塌；此阶段仅训练 RCA 参数，让跨层注意力先"学会接管"。
2. **阶段二（纯 RCA 全参训练）**：彻底抛弃 self_attn 分支与门控（`h = h + RCA(x)`，无插值），RCA 全部 822M 参数解冻，在对话 SFT 数据上做完整的全参训练。
3. **阶段三（RCA + MLP-LoRA 联训）**：对每层 FFN 的 gate/up/down 注入 LoRA（r=16, α=32，B 矩阵零初始化保证起点无扰动），**RCA 与 LoRA 同步解冻、互相适应**；数据为通用对话 + 前端 HTML SFT 混合（工具调用标签 token 损失加权 ×10，缓解标签占比 0.06% 被淹没的问题）。六种新机制小参数（λ/b_σ/s_gate/e_k/e_v/f_q；其中 s_gate 在 Beta12 语义下结构性停用）全程保留 fp32 主权重，对抗 bf16 量化对 ~1e-5 级 Adam 位移的舍入吞没。
4. **发布形态**：LoRA 合并进 MLP 主权重，RCA 适配器直接载入——推理路径无任何包装器，无 dtype 转换开销。

## 3. 消融实验

我们在受控设置下（同数据 / 同步数 / 同 lr / 同种子 / 同 2048 序列长度）对 RCA 做了两组关键消融。

### 3.1 消融一：语义版本裁决 —— "单次 softmax 三组竞争"是必要的

早期的 RCA 修正版使用"双独立 softmax + 标量门控插值"的保守设计（s_gate≈−6 近闭）。我们在 webcode2m HTML 数据（前 100k 字符）上对三种语义做了 300 步微型对照，以**留出集 NLL（泛化）**为准：

| 组 | 语义 | 留出 NLL @300 步 |
|---|---|---|
| vanilla | 标准 Qwen2 层内自注意力 | 5.5615 |
| rca_mod | 修正版（双 softmax + 标量门，跨层路由近闭） | 5.7116 |
| **rca_b12** | **正式语义（单次 softmax 三组 KV 竞争 + 逐头 λ 分化）** | **5.4834** ✦ 最优 |

**结论**：只有启用"单次 softmax 三组 key 竞争"的原生跨层路由，RCA 才能超过标准注意力；保守的门控插值版本反而拖累泛化。**Moti-1 最终采用 Beta12 语义**。

### 3.2 消融二：训练阶段收益 —— 结构替换 + 联训逐级下降

在 60 个评测块上对三个训练阶段做定量 NLL 对比（仅对回答 token 计损）：

| 阶段 | NLL（回答） |
|---|---|
| 阶段一起点（克隆未训练） | 1.3506 |
| 阶段一完成（纯 RCA 预调后） | 1.3481 |
| **阶段二/三完成（RCA 全参 + LoRA 联训，即 Moti-1）** | **1.3126** |

**结论**：从"结构已换、权重未训"到"纯 RCA 预调"再到"RCA+LoRA 联训"，损失单调下降；最终发布版在只动注意力与 FFN 低秩增量的约束下逼近并超越了起点等效模型，说明 RCA 分支真实承担了注意力职责，而非摆设。

## 4. 评测：六领域对照榜

我们构建了一个 6 领域 × 3 题的对照评测（页面生成 / 数据可视化 / 动画交互 / 小游戏 / 古诗生成 / 日常问答），由强云端模型作对照评委，对 **Moti-1、原版 Qwen2.5-7B-Instruct、DeepSeek-V4-Flash** 三方同题答案进行相对评分（1-100）。

![Moti-1 六领域对照评测](./model_evaluation_moti.png)

| 模型 | 页面生成 | 数据可视化 | 动画交互 | 小游戏 | 古诗生成 | 日常问答 | **均分** |
|---|---|---|---|---|---|---|---|
| **Moti-1（摩谛）** | **64.0** | 14.0 | **49.7** | **38.7** | 54.3 | 38.3 | **43.2** |
| Qwen2.5-7B-Instruct（原版） | 39.3 | 11.3 | 29.3 | 22.0 | **79.7** | **47.0** | 38.1 |
| DeepSeek-V4-Flash（参照上界） | 95.3 | 87.7 | 96.0 | 97.0 | 81.0 | 96.7 | 92.3 |

**要点**：

- Moti-1 总均分 **43.2，高于原版基座的 38.1**——在注意力结构被整体替换的前提下实现了净增益；
- 增益集中在**前端代码生成**方向：页面生成 **+24.7**、动画交互 **+20.4**、小游戏 **+16.7** 均大幅领先原版，说明 RCA 的跨层成品回读对长程结构化代码的组织有实际帮助——此类任务需要"前面定义的类名/样式/变量，后面精确复用"，正是**计算深度随上下文增长**特性的受益场景；
- 古诗生成与日常问答弱于原版，符合"结构性替换存在方向性取舍"的预期，也是后续训练轮次的主攻方向；
- 数据可视化域三方分差极大、方差高，是评测敏感区，我们保留原始数据不做修饰。

## 5. 使用

```python
# Moti-1 发布为合并版权重, 按标准 causal LM 加载(需 trust_remote_code=True)
from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained(
    "ericsjq/Moti-1-7B",
    torch_dtype="bfloat16", device_map="auto",
    trust_remote_code=True)   # RCA 分支由加载器自动回填 fp32, 无需手动转换
tok = AutoTokenizer.from_pretrained("ericsjq/Moti-1-7B")

messages = [{"role": "user", "content": "用SVG画一个会动的机器猫"}]
ids = tok.apply_chat_template(messages, tokenize=True,
                              add_generation_prompt=True, return_tensors="pt").to(model.device)
out = model.generate(ids, max_new_tokens=4096, temperature=0.7,
                     top_p=0.8, top_k=20)
print(tok.decode(out[0][ids.shape[1]:], skip_special_tokens=True))

# 流式生成(与 generate 同一推理路径, 逐 token 产出, 适合前端/服务端):
# for tid in model.generate_stream(ids, max_new_tokens=4096,
#                                  temperature=0.7, top_p=0.8, top_k=20):
#     print(tok.decode([tid]), end="", flush=True)
```

推荐生成参数：`temperature=0.7, top_p=0.8, top_k=20`；前端页面类任务建议 `max_new_tokens ≥ 4096`。

**运行要求**：GPU 显存约 18.6 GB（建议 24GB 卡）。RCA 分支以 fp32 运行（加载时自动回填），这是注意力算子走最优执行路径的必要条件——实测 RTX 3090 上 decode 约 30 tok/s；若强行把该分支降为 bf16 会落入 cuDNN 劣化路径，速度掉一个数量级以上。

## 6. 局限与说明

- 结构性替换带来方向性取舍：开放域闲聊与古典文学方向当前版本弱于原基座；
- RCA 波前按 64-token 块调度，短序列场景收益有限；
- RCA 分支以 fp32 运行，显存峰值约 18.6 GB，高于同尺寸常规 bf16 模型（16 GB 左右）；
- 对照评分为相对分数，会随评委与题集变化，横向比较请在同题集内进行；
- 训练与评测所有数字均为原始记录。

## 7. 引用

```bibtex
@misc{moti1_2026,
  title  = {Moti-1: Recursive Cross-Attention Wavefront Language Model},
  author = {XiaoSi Framework Researchers},
  year   = {2026},
  howpublished = {\url{https://modelscope.cn/models/ericsjq/Moti-1-7B}}
}
```

---

<div align="center">

*Moti-1（摩谛） · 小思框架 - 石京麒*

</div>
