---
title: Granite-1B-LoopAttnRes
canonical_url: "https://www.modelscope.cn/models/tysgydk/Granite-1B-LoopAttnRes"
md_url: "https://www.modelscope.cn/models/tysgydk/Granite-1B-LoopAttnRes.md"
repository: tysgydk/Granite-1B-LoopAttnRes
chinese_name: "跨轮注意力残差循环改造模型"
last_updated: 2026-08-28
license: "Apache License 2.0"
pipeline_tag: text-generation
tasks:
  - text-generation
base_model:
  - ibm-granite/granite-3.0-1b-a400m-base
base_model_relation: finetune
parameters: 8.0B
tensor_type:
  - BF16
library_name:
  - safetensors
  - pytorch
frameworks:
  - PyTorch
language:
  - zh
downloads: 22
stars: 0
---

# Granite-1B-LoopAttnRes

> Granite-1B-LoopAttnRes - tysgydk 在 ModelScope 开源的模型。将 Kimi 的块级注意力残差（AttnRes）嫁接到字节 Seed 的循环架构（Ouro）上，并原创改造为跨轮注意力残差（第 R 轮可定向检索之前所有轮次的块摘要）。基于 IBM Granite-3.0-1B-A400M 继续预训练 98.3M token，包含 4 组严格对照（G0 无循环 / G1 朴素循环 / G2 轮内残差 / G3…

tysgydk/Granite-1B-LoopAttnRes 是 ModelScope 魔搭社区上的 8.0B 参数text-generation模型，采用 Apache License 2.0 许可，基于 ibm-granite/granite-3.0-1b-a400m-base 构建。

- **Repository**: tysgydk/Granite-1B-LoopAttnRes
- **License**: Apache License 2.0
- **Tasks**: text-generation
- **Parameters**: 8.0B
- **Base model**: ibm-granite/granite-3.0-1b-a400m-base
- **Downloads**: 22
- **Stars**: 0
- **Last updated**: 2026-08-28

Source: https://www.modelscope.cn/models/tysgydk/Granite-1B-LoopAttnRes

---

# Granite-Loop-AttnRes: 循环深度 × 跨轮注意力残差消融模型

一组基于 IBM granite-3.0-1b-a400m-base (MoE, 总参 1.33B / 激活 ~400M) 的对照微调模型,
验证"跨轮 AttnRes"结构: 循环计算的后续轮次中, 注意力残差不仅能看到本轮正在演算的块,
也能定向提取之前轮次的块。思想来源: 月之暗面 AttnRes (2025.03) + 字节 Ouro 衔尾蛇循环架构。

## 模型列表

| 目录 | 配置 | 状态 |
|---|---|---|
| loop-g0 | R=1 无循环对照 (single-pass baseline), LR 1e-5 | 正式对照 |
| loop-g1 | R=4 纯循环, LR 1e-5 | |
| loop-g2 | R=4 + 轮内 AttnRes (intra-round), LR 1e-5 | |
| loop-g3 | R=4 + 跨轮 AttnRes (cross-round, 本文方案), LR 1e-5 | |
| loop-g3-r2 | loop-g3 的同配置续训版 (+800 步 / +52.4M token) | 训练量演化分析用 |
| loop-g0-lr2e5-deprecated | R=1, LR 2e-5 (配置失误版本) | 失败品, 仅供审计 |

注意: loop-g0-lr2e5-deprecated 是早期学习率配置失误的产物 (2 倍于其他组),
其 val/GSM8K 优势大半来自学习率而非结构, 正式结论一律以 loop-g0 (1e-5) 为准。
保留它仅为实验透明性。

## 训练

- 语料: 98.3M token (75% 中文 + 25% 英文/代码), 块长 2048
- 1500 步, 有效 batch 32 块 (≈65.5K token/步), 种子 42
- AdamW (0.9, 0.95), wd 0.1, grad clip 1.0, warmup 100 步, 余弦退火至 LR/10

## 核心评测 (final)

| 模型 | val loss | GSM8K-200 | CMMLU-2000 | LogiQA-651 | passkey-60 |
|---|---|---|---|---|---|
| 底座 | 1.5905 | — | — | 25.7% | — |
| loop-g0 | 1.4147 | 15.5% | 23.9% | 22.1% | 7/60 |
| loop-g1 | 1.5527 | 8.5% | 26.6% | 25.3% | 0/60 |
| loop-g2 | 1.4133 | 16.5% | 24.2% | 21.7% | 5/60 |
| loop-g3 | 1.4517 | 13.0% | 24.1% | 25.0% | 5/60 |
| loop-g3-r2 | 1.4239 | — | — | — | — |

loop-g3-r2 (续训 +800 步) 机制指标对比 loop-g3:
- val 固定子集 1.4517 → 1.4239 (与 G2 差距收窄 70%)
- 跨轮提取签名强化: 读旧轮时中间过程块偏好更鲜明 (峰值 5.05% vs 结论块 1.76%)
- passkey 首 token logprob 整体上移 ~0.77 nats, 末轮仍最优
- 轮间余弦活性保持 (0.034/0.004/0.009), 无坍缩

下游任务在 98M token 量级四组同档 (随机线附近), 核心证据在表示几何:
- 轮间 hidden 余弦距离: G2 ~0.001 (循环坍缩空转) vs G3 0.039/0.006/0.007 (活性 6~7 倍)
- G3 跨轮注意力偏好提取旧轮次的浅-中深度块 (中间计算过程), 非"抄结论"偷懒
- passkey 首 token logprob 探针: G3 逐轮单调改善, G1 恶化, G2 不动
- 坍缩 (G2) 与活性 (G3) 的结构在前 500 步内定型, 之后全程稳定

## 使用

权重不能直接用 transformers 加载, 需要自定义建模代码 modeling_granite_loop.py
(见配套 GitHub 仓库), 加载方式:
  from modeling_granite_loop import GraniteLoopForCausalLM
  model = GraniteLoopForCausalLM.from_pretrained("loop-g3")

## 许可

底座 IBM granite-3.0-1b-a400m-base 为 Apache 2.0, 本组权重随同 Apache 2.0 发布。
训练代码与评测脚本见配套 GitHub 仓库。

## 致谢

- 月之暗面 AttnRes 论文 (注意力残差新构)
- 字节跳动 Ouro (衔尾蛇循环架构)
- IBM Granite 团队 (底座模型)
