
本文首发于「山野村夫 AI 工程笔记」。完整论文请参见 DOI: 10.5281/zenodo.20541393。
大模型的核心瓶颈之一是注意力机制的显存开销——标准 Transformer 要算一个 L \times L 的大矩阵,序列越长越爆炸。
我们设计了一种叫 CubeAttn 的新算子:完全不做跨 token 矩阵乘法,改用「特征维度全局聚合」来实现信息传递。简单说:
关键区别:softmax 作用在特征维度 D 上,而非序列维度 L 上。没有任何 [B, L, L] 的张量出现过。
听起来很美好,但它真的能用吗?我们用合成任务做了三轮越来越严格的实验,结果发现了一些完全出乎意料的东西。
第一轮实验(3000 步),CubeAttn 在两个任务上表现很差:
当时我们的结论是:「单向量全局聚合有结构性缺陷」。
第二轮实验把训练步数从 3000 翻倍到 6000 步。结果:
基线 CubeAttn 的 Induction Head 从 31.6% 飙升到了 100%。
什么结构都没改,只是多训练了一会儿,瓶颈就消失了。所谓的「结构性缺陷」,其实是训练不够。
但更诡异的是:同一个模型,逆序拷贝(Reversed Copy)准确率反而从 97% 暴跌到 47%。
多训练不是应该更好吗?为什么一个任务变好了,另一个变差了?
答案是容量饱和:只有一个全局向量时,模型学好了 IH,就没空间同时记住 RC 了——它们在抢同一个「带宽」。
单一训练步数下得出的「结构性瓶颈」结论,可能只是训练预算假象。
这是整个实验最反直觉的发现。
CubeAttn 除了全局聚合,还有一个局部卷积(类似 CNN 的滑动窗口)。窗口大小 k 是一个超参数。
在 CNN 和 Transformer 的经验中,k=7 通常被认为是最优窗口——不大不小,刚刚好。
我们测了 k = 3, 5, 7, 9, 11, 15,得到这样的结果:

k=5 到 k=11 全线崩溃,Induction Head 准确率跌到 20–49%。而 k=3 和 k=15 都稳在 96% 以上。
这是一条 U 型曲线:两头行,中间死。
CubeAttn 有两条信息通道:全局聚合(全局向量)和局部卷积(滑动窗口)。
中间地带是梯度干扰的死亡区。
在全局+局部双通道架构中,「中等窗口最优」的经验不再成立。有效区间只有两档:k≤3 或 k≥15。
这是方法论的发现,对所有做线性注意力研究的人都有参考价值。
前面所有实验都是用 seed=42 跑的——这是机器学习社区的默认种子。
5-seed 验证后,真相浮出水面:
任务 | seed=42 | 5-seed 均值 | 差距 |
|---|---|---|---|
LRR (k=15) | 16.8% | 11.6% ± 3.9% | 高估 45% |
IH (k=15) | 96.9% | 55.9% ± 32.4% | 高估 73% |
seed=42 恰好是所有种子中最好的那个。如果你只跑一次实验就写论文,你的数据是最乐观的情况,不是真实水平。
Induction Head 更夸张:同一个架构、同一个超参数,只换随机种子,准确率从 11.7% 到 96.9%,波动超过 80 个百分点。
这不是模型能力,这是初始化彩票。

Reversed Copy 在所有 10 种配置(5 seed × 2 kernel)下都是 100%,零方差。
这给了我们一个极其干净的诊断工具——模式解耦。
所有线性注意力论文,至少跑 5 个 seed,报告均值 ± 标准差。单 seed 结果在统计上不可靠。
RC 全 seed 100%,LRR 却在 6–17% 之间乱跳。两者都需要位置信息,为什么天差地别?
Reversed Copy 只需要知道「谁在谁前面」——相对位置。CubeAttn 的聚合 V 机制已经完美编码了这一点。
Long-Range Recall 需要知道「这个 key 出现在序列的第几个位置」——绝对位置绑定。而 CubeAttn 目前的位置编码(RoPE 加在输入层)在逐层传播中衰减,无法稳定编码远距离位置。
这就是模式解耦:两个看似相似的任务,瓶颈完全不同。

看看热力图:左边两列(Copy、RC)全绿,右边两列(IH、LRR)参差不齐——模式解耦一目了然。
把 Phase 0(3000 步)和 Phase 1(6000 步)的 Induction Head 轨迹画在一起:

灰色曲线是 3000 步的基线——结束时才 30% 多。蓝色曲线是 6000 步的基线——继续训练后一路冲到 100%。红色是加了结构改进的变体,在中间一直领先。
这条图告诉我们:画结论之前,先确认你的训练真的收敛了。
CubeAttn B+ 默认配置:kernel=3,聚合 V,4 个全局 token,mean 融合。
指标 | 结果 |
|---|---|
Copy | 100%(全 seed) |
Reversed Copy | 100%(全 seed) |
IH | 5-seed 均值 ~54%(单 seed 可达 100%) |
LRR | 5-seed 均值 ~10%(vs Softmax 27.3%) |
k=3 和 k=15 在 LRR 上统计无差异(差 1.2pp < 一个标准差),但 k=3 计算更快、显存更低。
LRR 的 ~11% 上限是当前位置编码机制锁死的。训练加长没用,窗口调整没用。
解决方向:把位置编码从输入层移到 \phi 映射内部,让位置信息直接参与特征维度的全局竞争,不在逐层传播中衰减。
目标:128M 小模型上 5-seed LRR 均值 ≥ 20%,然后启动 1.8B 预训练。
完整论文(V3,含四张原图):
Ruan, Y. (2026). CubeAttn: Training Dynamics, Kernel Failure Modes, and Seed Sensitivity in Linear Attention (Version v3). Zenodo. https://doi.org/10.5281/zenodo.20541393
永久 DOI:https://doi.org/10.5281/zenodo.20541393
代码与数据:github.com/ahua2020qq/cubiformer
山野村夫 AI 工程笔记 | 2026.06