一个层,两种数学视角
先逐项核对离散矩阵,再把同一组状态看成沿网络深度演化的函数。连续视角来自算子拆分框架,是对经典 Transformer 的一种数学解释,不是模型在芯片上的实际连续运动。
3 个位置、d=4、2 个 Q 头共享 1 个 KV 头、单头维度 2、MLP 维度 6。全部为固定人造权重,计算顺序对照 Qwen3;数值不是实际模型输出。
因果性检查
拖动最后位置的输入。掩码开启时,前两个位置的最终输出相对基线应保持不变;关闭掩码会成为允许读取未来的反事实实验。
查看本次数值与全部玩具权重
核心映射:Token 位置是 x,特征维度是 y,网络深度被建模为 t,隐藏状态写成 u(x,y,t)。一层网络可以视作连续演化的一次离散时间步。
状态如何沿“深度时间”演化
输入状态 u(x,y,0)。拖动滑块,观察同一组离散计算结果之间的连续插值。
x · Token 位置y · 特征维度t · 网络深度
曲面使用左侧数值实验的真实玩具张量,并在离散子步骤之间插值。平滑运动只帮助观察状态变化;实际 Transformer 按离散算子执行。
Attention:从离散求和到非局部积分
离散模型对 Value 做加权求和;连续框架把 Token 轴上的求和推广为积分。两者表达的是同一种“从远处取回信息”的结构。
离散注意力矩阵 γ(x,x̃)
当前查询的权重分布
归一化:投影视角与现代实现
论文把经典 LayerNorm 解释为投影到具有指定均值与方差的约束集合;Qwen3 实际采用 RMSNorm,不减均值。下面用同一输入并排比较,避免把两者混为一谈。
经典 LayerNorm · 约束投影
Qwen3 RMSNorm · 保留均值方向
这一视角能解释什么,不能解释什么?
它为经典 Transformer 的 Attention、LayerNorm、前馈层和层级组合提供统一的算子解释。它不是硬件执行模拟,也不自动覆盖 RoPE、GQA、SwiGLU、RMSNorm、MoE 或稀疏 KV 等现代机制。现代部分仍应以离散公式、模型配置和实际实现为准。