当前步骤x₁
合并输入et + st−1
Decoder 读取M≤t + CDt−1
完整写回Ht = (st, CDt)
RECURRENT LOOPED TRANSFORMER
沿 Token 时间轴追踪三条不同的“记忆”:全局编码器记忆、局部 Decoder KV,以及跨 Token 延续的隐藏状态。
COMPLETE-STATE RECURRENCE
点选任一 Token,查看它读取了什么、写回了什么。移动边界只改变标签,不改变计算。
THREE MEMORY ROLES
下面显示被选 Token 更新完成后的概念容量;格子代表位置,不代表字节数。
M≤t,随前缀增长
由 Encoder 表征投影出的 K/V,供 Decoder cross-attention 读取。
CDt,每层独立
最多保留 W−1 个历史位置;旧位置被逐出后仍可能已写入状态。
st,固定一个向量
它不是历史 Token 列表,而是压缩后的连续中间状态。
Encoder Memory 提供全局上下文,Decoder SWA KV 提供最近的 Decoder 激活,st 延续跨 Token 的隐状态。三者不可互相替代。
CURRENT-POLICY REPLAY
这是论文定义的训练一致性要求,不是性能对比。
保存 Token 与真实行为概率 log μ;隐藏状态和 KV 只对应当时的参数。
同一段文本,在新参数下通常会产生不同的 Encoder KV、st 与 Decoder KV。
保留旧 log μ 作分母;用当前参数完整回放 Prompt 与已采样 Response,得到 log pΘ。
点击按钮查看证据链。
状态转移、缓存语义、因果性与回放流程。
tLD 路径深度、每 Token 逻辑 block 数和缓存阶数。
更强推理、更好硬件利用率、可靠 RL 扩展;尚待实验验证。
本页动画与格子图为原创教学重绘,不运行 RLT 模型。