Decision Titan 将测试时训练层接入 Decision Transformer,在 X-Maze 中学会比上下文窗口长 20 倍的长程依赖
核心概要
该工作把测试时训练(TTT)层加入 Decision Transformer,构成 Decision Titan,并在用于检验序列记忆的 X-Maze 环境中分析其性能与记忆机制:模型能学到比上下文窗口长 20 倍的长程依赖,可泛化到训练数据 1.7 倍的长度,但时间泛化取决于所用的时间嵌入,而长程依赖的学习能力取决于相关信息如何被编码。
Figure 1 : The Decision Titan architecture. A trajectory of returns-to-go, states, and actions is projected into a shared embedding space before having positional embeddings added. This sequence is then chunked into subsequences of k k timesteps and n n persistent memory tokens are appended to the front of each chunk. Following this, each chunk is then passed through L L Titans MAL blocks, consisting of a TTT layer that is updated every b b timesteps, followed by self-attention with a window size of 3 k + n 3k+n tokens.
arXiv深度剖析
作者提出 Decision Titan,即在 Decision Transformer 上增加 TTT 层,把 TTT 框架从自然语言处理引入离线强化学习,用网络参数而非向量隐状态来存储情节记忆。 据作者所述,TTT 此前尚未被应用于强化学习,也缺少对其记忆实际运作方式的分析;该工作同时补上应用与机制分析两块。 证据来自在 X-Maze(T-Maze 的扩展,用于检验序列记忆)上的性能与性质分析,以及随时间可视化门控值来观察记忆机制如何学习;摘要未给出具体数值、样本量或对照设置。
Decision Titan 能学到比上下文窗口长 20 倍范围的长程依赖,并可泛化到训练数据 1.7 倍的长度。 这给出了 TTT 记忆在离线强化学习决策任务中可达到的时间跨度与长度外推幅度的具体量级。 来自 X-Maze 环境中的实验测量,摘要以倍数形式报告;具体实验配置与统计细节未在摘要中展开。
时间泛化取决于所使用的时间嵌入,而学习长程依赖的能力取决于相关信息如何被编码。 把记忆效果归因于两个可设计因素——时间嵌入与信息编码方式,而非仅归因于 TTT 层本身。 来自对模型性质的分析与门控值随时间的可视化;摘要未给出各因素的具体对比数值。
启示与展望
该结果面向离线强化学习中的序列决策,尤其是需要跨越较长历史才能正确行动的记忆型任务,X-Maze 正是为此设计的 T-Maze 扩展。对从事长程记忆架构、离线强化学习或序列建模的研究者与工程师而言,它提示可以把情节记忆放进网络参数、在训练与测试时都通过梯度下降更新,并据此设计超出上下文窗口的时间跨度。适用前提是任务的相关信息能够以该框架可编码的形式呈现,且时间嵌入的选择与任务的时间结构相匹配。
摘要只报告了倍数形式的结论,未说明 X-Maze 的具体规模、训练数据量、基线对照与随机种子等设置,因此 20 倍与 1.7 倍这两个量级在何种条件下成立仍是开放问题。时间嵌入与信息编码方式各自的影响幅度、门控值可视化所揭示的记忆机制细节,也需要在原文中进一步确认。此外,结论目前限于离线强化学习与 X-Maze 这一记忆型环境,向其他任务与在线设定的推广尚待检验。
