普林斯顿学者提出 RLT 架构:通过状态传递实现 Transformer 的无界时序深度

Recurrent Looped Transformer (RLT) architecture proposed by Princeton researcher

长期以来,Transformer 架构一直是自然语言处理(NLP)领域的基石,但在处理超长序列时,其显存占用和计算开销成为了难以逾越的瓶颈。为了突破这一限制,普林斯顿大学的研究员 Yifan Zhang 近日提出了一种名为“循环循环 Transformer”(Recurrent Looped Transformer,简称 RLT)的新型架构方案。该方案旨在通过一种新颖的状态传递机制,赋予模型无界的时序深度。

RLT 的核心设计在于引入了一个“因果编码器”与“循环解码器”的协同工作模式。与传统 Transformer 在每个时间步重置注意力缓存不同,RLT 的解码器在每个标记生成后,会将其最终隐藏状态以及层级的滑动窗口注意力缓存传递给下一个标记。这种设计意味着模型在处理连续的提示和响应时,能够维持一种连续的记忆流,而无需在服务边界处进行重置。这种机制有效地解决了传统模型在长上下文任务中面临的“遗忘”问题。

在具体的架构实现上,参考配置显示 RLT 使用了 48 层编码器和 48 层解码器。这种配置不仅保证了模型的深度,还通过每标记 96 个逻辑块(Logical Blocks)的执行方式,展示了极高的计算密度。值得注意的是,随着处理标记数量的增加,解码器的状态路径会线性增长至 48t(t 为标记数),这种设计使得模型能够处理极其复杂的长篇逻辑推理任务,同时保持了计算效率的平衡。

此外,该技术报告还特别强调了硬件感知的执行策略。由于 RLT 的状态路径随时间增长,这对 GPU 等加速硬件的内存带宽提出了挑战。因此,研究者在设计上考虑了如何优化硬件利用率,以适应这种递增的状态流。同时,RLT 还被设计为与强化学习(RL)策略兼容,特别是精确的当前策略 RL 重放契约,这为未来在复杂交互场景中的应用提供了可能性。

目前,该技术报告尚处于理论验证阶段,尚未发布代码、权重或实际的性能测试数据。然而,这一架构的提出无疑为解决大语言模型(LLM)的长上下文限制提供了一个极具潜力的新思路。如果后续能够成功落地,RLT 有望彻底改变我们构建对话式 AI 和处理超长文档的方式,推动 AI 智能向更深层次的信息理解迈进。

信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/09/13/a-princeton-researcher-proposes-recurrent-looped-transformer-rlt/

封面图片来源:Unsplash / 摄影师 Brett Jordan

oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注