普林斯顿研究员提出RLT架构 解决Transformer上下文计算痛点

近日普林斯顿大学研究者发布全新Transformer变体架构Recurrent Looped Transformer(简称RLT),该架构可实现跨token传递解码器状态,单token可绑定96个计算块,同时支持无界时间深度,可大幅降低长上下文生成场景的计算损耗,为大语言模型的长文本处理、多轮交互等落地场景提供了全新的技术优化路径。

当前大语言模型的长上下文能力已经成为厂商核心竞争点,不管是OpenAI的GPT-4o、Anthropic的Claude 3还是国内的DeepSeek、通义千问,都在不断刷新官方标注的上下文长度上限。但传统Transformer架构的计算成本会随上下文长度增长呈近似线性上升趋势,Decoder端无法复用历史计算状态的痛点,使得很多号称支持百万token上下文的模型,实际落地时的推理成本是普通短文本场景的3-5倍,很难实现大规模商用。

这次提出的RLT架构核心创新点,就是打破了传统Transformer每个token独立计算解码器状态的逻辑,可将前序token的解码器状态直接传递到后续token的计算流程中,不需要重复计算历史信息的注意力权重。目前公开的测试数据显示,RLT单token最高可绑定96个计算块,同时支持无界时间深度,也就是说理论上上下文长度不再受计算资源的硬性限制,长文本生成场景下的推理效率较传统Transformer提升4倍以上。

RLT的出现相当于为大模型架构优化开辟了新的分支方向,不需要依赖显存扩容、量化压缩等工程化补全手段,仅靠架构原生设计就能实现长上下文能力的跃升。未来7B、14B这类中小参数模型也可依托RLT架构实现十万甚至百万级别的上下文能力,进一步降低大模型的落地门槛,在法律文档分析、多轮智能客服、长视频内容理解等场景的商用落地速度有望提前1-2年。

免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。