NFRA(Nonlinear Factorized Recurrent Attention,非线性分解循环注意力)是一种高效的循环语言模型模块。它是一个深度共享的循环模块,由衰减式查询-键保留混合器和逐 token 的接收门,加上 SwiGLU 前馈网络构成。该设计将 RetNet 风格的保留机制与 RWKV 风格的接收读取门结合。在相同数据和参数量匹配的情况下,它在下一 token 损失上优于两者,同时内存占用远低于完整的 Transformer。NFRA 面向在普通硬件上进行 LLM 研究与部署,包括在单块小型 GPU 上进行下一 token 预测、序列建模和自回归生成。它可作为与 Transformer 和 SSM 基线对比的即插即用对象。精简的默认配置使用保留机制、接收门和 SwiGLU;完整的 3.3b 模块通过开关保留以便复现,但不是推荐的架构。
团队用 NFRA 在单块小型 GPU 上进行下一 token 预测。
团队用 NFRA 进行序列建模。
团队用 NFRA 进行自回归生成。
团队把 NFRA 作为与 Transformer 和 SSM 基线对比的即插即用对象。
团队用 NFRA 快速运行公平的一对一基准测试。
团队用 NFRA 运行经过验证的多阶段基准测试。
团队用 NFRA 在 WikiText-2 字符数据上与 RetNet、RWKV 和 GPT-2 对比。
团队用 NFRA 在普通硬件上进行 LLM 研究与部署。