9月21日,由清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施RPent正式开源。该系统面向真实物理世界,将通用大模型的任务理解与规划能力、VLA等专家模型的精细操作能力,以及记忆、工具和机器人接口连接成完整闭环,使智能体能够持续适应环境变化。官方数据显示,RPent在LIBERO-PRO基准测试中达到92.6%的任务成功率,并将端到端任务完成速度优化7倍以上。
RPent的核心技术思路,是构建一个“观察—规划—执行—反馈—再规划”的闭环系统。在这一架构中,通用大模型充当“决策大脑”,负责理解任务目标并拆解执行步骤;VLA等专家模型则负责精细操作,处理具体动作控制;记忆模块和工具调用能力则让智能体在连续任务中积累经验,并在新一轮执行中调用此前验证过的策略。
据开源代码仓库信息,RPent由具身强化学习框架RLinf核心团队打造,代码托管于GitHub平台。此前,无问芯穹联合清华大学已于2026年7月16日发布RLinf v0.3版本,该项目在GitHub上已获得4100余个Star,并被英伟达Isaac Lab收录。
在基准测试表现方面,RPent在LIBERO-PRO基准测试中达到92.6%的任务成功率,端到端任务完成速度提升7倍以上。LIBERO-PRO是面向机器人操作任务的基准测试体系,相较于常规LIBERO基准,更强调任务定义的长尾分布与泛化性要求。
值得关注的是,此次发布的真机demo展示了多个开放式任务场景,包括钢珠倒碗、双臂擦盘、移开遮挡物找勺子、按标签分装饮料等。据官方介绍,这些任务并非为每种场景单独训练专用策略,而是由机器人在理解任务目标后,自主调用能力并根据环境变化调整行动。例如,当任务变化为“将干净餐具放入纸箱”时,智能体会先观察当前环境,再根据新的目标选择放置位置;执行过程中,如果视觉定位出现偏差,系统会通过反馈机制进行纠正。
此次开源的联合发起方中,清华大学与无问芯穹在具身智能领域合作已久。无问芯穹作为AI基础设施公司,与清华团队在强化学习框架方面有持续的技术积累,RPent即延续了RLinf的技术路线。正行创新则是此次联合中相对新锐的力量——据公开工商信息,正行创新(北京)科技有限公司成立于2026年2月12日,注册资本500万美元,法定代表人姚颂,为正大机器人全资子公司,已完成近亿美元天使轮融资。
据报道,RPent支持GPT-6 Astra等通用大模型接入,并兼容Franka等真机设备,同时提供FlashMode、Leaderboard等功能模块。这意味着开发者可以在RPent框架下,接入不同的通用大模型进行任务规划,并通过对真实机器人设备的支持,将仿真环境中的策略迁移到物理世界。
从技术路线看,RPent的出发点是解决具身智能体在开放环境中面临的核心问题:如何让机器人不再局限于执行预编程的动作序列,而是能够理解新任务的语义目标,并在执行过程中根据环境反馈动态调整自身行为。这一方向指向的是机器人从“专用工具”向“通用智能体”的演进路径。
RPent的代码仓库显示,该项目由RLinf核心团队持续维护,此次开源意味着其技术栈向开发者社区开放。分析认为,将强化学习框架与机器人基础模型相结合,并以开源方式输出,有助于降低具身智能领域的研究门槛——开发者可以在统一框架下完成仿真训练、策略迁移和真机部署。
从demo展示的场景来看,RPent所强调的并非单一任务的精度突破,而是任务定义变化时系统的适应能力。这种在物理世界中“理解任务—调整行动”的能力,与当前大模型在语言和视觉任务中展现出的泛化特性形成呼应。可以推断,将通用大模型的推理能力引入机器人控制回路,正在成为具身智能技术演进的一个实际方向。而RPent选择以开源方式发布,也让外界得以观察这一方向在实际系统中的具体实现形态。