9月24日,清华大学联合无问芯穹正式开源具身智能云原生纳管平台RLark。该平台以自研具身设备运行时与任务级跨集群网络互联技术为核心,将机器人、相机、云端算力及边缘节点纳入统一资源体系。实测数据显示,设备纳管时间从小时级缩短至约5分钟,任务提交后10秒内即可启动运行。
具身智能规模化研发长期面临基础设施层面的瓶颈。机器人型号分散、通信协议各异,设备接入耗时费力;跨地域、跨集群训练与推理任务对网络调度提出苛刻要求;训练、推理、真机交互程序的部署流程复杂,难以复用。
RLark的定位正是解决上述问题的“调度中枢”。该平台通过统一管理机器人、相机等具身设备的运行时环境,使设备可以像GPU一样被申请、调度和复用。运维人员通过一行命令即可接入并管理设备,研究人员提交一份任务配置,就能将训练、推理和真机交互程序部署至不同集群。
RLark的两大技术支柱是自研的具身设备运行时(embodied-runtime)和任务级跨集群网络互联技术。
前者负责屏蔽底层硬件差异,为异构设备提供统一的运行时环境;后者则根据任务类型及网络流量特征,对跨集群通信进行任务级隔离,并优化大小包传输性能。二者结合,使分散的机器人、相机、云端算力和边缘节点能够被当作一个整体资源池进行管理和调度。
据公开信息,RLark目前已在3个集群、近百个云边端节点上完成统一纳管验证,覆盖4种型号的具身设备。在性能指标上,设备纳管时间由小时级缩短至约5分钟,任务提交后可在10秒内启动运行。
值得注意的是,一次实验中完成的设备接入、部署和通信配置,可在后续任务中直接复用,这意味着RLark能够有效降低重复性的基础设施操作成本。
RLark的跨地域调度能力已在实际场景中经受检验。结合强化学习框架RLinf,平台在广东云端GPU集群与北京机器人现场之间完成了“采集—训练—真机验证”闭环。实测中,该系统连续运行约36分钟,完成323个训练步骤,验证了跨地域协同训练的可行性。
RLark开源项目地址为github.com/RLinf/RLark,文档地址为rlark.readthedocs.io。此次开源并非部分模块的开放,而是将UI、API、后端、任务编排、跨集群互联、运行时全套能力一并开放。这意味着研究团队无需从零搭建基础设施,即可在RLark之上构建自己的具身智能研发流程。
从行业视角观察,当前具身智能领域的竞争焦点集中在模型能力与硬件迭代,但基础设施层的碎片化正在成为规模化落地的隐性瓶颈。RLark的价值在于将“设备即资源”的理念落地,让机器人像云服务器一样被动态分配和调度。
值得注意的是,无问芯穹此前(9月15日)已联合清华、上海交大开源了具身端侧推理引擎APXInf。从端侧推理引擎到云原生纳管平台,这一系列布局显示出其在具身智能基础设施方向的系统性投入。在笔者看来,具身智能的“基础设施卡位战”已经开始,而开源路线将决定这场竞赛的节奏与格局。
需要说明的是,RLark初期验证规模仍属有限,其在大规模异构设备组网下的稳定性、跨地域网络延迟对训练效率的实际影响,仍需要更多外部研究团队在真实场景中检验。