大晓机器人携手港大推出StreamPI,为机器人时序理解开启时空智能新篇

   时间:2026-08-28 20:13 来源:互联网作者:陆辰风

在机器人技术领域,大晓机器人与香港大学联合发布了一项名为StreamPI(Streaming Multimodal Temporal Modeling for Vision-Language-Action Models)的全新研究成果,这一突破性进展为解决视觉-语言-动作模型(VLA)长期存在的“单帧智能”瓶颈提供了关键方案,成功为VLA补上了至关重要的“时间维度”。

传统VLA主要依据当前观测进行独立决策,这种“单帧智能”模式限制了机器人的能力。而StreamPI则为模型构建了持续的多模态时序上下文,使机器人能够记住过去、理解状态变化、判断任务进程,还能利用跨帧信息增强精细空间感知与动作决策能力。它推动VLA从单纯“识别当前状态”,迈向“理解正在发生的物理过程”,让机器人对世界的认知从静态画面转变为动态的时间流。

在技术实现上,StreamPI并未采用依赖额外参数堆叠来获取时序能力的方式,而是基于现有的VLA骨干,通过指令持续锚定、历史信息流式缓存与随机时间间隔训练,实现了从单帧决策到连续时序建模的轻量化扩展。这种创新方法避免了因参数堆叠带来的复杂问题,同时保证了模型的高效运行。

真实机器人实验以及在LIBERO、CALVIN等实验环境中的测试结果显示,StreamPI在时序记忆、精细空间操作与长程连续任务等方面取得了显著提升。以“猜杯子”任务为例,物体被藏入杯子并经过多次交换后,答案存在于整个变化过程而非最后一帧,传统单帧决策的机器人难以应对,而StreamPI赋能的机器人能凭借对历史信息的理解准确判断。在滚动物体场景中,单帧只能确定物体位置,连续观测才能理解其运动趋势,StreamPI让机器人真正理解了“物体正往哪里去”。

在给VLA加入时间信息的方法上,以往简单将过去多帧图像组成窗口一次性交给模型的方式存在诸多弊端。历史帧越多,视觉信息量越大,不仅需要反复计算已处理画面,增加推理开销,还易使任务指令被大量视觉信息稀释,导致机器人在长程执行中“忘记目标”。

StreamPI则采用了更科学的方法,它将每个时刻组织为“视觉观测 + 任务指令”的完整时序单元。语言指令持续绑定每次观测,成为贯穿任务始终的语义锚点,让机器人在接收新信息时始终明确目标。在时序单元内部,视觉与语言充分交互;不同单元之间按时间顺序持续读取和聚合历史信息,使模型既能理解当下所见,又能追溯过去发生的事,将离散的单帧判断连接成连续的时序理解。

为了让机器人拥有记忆的同时避免重复计算历史,StreamPI采用流式推理。首帧观测编码后存入键值缓存,后续只需处理新信息并调用历史表示,避免了重复计算整个观测窗口。而且,StreamPI无需额外引入视频编码器或独立记忆模块,通过重构原有VLA的注意力机制,直接继承π0.5的视觉—语言表征能力,在不增加额外模型参数的情况下,让单帧VLA获得连续时序能力。

真实机器人的运行环境复杂,相机采集、模型推理、通信与机械臂执行等环节都会产生延迟,导致观测时间波动,只在固定间隔数据上训练的模型在部署时易遭遇时序分布差异。为此,StreamPI引入随机时间间隔训练,随机改变历史观测间的时间距离并隐藏部分早期信息,让模型适应不同时间跨度和不完整上下文,学习更稳定的时序关系。

实验数据充分证明了StreamPI的有效性。在LIBERO上,随机时间间隔训练策略将三帧输入时的平均成功率从96.4%提升至97.5%,五帧输入时从97.0%提升至98.3%。在更依赖长程上下文的LIBERO - Long任务中,成功率从π0.5的92.4%提升至95.0%。在CALVIN上,StreamPI平均连续任务长度达到4.547,超过π0.5的4.313和MemoryVLA的4.090;任务推进到第五步时,成功率仍达85.0%,高于π0.5的79.5%。

团队还设计了四项真机任务检验StreamPI的时序记忆与精细空间感知能力,每项任务采集100条人类遥操作示范。在“猜杯子”任务中,StreamPI将π0.5的成功率从46.7%提升至80.0%;在滚动物体抓取任务中,从26.7%提升至63.3%。在强调空间精度的窄瓶口插笔任务中,成功率从40.0%提升至66.7%;纸杯插入杯套任务则从60.0%提升至92.0%。这些数据表明,时间不仅为机器人带来记忆,还帮助它更准确地理解空间。

StreamPI的出现,标志着机器人从基于当前状态决策迈向基于连续过程决策的重要转变。它让机器人对现实世界的认知不再局限于彼此孤立的静态画面,而是能够记忆、理解和持续更新时间流中的信息。目前,StreamPI在超长时间跨度训练和极端异步场景下仍有提升空间,但它的探索为机器人技术的发展开辟了新的道路,推动具身基础模型从空间智能向真正面向动态物理世界的时空智能迈进。

 
 
更多>同类内容
全站最新
热门内容