大晓机器人与南洋理工S-Lab联手,Puffin-World开启机器人三维环境训练新范式

   时间:2026-09-10 23:24 来源:互联网作者:顾雨柔

大晓机器人携手南洋理工大学S-Lab等机构,共同推出并开源了统一多模态世界模型框架Puffin-World,为空间智能与具身智能领域带来突破性进展。该框架首次将物理、几何和外观整合为三维世界的三种原生状态,构建了一个涵盖重力场感知、自由视点空间仿真、三维生成与重建以及闭环探索的完整系统,能够精准预测机器人行动后的世界状态变化。

Puffin-World的核心创新在于其统一的多模态架构。物理状态通过重力场与纬度图定义相机在真实世界中的绝对朝向;几何状态利用深度信息解析场景的三维结构与空间关系;外观状态则对应相机捕捉的RGB图像。三者共同构建了从"世界存在方式"到"交互逻辑"的完整表达体系。在生成新视角时,模型不仅需确保画面视觉合理,还需严格符合物理方向与三维结构约束。

为解决跨视角运动中的方向统一问题,研究团队提出Omni-Camera相机表示法。该技术将重力锚定的绝对相机信息与射线相对几何相结合,通过物理传播机制实现重力信息在连续视角中的稳定传递。实验表明,即使相机经历复杂旋转轨迹,生成画面的地平线仍保持稳定,场景上下关系与相机轨迹高度一致,有效避免了传统方法中常见的运动失真问题。

该框架突破性地实现了四大功能的统一:单图即可解析相机物理参数与场景语义;支持用户精确指定相机方向生成目标画面;能够从文字或图像生成具有一致空间结构的三维世界;更可形成"状态感知-动作预测-结果生成"的闭环探索系统。这些能力均基于统一的视觉-语言-相机表征体系,通过输入条件与视图角色的动态调整实现任务切换,更贴近机器人实际工作链路。

训练数据方面,研究团队构建了包含1500万组视觉-语言-相机三元组的Puffin-Cam-15M数据集,覆盖室内外、真实合成等多元场景,每组数据均标注相机姿态与视场角信息。配套的Puffin-Traj-1M数据集则提供100万条复杂旋转轨迹,包含360度环视等挑战性场景,重点强化模型对大幅旋转与长轨迹的理解能力。团队还为28个公开数据集补充了约4450万张图像的绝对相机位姿标注,为行业提供了大规模监督训练资源。

在基准测试中,Puffin-World展现出显著优势:在Stanford2D3D等四个相机理解基准上取得最佳中位误差,横滚角误差低至0.29度;在相机可控生成任务中,上方向误差仅0.84度,FID指标达75.93;三维世界生成测试的PSNR指标达17.22,视觉一致性显著优于对比方法。这些成果验证了框架在物理理解、空间控制、几何生成与三维重建间的协同优化能力。

目前,Puffin-World已完整开源代码、模型与数据集,涵盖从数据标注到模型评测的全技术链路。这一举措为机器人仿真、合成数据生成、虚拟现实等领域的研究提供了可复现的技术底座,有望推动世界模型从视觉内容生成向可感知、可校准、可探索的三维环境预测范式转变。

 
 
更多>同类内容
全站最新
热门内容