盈胜优配 大晓发布统一多模态世界模型,可预测机器人行动后的世界

作者:admin 发布时间:2026-09-15 05:52:58

盈胜优配 大晓发布统一多模态世界模型,可预测机器人行动后的世界

元股证券:ygzq.hk

重庆股票证券配资

9月10日,大晓机器人发布消息,联合南洋理工大学S-Lab等机构发布并开源统一多模态世界模型框架Puffin-World。作为面向空间智能与具身智能的成果,Puffin-World首次在一个统一多模态框架中,将物理、几何和外观定义为三种原生的三维世界状态,并贯通重力场感知、自由视点空间仿真、三维世界生成与重建以及闭环探索,预测机器人行动后世界将处于什么状态。

Puffin-World同步开源代码、模型和Puffin-16M数据集,包括1500万组视觉—语言—相机三元组和100万条具有挑战性的旋转轨迹,并开放覆盖28个公开数据集、约4450万张图像的绝对相机位姿标注,为机器人仿真、合成数据生产与具身智能训练提供可复现、可扩展的技术底座。

针对机器人训练来说,需要的并不是一段视觉上逼真的视频,而是能够支撑感知、定位、规划和行动的环境信息:当前相机处于什么姿态,重力方向是否稳定,场景结构如何延续,机器人移动后将看到什么。图像只是世界状态的一部分,物理方向、空间几何和视觉外观共同构成机器人真正需要的训练环境。

实盘开户配资服务

Puffin-World从三维世界状态本身出发,将其建模为三种相互关联的原生状态:物理状态:描述相机和观测视角在真实世界中的绝对朝向,包括重力场与纬度图。几何状态:通过深度信息表达场景的三维结构、空间远近和表面关系。外观状态:对应相机最终观察到的RGB图像。

三种状态共同构成从“世界如何存在”到“世界如何被交互”的完整表达。模型生成新视角时,不仅要回答画面应该是什么样,还要保证该画面在物理方向和三维结构上成立。

Puffin-Cam-15M提供1500万组视觉—语言—相机三元组,覆盖室内、室外、真实和合成等多种场景,并包含不同分辨率、宽高比、相机姿态和视场角。它不仅告诉模型图像中有什么,还告诉模型这张图像是在怎样的相机观测条件下形成的。

从“生成一段看起来合理的视频”,到“预测一个具有物理、几何和外观一致性的世界状态”,Puffin-World推动世界模型从视觉内容生成进一步走向可感知、可校准、可探索和可重建的三维环境。这也是世界模型真正进入机器人训练与具身智能应用所需要完成的一次范式转变。

南方+记者 郜小平