World Labs发布全球首个多模态世界模型Atlas:支持像素级相机控制与3D重建

SmartHey9月2日消息,“AI教母”李飞飞联合创办的World Labs今日正式发布全球首个多模态世界模型——Atlas。该模型具备以像素级精度控制虚拟相机生成图像与视频帧的能力,并可同步完成高保真3D场景重建。

据World Labs官方介绍,Atlas从零开始进行全栈预训练,原生支持多模态输入,尤其专为理解并响应相机运动轨迹而设计,能将动态视角输入实时映射为一致、连贯的三维空间表征。

借助对多视角空间关系的深度建模,Atlas允许用户在三维上下文中精准定位输入视图,从而实现高度可控的图像与视频生成——例如模拟电影级“子弹时间”效果,即围绕静态对象自由环绕拍摄。

该模型仅需单张或多张输入图像,即可输出结构清晰、几何准确的显式3D模型,在重建质量与泛化能力上已超越当前主流开源三维重建方案。

用户可指定任意摄像机位姿(位置+朝向),Atlas将据此生成与原始输入内容和几何结构严格对齐的新视图;同时具备空间推理能力,能合理补全遮挡区域,平滑延展画面边界,实现视觉上自然连贯的场景扩展。

Atlas覆盖三大核心能力维度:世界生成、世界重建与世界模拟:

相机控制生成:支持基于1张或多张参考图,通过亚像素级相机参数调控生成高质量图像及最长60秒的1440p视频;

空间重建:兼容从单图到数十图的输入规模,既可生成新颖视角下的逼真渲染帧,也可输出带纹理与拓扑结构的显式3D网格,性能优于专用三维重建模型;

时空模拟:以输入视频为驱动,联合建模空间结构与时间动态,支持智能重构图、戏剧化镜头调度,并为具身智能体(如机器人)提供高保真仿真环境构建能力;

图像生成:兼容文本到图像、文本到360°全景等生成任务,可精准解析复杂提示词,支持多风格渲染与文字内容可视化。

World Labs透露,部分战略合作伙伴已获准参与Atlas抢先体验计划,面向开发者与企业的早期访问通道将于未来数周内正式启动。