阿特拉斯:空间智能的世界模型
世界模型能够生成、重建和模拟任何可能的世界。它们理解世界的外观、行为和演变,以便我们可以为创意用户渲染想象中的世界,以高保真度模拟现实世界,并帮助机器人规划行动。在世界实验室,我们构建这些通用的世界模型,以追求空间智能。今天,我们介绍阿特拉斯,我们的下一代世界模型。阿特拉斯是一个全能模型,我们从零开始预训练,以原生支持文本、图像、视频和3D。它是一种多模态自回归扩散变换器:所有输入都结合成一个共享的空间上下文。阿特拉斯利用该上下文生成接下来发生的内容,在3D中与它所见的一切保持一致,并想象超越它的内容。阿特拉斯旨在扩展:其性能随着训练计算资源的增加而提高,我们预计这种趋势在我们继续扩展时会持续下去。阿特拉斯可以执行广泛的任务,包括世界生成、重建和模拟:相机控制生成:阿特拉斯可以从一个或多个图像生成图像和视频,具有像素级的相机控制,输出高达1分钟、1440p的视频。空间重建:阿特拉斯可以从一个到数十个输入图像重建现实世界场景。它生成新视角的图像帧和明确的3D输出,超越了专门用于3D重建的最先进模型的表现。时空模拟:阿特拉斯根据输入视频建模空间和时间,重新构架视频以实现戏剧性的视觉效果,并实现机器人领域的真实到模拟工作流。图像生成:阿特拉斯可以从文本生成图像和360度全景;它可以遵循复杂的提示,渲染文本,并生成各种视觉风格。阿特拉斯将为未来版本的Marble和世界实验室的其他产品提供动力。相机控制生成阿特拉斯接收一个或多个参考图像,并生成您指定的任何相机位置和角度的新视角。生成的视角与输入图像的内容和几何形状相匹配,平滑地向外推断,想象输入中不可见的场景部分。阿特拉斯处理各种场景类型、视觉风格和相机运动。视频是从一个到六个输入图像中生成的,采用手动设计的相机路径;像素完美的相机控制阿特拉斯使用精确的相机几何作为原生输入类型,超出了基于文本的粗糙相机控制指令。这样使您能够框定每个镜头并控制每一个动作。在这里的示例中,阿特拉斯从单个输入图像中生成完整场景。它利用输入图像的内容以及它广泛的世界知识,想象新角度下场景应该是什么样子。例如,它生成机器人的背面,并且猜测游泳池旁边应该有一片草坪。从单个图像,阿特拉斯能够从任何角度生成视图。拖动以改变视角。生成具有空间上下文的内容类似于LLM,阿特拉斯首先将输入编码为上下文,然后生成基于该上下文的输出。然而,阿特拉斯的独特之处在于每个图像都在空间中的3D位置上进行定位;这形成了一个空间上下文。管理这个空间上下文解锁了全新的创造性控制方式。例如,您可以将两个无关的参考图像放置在上下文中,将它们在3D空间中定位,阿特拉斯生成一个平滑插值的世界。这些示例展示了模型的世界知识和创造力;它想象门口、走廊、隐蔽处和其他在原本不相关的输入图像之间的过渡。选择左侧和右侧帧以填充空间上下文,阿特拉斯将它们结合在一起。可控长视频阿特拉斯让您通过组合相机运动和空间上下文管理生成长视频,具有精确控制。您设计每个场景和每个相机角度。这让您坐在导演的椅子上:您在布置场景,而不是拉动老虎机的杠杆。在下面的示例中,我们使用少量参考图像生成了一段1440p分辨率的1分钟视频。我们手动设计了相机路径穿过场景,阿特拉斯生成了一个连贯的世界。本页面上的其他视频已经被压缩以优化页面性能。空间重建阿特拉斯从一个或多个输入图像重建现实空间。它不需要特殊捕捉设备或数百个密集视图来忠实重建物体和场景。我们相信,阿特拉斯在解决稀疏输入图像的新视图合成问题上迈出了重要一步,这是计算机视觉领域一个长达数十年的基本问题。多个图像重建阿特拉斯可以接受场景的不定数量的输入视图。当输入视图中某些部分不可见时,阿特拉斯想象一个合理的方式填补这些空白,通过丰富的世界知识进行推测。但有时,您可能不希望想象;您可能希望实现精确的重建。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡