关键观点
新视角预测是Atlas的基础原语Atlas把任务定义为:给定若干场景视图或场景描述,建立隐式的空间上下文,再预测任意时空位置上的相机画面。它与大语言模型的下一词元预测、传统视频模型的下一帧预测形成清晰区别。核心目标不是生成一段看似连贯的视频,而是让输出受到观察位置、时间和已有空间证据的约束。
Atlas把任务定义为:给定若干场景视图或场景描述,建立隐式的空间上下文,再预测任意时空位置上的相机画面。它与大语言模型的下一词元预测、传统视频模型的下一帧预测形成清晰区别。核心目标不是生成一段看似连贯的视频,而是让输出受到观察位置、时间和已有空间证据的约束。
为什么重要: 这一原语把镜头控制从模糊的文本提示转变为具有空间含义的条件,为稳定的多视角生成和重建奠定基础。
支撑证据
We know LLMs are built on next token prediction. We've seen video models as being built on next frame prediction. Atlas is really new view prediction.
生成与重建首次在同一模型中统一传统计算机视觉通常把三维重建和视觉生成视为不同子领域:前者强调忠实恢复,后者强调创造未见内容。Atlas让两者在同一架构中联合工作。可见区域依靠多视角信息进行空间约束,不可见区域则由生成能力补全,因此稀疏输入不必必然留下空洞。