展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 硬件相关 > 南洋理工大学&快手联合团队攻克AI"空间盲症"

南洋理工大学&快手联合团队攻克AI"空间盲症"

南洋理工大学与快手等团队提出MetaView方法,通过隐式几何先验与度量深度锚定,使AI从单张照片生成准确新视角,并引入密集匹配距离(DMD)指标,在多个数据集上显著优于现有方法。

这项由南洋理工大学、快手科技Kolors团队和香港科技大学(广州)联合开展的研究,以预印本形式于2026年7月发表,论文编号为arXiv:2607.12000。有兴趣深入探究的读者可通过该编号检索完整论文。

你有没有想过,一张照片其实记录了很多遗憾?比如,站在一个绝美的风景前,按下快门,回家翻看时却忍不住想:要是当时再往左走两步,或者换个角度,画面会不会更惊艳?但那个瞬间已经永远定格了,错过了就是错过了。现在,一群AI研究者正在试图改变这个局面——他们想做到的是:只给你一张照片,AI就能“想象”出你站在另一个位置、朝着另一个方向看时,世界应该是什么样子。

听着简单,但真要实现,难倒了一代又一代的计算机科学家。今天要聊的,是一个叫做**MetaView**的新方法。可以这么说,它在这个问题上迈出了迄今为止最具说服力的一步。

一、AI为什么会“看不懂空间”

先从一个生活场景说起。你闭上一只眼,用手捂住另一只,然后试着去估一下桌上那个杯子离你有多远。你会发现,这事儿突然变得很悬。因为人脑判断距离和空间关系,靠的是双眼协作产生的立体视差、运动带来的视差变化,以及长期积累的经验。一旦这些线索断了,空间感就大打折扣。

对AI来说,情况更糟。一张普通照片是二维的,它把三维世界“压扁”成了一个平面。照片里哪个东西近、哪个东西远、墙壁和地板的交界在哪里、椅子腿后面藏着什么——这些信息在拍照那一刻就已经“丢失”了。让AI从一张照片出发,生成另一个视角的画面,本质上是在让它凭空“猜测”那些被遮挡和未被拍到的部分,同时还得保证整个场景的空间关系是合理的。

现有的解决方案大致分两派,各有各的困境。一派先让AI把场景“建模”成一个三维结构,再从新角度“渲染”出来。就像是给AI一套积木,让它先把楼房搭出来,再换不同方向拍照。效果在视角变化不大时还行,但一旦视角变化太大,建模时遗漏的细节就会暴露,画面变得模糊、扭曲,甚至出现怪异的破洞。另一派则干脆抛弃三维建模,直接让AI学“看到什么镜头角度,就输出对应画面”的映射关系。这种方式更灵活,但AI对空间的理解始终是模糊的,就像一个没学过地图的人,按“向右转大约走一段”的指示导航——方向感天生就不准。

在MetaView的团队看来,这两派并不是非此即彼的对立,真正的解决方案在于找到两者的平衡点:既不要被繁琐的三维建模所束缚,也别让AI在空间感上完全“裸奔”。

二、一套聪明的“空间感知”配方

MetaView的核心思路,用一个厨师的比喻来理解可能更贴切。一个经验丰富的厨师,不需要每次做菜都按精确到克的食谱来操作,但也绝不会完全凭感觉乱来——他依赖的是多年积累下来的“手感”和“经验直觉”,同时在关键节点上(比如加盐的量、火候的控制)还是会用工具辅助确认。MetaView对AI的处理方式,与此异曲同工。

整个框架建立在**Qwen-Image-Edit**这个预训练图像生成模型上。这个模型本身已经非常擅长根据文字描述和参考图片生成高质量的新图像,可以把它理解为一个见过海量图片、具备丰富视觉“直觉”的AI画家。MetaView的工作不是从零训练一个新AI,而是精心设计一些“附加模块”,来扩展这位画家的能力,让它学会“换了视角之后该怎么画”。

这套扩展方案由两个关键成分构成,就像给厨师增加了两件新厨具。

第一件厨具:从专业几何感知网络里借来的“空间直觉”

研究团队使用了DepthAnything3这个深度感知模型。这个模型的本职工作,是从图片中估算每个像素点的距离(深度),但在这个过程中,它积累了大量非常丰富的“场景理解能力”。MetaView不直接使用这个模型的输出结果(也就是深度图),而是提取它在处理图片时产生的**中间层特征**——那些还没有变成最终答案、但已经包含了大量空间关系信息的内部数据。这些特征被研究团队称为“隐式几何先验”,你可以理解为AI对场景空间关系的“内心感受”,而不是精确的测量结果。

第二件厨具:用“真实距离”来锚定空间尺度

这里需要解释一个AI生成领域的顽疾,叫“尺度漂移”。设想你告诉AI“摄像机向前移动了1米”,但AI对“1米”这个概念没有实际感受——它不知道这1米是在一个狭小的卫生间里,还是在一个宽阔的广场上,结果生成的画面可能跑偏得面目全非。MetaView的解决方案是使用DepthAnything3的另一个版本(带度量深度估算的版本),它能估算出图片中每个物体到摄像机的真实物理距离,单位是真实的米。有了这个真实的距离信息,AI对“摄像机移动了多远”就有了真实的参照,不会再产生尺度漂移的问题。

三、如何把“空间感”注入AI画家的神经网络

上面说的这两件“厨具”很有价值,但关键问题是:怎么把这些信息塞进一个已经训练好的复杂AI系统里,而不破坏它原有的“画功”?

MetaView选择了一种非常巧妙的非侵入式方案。研究团队把原有的Qwen-Image-Edit模型的所有参数都冻结起来——也就是说,这位AI画家原有的所有知识和技能原封不动,完全不改动。新增的功能,通过一套**平行的注意力层**来实现,就像在画家旁边安排了一个新的“几何顾问助手”,画家在作画过程中随时可以向这位助手请教空间关系,但画家本人的技法和风格完全保持不变。

具体来说,从DepthAnything3提取出的那些空间感知特征,被压缩成一组“几何令牌”(可以理解为一张写满空间信息的便条)。在每一个生成步骤中,AI画家处理图像时,不仅会与原始图片的信息和文字描述互相“交流”,还会同时与这张几何便条“交流”。研究团队可视化了这种交流过程,发现AI在生成目标视角画面时,给几何令牌分配的“注意力”远高于其他任何信息——这意味着几何先验在生成过程中确实发挥了至关重要的引导作用。

至于如何传达摄像机的位置和角度(即“从哪个方向看”),MetaView采用了一种叫做**空间感知旋转位置编码**的技术(改自PRoPE方法)。用更直白的话来说,这套编码方式让AI能够理解图像中每一个像素点在三维空间中的位置——它的横坐标、纵坐标,以及距离摄像机的深度(也就是Z轴)。把摄像机的内参矩阵(决定镜头视角大小的参数)和外参矩阵(决定摄像机在空间中位置和朝向的参数)都编码进这套位置系统里,AI就能在整个生成过程中时刻感知“我现在是在从哪个位置、朝哪个方向看这个场景”。

值得特别说明的是,整个训练过程中研究团队刻意回避了一件事:不做“深度提升”,也就是不把深度图转换成三维点云或三维网格。这看起来好像是主动放弃了一些信息,但实际上正是这种克制,避免了显式三维重建的种种局限性,保留了模型在面对复杂场景时的泛化能力。

四、为什么现有评价标准不够用,研究团队还发明了新指标

在介绍实验结果之前,有必要先聊一个很有意思的问题:怎么判断一张“新视角生成图”好不好?

传统上,研究者使用的评价指标包括PSNR(峰值信噪比)、SSIM(结构相似度)和LPIPS(感知相似度)。这些指标的共同逻辑是:把生成的图片和真实拍摄的对应视角图片逐像素比较,看看有多相似。在视角变化不大的情况下,这些指标基本靠谱。但当视角变化非常大时,问题就来了。

研究团队发现,当摄像机移动幅度很大时,生成画面中有相当一部分区域是原图中根本看不到的——AI需要“脑补”这些区域。对于这些脑补的部分,不同方法的结果可能看起来都不错,只是风格略有差异。然而,传统指标对图像的整体亮度分布和低频纹理非常敏感,一张画面模糊但亮度分布接近真实的图片,可能比一张画面清晰但视角略有偏差的图片得分更高——这明显和人眼的感受不一致。

为此,MetaView的团队提出了一个全新的评价指标,叫做**密集匹配距离(Dense Matching Distance,DMD)**。这个指标的思路是:与其比较像素值是否相似,不如比较图像中可识别的特征点,是否落在了正确的空间位置。具体操作是:用一个叫做UFM的密集特征匹配工具,在源图片、生成图片和真实目标图片之间建立点对点的对应关系,然后测量生成图片中的特征点和真实图片中对应点之间的平均位移距离。位移越小,说明生成的视角越准确;如果某些特征点在生成图中根本找不到对应(即遮挡或生成失败),则给予最大惩罚分数。

研究团队通过实验验证了这个新指标的优越性:对一组视角逐渐增大的图像序列,PSNR、SSIM和LPIPS都不能稳定地随视角增大而单调变化,而DMD能够准确地反映视角差异的大小,与人眼的直觉判断高度一致。这个新指标,今后有望成为衡量视角合成能力的更可靠标准。

五、真刀真枪的对比:MetaView到底赢在哪里

研究团队在三个不同的数据集上进行了系统性测试,分别是室外大场景数据集DL3DV(包含超过10000个真实场景)、室内场景数据集RealEstate10K(真实房产视频)以及街景数据集Sekai-Real-Walking-HQ(真实街道行走视频)。

特别是在DL3DV数据集上,测试被细分为三个难度级别:容易级(源图和目标图重叠超过80%)、中等级(重叠50%-80%)和困难级(重叠30%-50%)。重叠比例越低,意味着视角变化越大,生成难度也越高。

与之对比的六个方法涵盖了两大流派:重建派包括ViewCrafter、Gen3C、PE-Field和Voyager,隐式生成派包括HY-World-1.5和Lingbot-World。

在容易级测试中,MetaView的PSNR得分为17.94,而排名第二的重建派方法ViewCrafter只有15.45;DMD指标MetaView仅为2.56,而最好的竞争对手Gen3C也有6.52——差距已经相当明显了。

进入困难级测试,差距被进一步放大。MetaView的DMD指标为20.74,而ViewCrafter达到了48.83,Gen3C也有41.07,HY-World-1.5为34.45。两个隐式生成派方法在所有难度下的表现都很糟糕,特别是DMD指标,Lingbot-World在困难级高达55.39。这印证了研究团队的判断:纯粹依赖摄像机姿态作为控制信号、没有空间尺度锚定的隐式方法,在视角变化较大时会产生严重的尺度漂移和方向失控。

在RealEstate10K和Sekai数据集上,MetaView同样取得了全面领先的结果。在Sekai数据集上,DMD指标MetaView为6.69,Gen3C为8.72,其余方法均在15以上。

从生成图片的直观质量来看,重建派方法在视角大幅变化时普遍出现了明显的模糊和扭曲,有些情况下甚至连基本的场景结构都无法正确还原。而MetaView生成的画面不仅视角准确,细节也保持了相当高的清晰度和一致性。

六、拆解每个零件:没有哪个设计是多余的

研究团队还专门做了消融实验,就是逐一把MetaView的每个组件拆掉,看看少了这个零件之后性能会怎么变化。

去掉几何令牌(隐式几何先验)之后,整体视角方向仍然基本正确,但画面中物体的相对空间关系开始出错:指示牌消失了,物体轮廓变得不准确,不同物体的前后关系也开始混乱。PSNR从14.21降到13.53,DMD从9.33升到11.61,数据和视觉观察都印证了几何先验的重要性。

去掉Z轴深度编码(即度量深度锚定)之后,视角的旋转方向仍然正确,但位移出现了偏差——画面中的整体场景在空间中的位置“跑偏了”,这正是尺度漂移的典型症状。PSNR从14.21骤降到12.49,DMD从9.33升到14.45,退化幅度比去掉几何令牌更为显著,说明尺度锚定对于精确的视角控制至关重要。

研究团队还测试了用另一个流行的基础模型FLUX.1-Kontext替换Qwen-Image-Edit的效果。结果发现,即便换了基础模型,MetaView的设计思路依然有效——在相同基础模型上,MetaView的各项指标全面优于同样使用FLUX.1-Kontext的PE-Field(竞争对手中的重建派代表),证明这套方法本身的有效性不依赖于特定的基础模型。

七、可以用在哪里,还有什么做不到

MetaView的一个重要特质是泛化能力强。由于基础模型的参数完全冻结,原始预训练数据中积累的丰富语义知识被完好保留。研究团队测试了大量训练集之外的场景,包括以人物为主角的场景、以动物为主角的场景,甚至包括卡通风格、水彩画风格和AI生成图像风格的内容——MetaView都能生成合理的新视角画面,跨域适应能力相当出色。

然而,这个方法也有其边界。在基础模型从未见过的复杂场景中,MetaView可能出现生成失败的情况,本质上是因为基础模型的语义先验中没有对应的“素材”。在视野极其开阔的远景场景中(比如从山顶俯瞰城市全景),由于深度估算本身的精度下降,MetaView的视角控制精度也会随之降低。此外,MetaView目前只能处理静态场景,对于包含运动物体的视频场景(比如街道上行驶的车辆、走路的人群),它还无法生成在时间维度上连贯一致的结果。研究团队表示,将来的工作方向之一是扩展到时空一致的动态场景生成。

归根结底,MetaView做的事情,是在“什么都不建模”和“什么都精确重建”这两个极端之间,找到了一条更明智的中间路径:只提供最关键的空间线索,把其余的创造工作交给已经具备丰富视觉经验的生成模型来完成。这种克制与放手的结合,恰恰是它能够在大视角变化下依然保持准确和流畅的核心原因。

对于每一个曾经遗憾“当时要是多走几步就好了”的摄影爱好者来说,这项研究预示着一个有趣的可能性——也许在不远的将来,错过的角度真的可以被“补回来”。

Q&A

Q1:MetaView生成新视角时需要提供什么信息?

A:MetaView需要三样东西:一张源图片、摄像机的内参矩阵(描述镜头视角大小的参数)以及目标视角相对于源图片的摄像机外参(描述新位置和朝向的参数)。相机参数可以通过VIPE等工具从视频中自动估算,不需要用户手动填写复杂的数字。

Q2:MetaView和传统三维重建方法有什么本质区别?

A:传统三维重建方法会先把场景转化为三维点云或网格结构,然后从新视角渲染。MetaView不做这一步,它通过“隐式几何先验”让AI内部感知空间关系,同时用度量深度锚定尺度,整个过程不依赖显式三维结构,因此在视角大幅变化时不会因为重建缺陷而出现明显的画面破损和扭曲。

Q3:DMD指标和PSNR、SSIM这些常见指标有什么不同?

A:PSNR和SSIM本质上是逐像素比较亮度和结构差异,容易被整体亮度分布影响,一张模糊但亮度对的图片可能得高分。DMD则是追踪图像中可识别的特征点在空间上的位移距离,直接衡量生成视角是否在正确的空间位置,与人眼对视角准确性的感知更为一致,对大视角变化场景的评估更加公正可靠。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关 AI
相关文章 更多
精品专题 更多
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

PDF教程

PDF教程适合刚接触PDF文件的用户,本文整理PDF打开、编辑、转换、合并、压缩等常见基础操作。通过这些教程可以快速了解PDF文件怎么处理,解决办公、学习和资料科整理中的常见问题。使用极轻PDF可在线完成多种PDF操作,适合新手快速上手。

Mac软件 更多
灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Menuist
Menuist

Menuist 是一款面向 macOS 的 Finder 右键菜单增强工具,主要用来补充新建文件、快捷导航等常用操作,让日常文件管理和访问路径时更高效、更顺手。

Mole
Mole

Mole 是一款专为 Mac 设计的深度清理优化工具,涵盖缓存清理、应用管理及实时状态监控等功能。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

PinStack
PinStack

PinStack是一款轻量级的Windows平台剪贴板管理工具,优化您的剪贴板使用体验。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Seer
Seer

Seer是一款在Win平台下的空格键功能增强效率工具,只需轻敲空格键,就能预览几乎任何格式的文件。它更适合把零散的小功能集中起来使用,处理高频琐碎任务时会更省事。