跳至内容

机器如何学习在三维中看见

2026年4月12日
机器如何学习在三维中看见
Administrator

介绍

长期以来,让计算机从平面照片中理解三维世界是计算机视觉领域最难的问题之一。研究人员为此构建了许多工具——跨照片匹配特征的方法、从并排的两台相机测量深度的系统,以及将数千个图像点转换为粗略3D形状的软件。这些工具取得了真正的进展,但它们都有一个共同的弱点。它们能够识别物体的形状,但无法真正理解光是如何在场景中移动的.

这一切在2020年发生了变化,当时一篇研究论文介绍了一种新的方法,该方法在该领域被称为神经辐射场。与其构建场景的几何骨架,这种方法训练了一个小型神经网络,将整个场景表示为空间和光的连续函数。结果远远优于之前的任何方法,特别是在目标是生成从未实际拍摄过的相机角度下场景的外观时.

这篇文章解释了该技术是如何工作的,它对数据密集型行业的重要性,它的真正弱点是什么,以及随着其日常使用的日益实用,它将走向何方.

旧方法的错误

要理解这种新方法为何如此突破,了解它所打破的壁垒是有帮助的.

旧的三维重建工具通过在多张照片中找到匹配点并使用几何学计算它们在空间中的位置来工作。结果通常是一个点云——本质上是三维空间中大量点的集合——或由连接的三角形构成的网格,近似物体的表面。这些表示存在几个众所周知的问题:

  • 光滑、闪亮或透明的表面会混淆特征匹配步骤,导致重建中出现空白
  • 像头发、叶子和织物这样的细节很难准确恢复
  • 这些方法捕捉形状,但在捕捉表面在不同光照或不同视角下的外观时遇到困难
  • 从全新的相机角度生成场景的外观会产生模糊或失真的结果

更深层次的问题是,这些方法将场景视为一组表面。但表面是人类的抽象。光并不遵循这种抽象。它在空间中传播,反射,吸收进材料,并以复杂的方式散射。相比之下,新方法拥抱这种物理现实,并将场景建模为一个空间体积,而不是一组表面。

核心思想:将场景表示为学习的函数

这种方法的核心思想是将场景表示为一个存储在神经网络中的数学函数,而不是网格或一组点——具体来说,是一种称为多层感知器的网络类型,它是通过学习的操作转换数字的连接层序列。

该函数接受五部分输入:一个三维空间位置——由其坐标标识的特定点——以及一个描述观察者视角的二维观察方向。给定这五个数字,网络输出两个结果:

  • 该点空间的密度或实心程度——本质上是指该位置是否被某种物体占据
  • 从特定观察方向发出的空间颜色

观察方向的组成部分很重要。抛光金属在正面观察时与从侧面观察时的外观不同。湿润的表面在一个角度下反射天空,而在另一个角度下看起来则很暗。传统的基于网格的表示通过材料参数来近似这一点。这种方法直接从照片中学习。

训练网络涉及提供一组场景的照片——通常在二十到几百张之间——以及每张照片的相机精确位置和方向。然后使用优化过程调整网络。对于每张训练照片,系统通过每个像素投射虚拟光线,沿每条光线采样多个点,询问网络每个样本处的颜色和密度,并使用描述光在雾或云中如何积累的相同数学方法结合这些答案。结合的结果应与原始照片匹配。预测颜色与实际颜色之间的差异用于调整网络权重。这个循环重复数百万次,直到网络学会准确再现每张训练照片。

在那时,网络已经隐式地学习了场景的三维结构。没有提供任何显式的三维数据。几何形状是通过学习从已知相机位置重现照片的过程而产生的。

渲染步骤背后的物理学

渲染步骤——将网络的输出转化为像素颜色的过程——基于光在体积中传播的成熟物理学。

当光线穿过雾、烟或任何部分透明的介质时,它会逐渐从经过的粒子中积累颜色,并且可以被更密集的区域阻挡。描述这一过程的数学在电影视觉效果中已经使用了几十年。这种方法应用了相同的数学,但反向进行——它不是渲染已知的体积,而是学习为了产生已知的照片,体积必须是什么样的。

因为这个过程的每一步——网络查询、沿光线的样本组合——在数学上是可微分的,这意味着梯度可以在其中流动,整个系统可以使用标准深度学习工具进行端到端的训练。网络通过在每次错误渲染照片时受到惩罚来学习几何。

一种称为分层采样的实用改进将计算工作集中在密度较高的空间区域,而不是在空白空间中浪费样本。这使得该方法在不牺牲质量的情况下更快。

这对数据系统和工业应用的重要性

这项技术不仅仅是一个学术练习。它对处理空间数据、检查工作流程、模拟和物理资产管理的行业有直接影响。

数字双胞胎和设施映射是最直接的应用之一。可以在无人机或手持相机拍摄的工业设施视频或照片上训练模型。结果是一个逼真、可查询的三维表示,远比传统激光扫描点云更忠实于设施的实际视觉外观。检查员可以虚拟地走过空间,放大设备,并检测随时间变化的视觉变化。

医学成像和手术规划开始使用这种技术,利用在微创手术中捕获的视频。与仅依赖手术前拍摄的扫描不同,基于体内视频训练的模型可以生成一个连续的三维组织几何模型,反映手术过程中组织的实际状态。

自主系统的仿真面临持续的数据稀缺问题。训练一个自动驾驶系统需要大量逼真、物理准确的视觉数据,涵盖在现实世界中难以捕捉的稀有和危险场景。基于真实驾驶视频训练的模型可以重建特定场景,并从新的摄像机角度或不同的光照条件下生成视图——大幅扩展训练数据的多样性,而无需额外的物理数据收集。

零售中的产品可视化利用这项技术从标准摄影中生成三维产品表示,使在线互动产品查看成为可能,而无需昂贵的手动建模。

对生产使用重要的限制

这种方法的优雅伴随着实际成本,任何评估其生产使用的团队都必须理解。

训练时间是原始方法最显著的弱点。早期版本在高端显卡上训练单个场景需要数小时甚至数天。这使得快速周转的工作流程变得不切实际。

渲染速度加剧了这个问题。生成单个图像需要对神经网络进行数百万次查询,这对于交互式查看或实时应用来说太慢了。

场景特异性是一个基本限制。一个训练好的模型只代表一个场景,而仅仅是那个场景。它无法推广到新的环境。每个新场景都需要从头开始进行完整的训练。这与传统的神经网络分类器根本不同,后者只需训练一次即可广泛应用。

移动物体打破了核心假设。该方法假设在捕捉过程中场景是静止的。在有人走过或车辆移动的空间中捕捉场景违反了这一假设,并显著降低了结果的质量。

固定光照是另一个限制。训练好的模型将捕捉过程中存在的光照条件固化。它无法显示在不同光照下场景的样子,而不需要额外的建模工作。

研究界如何解决这些弱点

原始论文激发了一大波后续研究,其中大多数直接针对上述描述的弱点。

一家主要图形硬件公司的研究人员开发的系统用一种称为多分辨率哈希编码的技术替代了神经网络,使用了结构化查找表。这一变化将训练时间从数小时缩短到几秒,并使交互式渲染成为可能。

另一项工作通过推理像素所代表的空间锥体,而不是单一的数学光线,改善了不同距离和视角下的质量。这为在不同距离捕获的场景产生了显著更好的结果。

处理大型户外环境——城市、风景、开阔田野——的扩展解决了一个最重要的实际限制,因为大多数现实世界的捕获场景并不局限于一个小的、有界的空间。

对可变形场景的研究引入了学习变形场的概念,与主要场景表示一起,允许从视频中重建人、面孔和其他移动对象。

从互联网照片集合中重建场景的工作——这些照片是由许多不同的人在不同的光照条件下、不同的时间拍摄的,画面中还有随机路人——使得该方法适用于大量杂乱的现实世界数据集,而不仅仅是干净、受控的捕获。

一种竞争方法:使用高斯形状的场景表示

在讨论这一研究领域时,如果不提及最近出现并获得显著关注的竞争方法,那将是不完整的。

该方法不是使用神经网络将场景编码为连续函数,而是将场景表示为大量小的三维椭圆形状——技术上称为高斯原语——每个形状都有自己的位置、大小、方向、透明度和视角依赖的颜色。这些形状被投影到图像平面上,并通过快速的并行渲染过程组合以生成最终图像。

这种表示实现了实时渲染——通常在高分辨率下每秒三十帧到超过一百帧——同时匹配或超过基于神经网络的方法的质量。训练也保持快速,典型场景通常在几分钟内完成,而不是几个小时。

权衡是内存使用。由数百万个小形状表示的场景可能需要数十GB的存储,而一个紧凑的训练神经网络可以在几MB中表示一个场景。对于涉及通过网络流式传输三维内容的应用,这种差异非常重要。

研究人员越来越多地探索结合两种方法最佳特性的混合表示。

与大型视觉和语言模型的连接

当前最活跃的研究方向之一是将这种场景表示技术与理解语言和视觉语义的大型模型连接起来。

标准的训练场景表示是纯视觉的——它编码外观和几何形状,而不理解存在什么物体或它们的意义。最近的工作将基于语言的语义信息附加到三维表示上,使用户能够通过自然语言查询空间位置。例如,用户可以问“灭火器在哪里?”并在三维场景中收到高亮区域,而不必进行视觉扫描。

几何重建与语义理解的结合对机器人技术具有重要意义。在仓库中执行任务的机器人手臂或在工厂车间导航的移动机器人,不仅需要感知其环境的几何形状,还需要推理出存在的物体及其位置。一个同时具备几何特征、照片真实感和语义可查询的场景表示直接满足了这一需求。

部署的实际考虑

评估该技术用于生产的组织应仔细考虑几个实际因素。

捕获质量是所有事物的基础。重建的质量取决于输入的照片。运动模糊、相邻视图之间的重叠不足,以及未能从足够角度覆盖场景的相机路径,都会削弱质量,无论底层模型多么复杂。学习如何进行良好的捕获与理解模型本身同样重要。

计算要求根据使用案例而异。交互式实时查看受益于上述描述的基于形状的方法。可视化资产的批量渲染可以使用较慢但质量更高的方法。大规模训练大型或高分辨率场景需要多张显卡。

管道集成往往是被低估的挑战。该技术需要一个周边系统来摄取捕获的图像、估计相机位置、运行训练过程,并将结果导出为下游可用的格式——无论是渲染视频、提取的网格,还是可流式传输的三维表示。

数据隐私和所有权值得关注。专有设施、产品或敏感物理空间的重建与任何其他敏感数据资产具有相同的保密考虑。

这项技术的未来方向

该领域的几个发展预计将在未来两到三年内到来。

直接在边缘设备上进行训练——通过更高效的编码方法实现——将使在手机或嵌入式设备上生成高质量的三维重建变得可行,而无需将数据发送到云端。已经开始出现从智能手机拍摄的短视频中生成照片级真实感三维资产的应用。

能够跨场景进行泛化的模型——仅通过几张照片重建新环境,而无需完整的训练过程——将显著降低每个场景的成本。早期的研究方向已经显示出希望。

理解物理材料属性的扩展——表面如何反射、吸收和散射光——将使重新照明和材料编辑成为可能。这对于工业仿真非常重要,因为照明条件必须以编程方式进行控制。

这项技术与生成性人工智能之间的界限也在逐渐消失。现在已经存在可以从文本描述生成完整三维对象或场景的系统,内部使用这种场景表示,并通过文本引导的图像生成模型监督其生成。这将显著改变三维内容创作的工作流程。

结论

将场景表示为学习到的空间和光的连续函数的方法,是真正改变机器理解三维世界的方式——不仅仅是对旧方法的渐进改进。通过学习从已知相机位置重现照片,这些系统隐式地发现了几何形状和外观,捕捉了细节和视角依赖的效果,而基于表面的方法无法做到这一点。

关于训练速度、渲染速度和场景特异性的原始限制已经通过后续研究得到了实质性解决。该技术现在足够成熟,可以在数字双胞胎创建、自动系统仿真、医学成像和空间计算中进行严肃的生产评估。

对于考虑空间人工智能在其基础设施中适合何处的数据系统团队来说,问题不再是这项技术是否足够强大。关键在于捕获管道、计算基础设施和数据集成工作流程是否准备好利用它。

计算机视觉:将视觉数据转化为智能洞察