一、时代背景:摄影的第三个范式
1.1 从记录光线到计算像素,再到重建世界
回顾我们这100天的旅程:
- Day 1-30(1826-1900):摄影的诞生——从尼埃普斯的8小时曝光到干版快照,核心是"记录光线"
- Day 31-70(1900-1980):摄影的艺术化——从画意摄影到决定性瞬间,核心是"诠释光线"
- Day 71-97(1980-2026):摄影的数字化——从数码单反到计算摄影,核心是"计算像素"
今天,我们站在第四个范式的入口:"重建世界"。
不再是拍一张照片告诉你"世界长这样",而是拍一组照片让你"走进去"。
1.2 一个不可能的时间线
| 年份 | 里程碑 | 耗时 |
|---|---|---|
| 2020 | NeRF论文发表(Ben Mildenhall等) | — |
| 2022 | Instant-NGP(NVIDIA),训练时间从天级降到秒级 | 2年 |
| 2022 | Apple Object Capture API,手机3D扫描 | 同年 |
| 2023 | 3D Gaussian Splatting(Kerbl等),实时渲染 | 1年 |
| 2024-25 | ILM将NeRF用于漫威《Ironheart》特效制作 | 2年 |
| 2025 | VGGT获CVPR最佳论文,单次前向传播完成3D重建 | 1年 |
| 2026 | VGGT-Ω和D4RT获得CVPR 2026最佳论文;ILM+Nerfstudio获HPA技术创新奖 | 1年 |
从论文到好莱坞特效,只用了5年。 这个速度在摄影史上前所未有。
1.3 为什么是"摄影"的事?
你可能觉得这是计算机图形学的事,跟摄影无关。但请记住:
- NeRF的输入是照片——多角度拍摄的2D图像
- Gaussian Splatting的输入是照片——COLMAP从照片中提取相机位姿
- VGGT的输入是照片——transformer直接从图像预测3D几何
摄影师拍下的每一张照片,都可能成为3D世界的一个数据点。 这不是"取代摄影"——这是"赋予摄影新的维度"。
二、核心技术里程碑:五步改变一切的算法
2.1 NeRF——神经辐射场(2020)
论文:Ben Mildenhall, Pratul P. Srinivasan, Matthew Tancik等, "NeRF: Representing Scenes from a Single Viewpoint Using Neural Radiance Fields", ECCV 2020 Best Paper Honorable Mention
核心思想:用一个神经网络(多层感知机MLP)来表示整个3D场景。网络的输入是空间坐标(x, y, z)和观察方向(θ, φ),输出是该点的颜色(r, g, b)和体积密度σ。
一句话解释:传统3D建模用三角面片(mesh)描述物体表面,NeRF用一个"函数"描述整个空间——空间中每个点有什么颜色、有多"密"。
为什么震撼?
- 渲染质量接近照片级真实感
- 能完美处理反射、折射等传统3D难以表现的光学效果
- 只需要一组照片作为输入
为什么慢?
- 原始NeRF训练一张场景需要12-24小时(单块V100 GPU)
- 每次渲染新视角需要大量光线采样计算
- 无法处理动态场景
2.2 Instant-NGP——秒级训练(2022)
论文:Thomas Müller, Alex Evans, Christopher Schied, Alexander Keller(NVIDIA), "Instant Neural Graphics Primitives with a Multiresolution Hash Encoding", SIGGRAPH 2022 Best Paper
核心突破:用多分辨率哈希编码(multiresolution hash encoding)替代NeRF原始的位置编码。
效果:
- 训练时间从12-24小时降到5-30秒
- 渲染速度达到实时(30+ fps)
- 让NeRF从实验室论文变成了可用工具
Thomas Müller是NVIDIA的研究科学家,这篇论文让NeRF从"有趣但无用"变成了"有趣且有用"。它是整个3D影像革命的加速器。
2.3 3D Gaussian Splatting——当点变成椭球(2023)
论文:Bernhard Kerbl, Georgios Kopanas, Thomas Leimkühler, George Drettakis, "3D Gaussian Splatting for Real-Time Radiance Field Rendering", SIGGRAPH 2023 Best Paper
核心思想:不再用神经网络的隐式表示,而是用数百万个3D高斯椭球来表示场景。每个高斯椭球有:
- 位置(均值)
- 形状和方向(协方差矩阵)
- 颜色(球谐函数系数)
- 透明度
渲染方式:把所有高斯椭球投影到2D图像平面上,按深度排序,alpha混合。这就是"splatting"(溅射/投射)的由来。
为什么比NeRF更快?
- 不需要神经网络推理——每个高斯就是一个简单的数学函数
- 光栅化过程完全并行——GPU天生擅长
- 实时渲染帧率可达100+ fps(甚至超过很多传统3D引擎)
为什么对摄影重要?
- 训练速度快:几分钟完成
- 画质更高:细节保留优于NeRF
- 可编辑:可以移动、删除、添加高斯椭球
- 2026年,Pix4D已经将Gaussian Splatting集成到生产级测绘工作流中
2.4 VGGT——一次前向传播完成3D重建(2025)
论文:Visual Geometry Grounded Transformer, Oxford VGG + Meta AI, CVPR 2025 Best Paper
核心突破:不再需要迭代优化,用一个Transformer网络一次前向传播就能从1到数百张照片中预测:
- 相机内参和外参
- 深度图
- 3D点云
- 点追踪
速度:约0.2秒(单块H100 GPU),无需任何优化循环。
意义:这相当于把传统摄影测量(SfM/MVS,需要COLMAP跑几十分钟到几小时)的工作压缩到了一次神经网络推理。
2.5 D4RT——动态4D重建(2026)
论文:Dynamic 4D Reconstruction and Tracking, Google DeepMind + Oxford + UCL, CVPR 2026 Best Paper
核心突破:在VGGT的基础上加入时间维度。不仅重建3D空间,还追踪每个点在时间上的运动——实现4D重建(3D空间+1D时间)。
关键数据:
- 在NVIDIA A100上达到200+ fps的相机位姿估计速度
- 比VGGT快9倍,比MegaSaM快100倍
- 同时精度更高
对摄影的启示:这意味着你拍的一段视频,AI可以在几秒内重建出完整的4D时空——每个像素在每个时刻的3D位置。
三、作品赏析:当照片变成可以走进去的世界
作品1:NeRF原始论文的经典对比(2020)
Ben Mildenhall等人的原始论文中,最令人震撼的是对比图:左边是输入的50-100张照片,右边是从NeRF中渲染出的全新视角——这些视角从未被任何相机拍摄过,但看起来完全真实。
技术细节:
- 输入:50-256张不同角度的照片
- 网络:8层MLP,每层256个神经元
- 训练时间:12-24小时(V100 GPU)
- 渲染:体积渲染(volume rendering),沿每条光线采样192个粗采样点+192个精采样点
历史意义:第一次证明"神经网络可以学会一个完整的3D场景"。这比任何摄影测量算法都更优雅——不需要特征点匹配、不需要三角化、不需要光束法平差。一个MLP就够了。
作品2:Instant-NGP的"秒级奇迹"(2022)
Thomas Müller的Instant-NGP论文中有一张经典对比图:同一场景,原始NeRF训练24小时的结果 vs Instant-NGP训练5秒的结果——后者在SSIM指标上甚至略优。
这意味着什么?
- NeRF从"需要一天的学术实验"变成了"几秒钟的交互操作"
- 普通人可以在自己的GPU上训练NeRF
- 从此刻起,3D重建不再是专家的专利
作品3:Nerfstudio——开源3D重建平台
Matt Tancik(UC Berkeley / Google)在2022年创建了Nerfstudio——一个完全开源的NeRF/3DGS工具包。它把散落在各个论文仓库中的代码整合成了一个统一的、易用的平台。
为什么重要?
- 降低了使用门槛:不需要理解每篇论文的细节就能训练NeRF
- 提供了可视化界面:实时看到训练过程
- 模块化设计:研究者可以方便地插入自己的改进
- 2026年,Nerfstudio已经成为工业界和学术界最广泛使用的NeRF工具
作品4:ILM《Ironheart》——NeRF进入好莱坞(2024-2026)
这是NeRF技术最引人瞩目的工业应用案例。
背景:漫威Disney+剧集《Ironheart》(钢铁之心)中有大量无人机拍摄的芝加哥城市镜头。导演要求以超过1000%的速度重放这些镜头——但高速重放暴露了原始素材的相机抖动问题。
传统方案:用CG重建整个芝加哥——需要数月时间和巨额预算。
创新方案:视觉特效总监Vincent Papaix发现了Nerfstudio。他用无人机照片训练了NeRF模型,重建了芝加哥天际线的3D环境。然后可以:
- 在NeRF重建的环境中自由设计新的相机路径
- 无缝拼接不同机位拍摄的素材
- 删除/替换场景中的物体(如桥上的交通)
他们以为不可能用原始素材改变相机运动。但我们做到了。他们说这像魔法一样。没有建模,没有任何传统CG。 ——Vincent Papaix, ILM
结果:2026年3月,ILM和Nerfstudio因此获得HPA(好莱坞专业协会)技术创新奖。
Matt Tancik的评价:"几年前这还是科学论文。现在它正在进入我们使用的所有软件。"
作品5:Apple Object Capture API——手机上的3D扫描(2022-2026)
2022年WWDC,Apple发布了Object Capture API——开发者可以用iPhone拍摄一组照片(配合LiDAR传感器),自动在设备端生成3D模型。
2026年最新进展(iOS 17+):
- 完全在设备端处理——不需要云端
- 利用Apple Silicon的Neural Engine优化
- LiDAR辅助相机对齐——最耗资源的步骤
- 3次pass,几秒钟完成
- 输出USDZ格式,可直接用于AR
KIRI Engine等第三方App已经率先集成了这一API。用户只需围绕物体走动拍摄,就能得到一个可旋转、可缩放的3D模型。
摄影意义:你用手机拍一圈照片,就得到了一个3D模型。这是摄影测量(photogrammetry)在消费级设备上的终极形态。
作品6:VGGT的"单次推理"(2025)
CVPR 2025最佳论文VGGT展示了令人震惊的结果:
| 方法 | 相机位姿精度(AUC@30) | 运行时间 | 需要优化? |
|---|---|---|---|
| COLMAP(传统SfM) | ~90 | 几十分钟 | 是 |
| DUSt3R | 67.7-76.7 | ~7秒 | 后处理 |
| MASt3R | 76.4-81.8 | ~9秒 | 后处理 |
| VGGT(前向传播) | 85.3-88.2 | ~0.2秒 | 否 |
| VGGT + BA优化 | 91.8-93.5 | ~1.8秒 | 微调 |
一句话:一个神经网络在0.2秒内完成的工作,传统摄影测量需要几十分钟。而且精度相当甚至更优。
作品7:Gaussian Splatting在文化遗产保护中的应用(2025-2026)
据《AI-Driven 3D Reconstruction for Cultural Heritage》(ISPRS Archives, 2026),多个欧洲博物馆已经开始使用Gaussian Splatting技术对文物进行3D数字化:
- 拍摄:无人机或手持相机围绕文物拍摄数百张照片
- 训练:几分钟完成Gaussian Splatting
- 结果:可以在浏览器中实时浏览的3D文物模型
- 精度:细节保留优于传统摄影测量的mesh+texture方案
摄影意义:文化遗产的数字化保存不再需要数百万美元的激光扫描仪——一组照片+一台GPU就够了。
作品8:D4RT的4D重建——时间成为第四维度(2026)

Google DeepMind的D4RT在CVPR 2026获得最佳论文。它的创新之处在于:
- 输入一段视频
- 输出每个像素在每个时刻的3D位置
- 自动分离"相机运动"和"物体运动"
- 速度:200+ fps(A100 GPU)
对摄影的意义:你拍的一段视频,AI可以在几秒内重建出完整的4D时空模型。你可以:
- 从任意角度回看这段视频中的任何时刻
- 冻结某个时刻,从不同角度观察
- 追踪画面中每个物体的运动轨迹
这已经不是"照片"了。这是"可探索的时间切片"。
四、技术专题:3D影像的五层进化
4.1 传统摄影测量时代(1850s-2020)
| 特征 | 细节 |
|---|---|
| 核心算法 | SfM(Structure from Motion)+ MVS(Multi-View Stereo) |
| 代表工具 | COLMAP, Agisoft Metashape, Pix4D |
| 输出 | 稀疏/密集点云 → mesh → 纹理贴图 |
| 耗时 | 几十分钟到几小时 |
| 局限 | 难以处理反光、透明、弱纹理表面 |
摄影遗产:150年来,摄影测量的核心假设一直是"2D照片可以推断3D结构"。从立体镜到航空摄影测量,到如今的无人机测绘——一脉相承。
4.2 NeRF隐式表示时代(2020-2023)
| 特征 | 细节 |
|---|---|
| 核心创新 | 用神经网络隐式表示3D场景 |
| 代表方法 | NeRF, Mip-NeRF, Nerfacto |
| 优势 | 照片级渲染质量,完美处理反射 |
| 局限 | 训练慢(小时级),不可编辑,静态场景 |
摄影连接:NeRF的输入是摄影师拍的照片。摄影师的"构图能力"和"视角选择"直接决定了3D重建的质量。
4.3 Gaussian Splatting显式表示时代(2023-2025)
| 特征 | 细节 |
|---|---|
| 核心创新 | 用数百万个3D高斯椭球显式表示场景 |
| 代表方法 | 3DGS, Mip-Splatting, 2DGS |
| 优势 | 实时渲染(100+fps),可编辑,训练快 |
| 局限 | 内存占用大(数百万高斯),新视角合成质量略低于NeRF |
摄影连接:Gaussian Splatting可以编辑——这意味着摄影师可以"修改"重建后的3D场景:删除干扰物、改变光照、调整构图。
4.4 前向传播重建时代(2025-2026)
| 特征 | 细节 |
|---|---|
| 核心创新 | 单次神经网络前向传播完成3D重建 |
| 代表方法 | VGGT, VGGT-Ω, D4RT |
| 优势 | 亚秒级速度,精度媲美传统方法 |
| 局限 | 需要大量训练数据,泛化能力待验证 |
摄影连接:这意味着3D重建不再是"后处理"——可以是"实时"的。你拍的照片,瞬间变成3D模型。
4.5 生成式3D时代(2026-)
| 特征 | 细节 |
|---|---|
| 核心创新 | 从文本/图像直接生成3D场景 |
| 代表方法 | DreamFusion, Zero-1-to-3, SV3D |
| 优势 | 不需要照片输入,纯想象即可 |
| 局限 | 质量和一致性仍在提升中 |
摄影连接:这可能意味着——即使你不拍照,AI也能根据你的文字描述"生成"一个3D世界。但这恰恰让真实照片变得更珍贵——因为它是唯一的"真实数据源"。
五、关键人物谱系
学术先驱
| 人物 | 机构 | 贡献 |
|---|---|---|
| Ben Mildenhall | Google Research | NeRF论文第一作者,ECCV 2020 |
| Matthew Tancik | UC Berkeley | NeRF核心作者,Nerfstudio创建者 |
| Thomas Müller | NVIDIA | Instant-NGP,SIGGRAPH 2022 Best Paper |
| Bernhard Kerbl | Université Côte d'Azur | 3D Gaussian Splatting,SIGGRAPH 2023 Best Paper |
| Andrea Vedaldi | Oxford VGG | VGGT核心作者,CVPR 2025 Best Paper |
工业推动者
| 人物/团队 | 机构 | 贡献 |
|---|---|---|
| Vincent Papaix | ILM | 将NeRF引入好莱坞特效制作 |
| George Drettakis | Université Côte d'Azur | Gaussian Splatting合作者 |
| Pix4D工程团队 | Pix4D | 将Gaussian Splatting集成到生产级测绘工具 |
| Apple Vision团队 | Apple | Object Capture API,让3D扫描走进手机 |
传承关系
Marc Levoy(光场相机/计算摄影)
└─ Ren Ng(Lytro光场相机)
└─ Ben Mildenhall(NeRF第一作者)
└─ Matthew Tancik(Nerfstudio)
└─ Vincent Papaix / ILM(好莱坞应用)
传统摄影测量(COLMAP/SfM)
└─ Johannes Schönberger(COLMAP作者)
└─ VGGT / D4RT(用Transformer替代传统SfM)
NVIDIA图形学
└─ Thomas Müller(Instant-NGP)
└─ 3D Gaussian Splatting社区
六、思考题
1. 当照片可以"走进去","拍照"这个动作的意义发生了什么变化?
传统摄影中,你按一次快门得到一张照片。现在,你拍一组照片得到一个3D世界——观者可以自由选择视角。这是否意味着"摄影师"的角色从"构图者"变成了"世界建造者"?当观者可以自由移动视角,摄影师还有"控制权"吗?
2. NeRF/Gaussian Splatting是"摄影的终结"还是"摄影的升华"?
乐观观点:这赋予了照片前所未有的表达能力——一张照片是一个窗口,一组照片是一个世界。
悲观观点:当AI可以从几张图片"脑补"出完整3D场景,照片作为"真实记录"的价值将被稀释。
你的判断是什么?
3. 如果你的手机可以在按下快门的瞬间生成3D模型,"照片"和"模型"的边界在哪里?
Apple的Object Capture API已经让手机可以拍几张照片就生成3D模型。Vision Pro的Spatial Video已经在记录3D空间。未来,你拍的不是"一张照片"——而是一个"可探索的时空切片"。到那时,"摄影"这个词还够用吗?
七、总结:从达盖尔到NeRF,187年的圆环
1839年,达盖尔用银版法把三维世界变成了二维影像。这是一个降维的过程——丢失了深度信息,但获得了可复制、可传播的影像。
2020年,NeRF把二维影像重新变回三维世界。这是一个升维的过程——从照片中恢复了深度信息,甚至"脑补"出了从未被拍摄过的视角。
187年,摄影走了一个圆环:从3D世界→2D影像→3D世界。
但这不是简单的回归。在这个圆环中,摄影获得了:
- 记录能力:从一张照片到一个可探索的世界
- 表达能力:从固定视角到自由视角
- 真实性的新定义:从"这张照片是真的"到"这个世界是从真实数据重建的"
而我们——作为摄影师——获得了一个前所未有的选择:
是继续拍2D照片?还是开始"拍"3D世界?
答案可能不是二选一。答案可能是:两者都是摄影。只是维度不同。
延伸阅读
- NeRF原始论文:[NeRF: Representing Scenes from a Single Viewpoint](https://www.matthewtancik.com/nerf)
- Nerfstudio官方文档:[docs.nerf.studio](https://docs.nerf.studio/)
- ILM x Nerfstudio幕后:[ILM's Award-Winning Partnership with Nerfstudio](https://www.ilm.com/ilm-nerfstudio-ironheart-hpa-award-interview/)
- CVPR 2026综述:[Best of CVPR 2026: Feed-Forward 3D and 4D Reconstruction](https://www.digitalsense.ai/blog/best-of-cvpr-2026)
- 3D Gaussian Splatting项目页:[repo-splin](https://repo-sam.inria.fr/fungraph/3d-gaussian-splatting/)
Day_98已完成