作者:哈尔滨工业大学(深圳)、大湾区大学、广州云蝶科技有限公司相关研究团队
本文已被 ECCV 2026 接收,项目代码与页面已开源:
论文:https://arxiv.org/abs/2606.28321
项目主页:
https://structsplat.github.io
开源代码:
https://github.com/J-C-Zhao/StructSplat
【研究背景】
随着三维高斯泼溅(3D Gaussian Splatting, 3DGS) [1] 和神经辐射场(Neural Radiance Fields, NeRF)[2] 的发展,三维场景重建与高质量的新视角合成取得了令人瞩目的进展。然而,为了获得准确的三维表示,大多数现有的前馈泛化模型仍高度依赖于通过SfM(Structure from Motion)[3], [4]预先计算出的精确相机内参和外参。
在实际应用中,相机参数往往难以获取(即未校准设定),而现有的无需位姿(Pose-free)的方法[5], [6], [7] 通常需要针对单个场景进行耗时的逐场景优化,无法直接推广到未见过的场景。因此,如何在无相机参数且稀疏视角的挑战性设定下,快速、高质量地重建三维场景,成为了当前研究的一个重要方向。
【研究挑战和存在的方法】
图1 几何特征难以还原纹理信息 |
在未校准的稀疏图像输入下进行前馈三维高斯重建,目前主要面临以下三个核心技术瓶颈:
• 缺乏语义感知建模:现有方法难以有效利用高层级的语义先验来指导几何重建,限制了模型在复杂场景下的鲁棒泛化能力。
• 几何与外观的相互纠缠:现有的骨干网络通常将几何与外观信息混合处理。然而,紧凑的3D几何特征往往倾向于空间平滑和几何一致性,不擅长捕捉高频的2D纹理细节和与视点相关的细粒度外观变化,导致渲染出的图像细节模糊、色彩失真。
• 训练中的特征信息泄露:一些方法在联合估计相机姿态时会同时处理源视角和目标视角。在渲染过程中,目标视角的信息容易通过交叉注意力机制引入到源特征中,这在训练和评估时会造成“信息泄露”,从而损害模型的实际泛化性能。
为了应对这些挑战,近期涌现了诸如AnySplat[8]、Splatt3R[9]和Depth Anything 3[10]等模型,但这些方法在保留丰富的2D语义信息和高频纹理细节方面仍有进一步提升的空间。
【方法框架】
图2 StructSplat整体方法框架 |
StructSplat 的整体架构如图2所示。给定一组未校准的稀疏源图像,模型通过并行结构化表征对图像的几何、语义和外观进行解耦编码,随后驱动两个解码通路:一个是用于密集预测相机中心高斯属性的高斯解码器,另一个则是用于估计相机参数并进行统一注册的相机解码器。
传统的可泛化重建方法常将几何与外观特征混杂在统一的骨干网络中,由于深层几何骨干天然具有空间平滑和几何一致性的偏置,高频的纹理细节极易在传递中丢失。StructSplat 创新性地采用三种解耦特征来协同表示三维场景:
• 几何编码器(提供骨架引导):利用其跨视角注意力机制进行多视图特征融合与长程上下文推理,生成多视角一致的 3D 几何特征。
• 语义编码器(提供语义一致性先验):提取输入图像的 2D 语义特征。这些特征编码了物体级的边界信息,在面对大视角变化或稀疏观测时,能够有效约束更细粒度的视角变化连贯性。
• 轻量级纹理编码器(保留高频细节):使用轻量级的卷积网络直接作用于源图像,在 2D 图像空间中提取高分辨率的浅层纹理特征。这些特征保留了最原始的色彩细节和局部高频变化,成为后续高保真外观重建的直接来源。
图 3 高斯解码器结构 |
在获得上述三类特征后,StructSplat对标准的密集预测Transformer(Dense Prediction Transformer, DPT)[11] 解码头进行了针对性改良,以实现特征的有机融合(如图 3 所示)
•重组与融合:在解码器的早期和中期,通过重新设计的重组模块,将3D几何特征与2D语义特征在空间上对齐、拼接并通过投影层控制通道维度。随后,利用级联的融合模块逐级上采样。
•像素对齐特征注入:为了防止高频纹理信息在多层网络传递中被平滑衰减,高分辨率的 2D 纹理特征被设计在最晚阶段注入。在输出高斯属性(如颜色、缩放、旋转等)的最后一个预测层之前,通过相加并投影将浅层纹理直接叠加上去。这种晚期注入建立了2D像素与3D高斯外观属性的直接通路,有效避免了纹理模糊。
图 4 是否采取相机对齐策略对渲染管线的影响 |
在未校准重建中,训练和测试模型需要联合估计源视角与目标相机的位姿。然而,如果直接将要渲染的目标图像与用于重建输入的源图像混合输入网络,网络内部的注意力机制容易将目标图像的信息“泄露”给源特征(即高斯解码器隐式地“偷看”了真值,如图 4 所示),导致模型泛化性能下降。为此,StructSpla 提出了一套并行流相机对齐策略:
• 双流并行估计:将“源视图+目标视图”混合集与“纯源视图”集并行输入网络,分别估计两套相机参数。
• 数学对齐注册:以源相机坐标系为基准,通过快速数学优化(旋转与平移对齐),将目标相机的位姿统一注册到源相机的坐标系中。
• 安全特征解码:在生成 3D 高斯时,解码器仅使用不含目标信息的“纯源”特征进行重建,并结合对齐后的目标位姿进行渲染。
该设计在保证多视角坐标系统一的同时,彻底杜绝了信息泄露,确保了前馈推理时的鲁棒性与评估的公平性。
【本文的主要贡献】
本工作的主要贡献可以总结为以下三点:
1)提出 StructSplat 框架:这是一种新型的前馈、可泛化的三维高斯重建框架,能够直接作用于未校准的稀疏输入图像,无需任何相机先验参数。
2)构建结构化表示:设计了显式分工的几何、语义和外观表示体系。通过引入像素对齐特征注入和语义先验,显著改善了场景的精细结构重建和色彩表现。
3)提出无泄露对齐策略:引入了并行流相机姿态对齐机制,有效规避了训练阶段的特征泄露,保障了模型的高泛化性与评估的公平性。StructSplat 在多个极具挑战性的公开 Benchmark 上取得了明显优于以往同类方法的重建质量。
【实验结果:稀疏视角重建质量评估】

【实验结果:多视角重建质量评估】

【实验结果:渲染质量可视化对比】
图5 DL3DV[12]数据集可视化对比 |
图6 ACID[13]和 RealEstate10K[14]数据集可视化对比 |
【参考文献】
[1] B. Kerbl, G. Kopanas, T. Leimkuehler, and G. Drettakis, “3D Gaussian Splatting for Real-Time Radiance Field Rendering,” ACM TOG, vol. 42, no. 4, Jul. 2023.
[2] B. Mildenhall, P. P. Srinivasan, M. Tancik, J. T. Barron, R. Ramamoorthi, and R. Ng, “NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis,” in ECCV, 2020, pp. 405–421.
[3] L. Pan, D. Baráth, M. Pollefeys, and J. L. Schönberger, “Global Structure-from-Motion Revisited,” in ECCV, 2024, pp. 58–77.
[4] J. L. Schönberger and J.-M. Frahm, “Structure-from-Motion Revisited,” in CVPR, 2016, pp. 4104–4113.
[5] T. Liu et al., “MVSGaussian: Fast Generalizable Gaussian Splatting Reconstruction from Multi-View Stereo,” in ECCV, 2024, pp. 37–53.
[6] D. Charatan, S. L. Li, A. Tagliasacchi, and V. Sitzmann, “PixelSplat: 3D Gaussian Splats from Image Pairs for Scalable Generalizable 3D Reconstruction,” in CVPR, 2024, pp. 19457–19467.
[7] H. Xu et al., “DepthSplat: Connecting Gaussian Splatting and Depth,” in CVPR, 2025, pp. 16453–16463.
[8] L. Jiang et al., “AnySplat: Feed-forward 3D Gaussian Splatting from Unconstrained Views,” ArXiv Prepr. ArXiv250523716, 2025.
[9] B. Smart, C. Zheng, I. Laina, and V. A. Prisacariu, “Splatt3r: Zero-shot gaussian splatting from uncalibrated image pairs,” ArXiv Prepr. ArXiv240813912, 2024.
[10] H. Lin et al., “Depth anything 3: Recovering the visual space from any views,” ArXiv Prepr. ArXiv251110647, 2025.
[11] R. Ranftl, A. Bochkovskiy, and V. Koltun, “Vision transformers for dense prediction,” in ICCV, 2021, pp. 12179–12188.
[12] L. Ling et al., “Dl3dv-10k: A large-scale scene dataset for deep learning-based 3d vision,” in CVPR, 2024, pp. 22160–22169.
[13] A. Liu, R. Tucker, V. Jampani, A. Makadia, N. Snavely, and A. Kanazawa, “Infinite nature: Perpetual view generation of natural scenes from a single image,” in ICCV, 2021, pp. 14458–14467.
[14] T. Zhou, R. Tucker, J. Flynn, G. Fyffe, and N. Snavely, “Stereo magnification: Learning view synthesis using multiplane images,” ArXiv Prepr. ArXiv180509817, 2018.