学习杂谈一
今天是2026年8月7号,天气晴朗,同学都出去玩了,我在家里看论文。
我用AI生成了一个完整的论文阅读计划。
其实读论文是有技巧的,这个技巧可以大体分两个层次,初始是阅读语段的技巧,进而是阅读论文的技巧;
我们做过大量英语阅读理解的中国学生都知道,要快速看完一篇文章(当前核心目的是把题目作对),那么你肯定不能一个词一个词的看,大体上看完一两段,几句话,然后心里就有数了。
阅读论文也是类似的道理,首先要有一个心理预期,你期望从这一篇论文或者这一组论文中收获什么;对于我的话,我希望能够基于现有论文中真实的科学研究记录辅助我做软件横向,提升软件中展示的模型质量。如果说你仅仅是需要一个处理问题的方法,AI可以提供给你一大堆,但是不保证有用,至少在我当前的软件中是基本上没有作用的,所以我需要自己来细化这个思考过程,从现有论文的研究框架及创新中过一遍自己的思路。
然后就开始第一轮阅读;
高斯泼溅对我来说是一个陌生的领域,之前是赶鸭子上架完善了一个简陋的软件,跟现有的软件及平台没法比,真的,简陋软件唯一的优点就是简陋,我们可以根据自身的认识和技术水平做自由的开发完善,因为根本没有一个成熟的框架限制。。。
既然学习3DGS,不免要接触其前辈--NeRF(神经辐射场)。
我们可以把NeRF看作一个“用AI生成3D照片”的黑盒。
在NeRF中,MLP充当“3D空间的记忆体”。它不存储图片,而是把整个3D场景的几何形状和颜色,全部编码进网络几亿个神经元的权重参数里。MLP本身查询就慢(毫秒级/次),再乘以“体积光线行进”带来的亿级查询次数,就造成了训练时间以天计,渲染时间以分钟计的现状。这种高成本直接限制了NeRF的应用场景。
那3DGS究竟是怎么回事?
3D 高斯场景表示
- 初始化:利用运动恢复结构(SfM)生成的稀疏点云初始化 3D 高斯集合,无需多视图立体(MVS)数据。
- 各向异性协方差:每个高斯由位置(均值)、不透明度( αα )、各向异性协方差矩阵( ΣΣ )和球谐函数(SH)系数定义。协方差矩阵通过缩放向量 ss 和旋转四元数 qq 进行优化,以适应场景几何形状。
- 体积表示:3D 高斯是一种可微分的体积表示,通过投影到 2D 进行光栅化,使用标准的 αα -blending 合成图像。
原始3DGS为了追求极致的渲染速度,在投影渲染时采用了一个“2D膨胀(Dilation)”的近似操作。这个操作在训练视角下表现良好,但当相机拉远或拉近时,问题就暴露了:
拉近(放大)看:这个固定的膨胀量相对变小,导致高斯点之间出现缝隙,渲染出的画面就会有空洞和噪点。
拉远(缩小)看:这个固定的膨胀量相对变大,导致细节过度膨胀,看起来模糊、臃肿,像涂了一层不均匀的奶油。
有一篇论文的工作就是专门解决这个问题,然而3DGS模型最终呈现的效果与很多因素有关,所以实际上就是使用了其方法(滤波器),也无法保证最终结果。
