K2E-B-G5-4 · Paper Note
Vox-Fusion
- Description:Vox-Fusion 论文笔记 — 稀疏体素八叉树动态分配 + 每体素隐编码 MLP 解码 SDF,神经隐式 SLAM 的动态可扩展代表
- My Notion Note ID:K2E-B-G5-4
- Created:2024-03-31
- Updated:2026-06-11
- License:转载欢迎:转载请注明作者 Yu Zhang 并附原文出处(yuzhang.io)
Table of Contents
- 1. Summary
- 2. Key Contributions
- 3. Method
- 4. Experiments & Results
- 5. Ablation & Discussion
- 6. Strengths / Limitations / Future Work
- References
1. Summary
Title: Vox-Fusion: Dense Tracking and Mapping with Voxel-based Neural Implicit Representation Authors: X. Yang, H. Li, H. Zhai, Y. Ming, Y. Liu, G. Zhang Paper: arXiv:2210.15858 (ISMAR 2022) Github: zju3dv/Vox-Fusion
Vox-Fusion (浙大 CAD&CG, 2022):神经隐式 SLAM 中"显式空间结构 + 隐式解码"路线的代表。核心:用稀疏体素 + 八叉树动态管理场景,每个体素挂一个 16 维隐编码 (latent embedding),由共享 MLP 解码 SDF 和颜色。
关键优势:动态体素分配:不像 NICE-SLAM 预设固定边界密集网格,Vox-Fusion 边走边按 RGB-D 观测增量分配体素,无需预知场景大小;八叉树 + Morton 码高效管理,只在表面附近分配内存。内存:嵌入仅 0.149 MB vs. NICE-SLAM 238.88 MB(同场景,节省约 1600×)。
Replica 8 场景平均 ATE 0.54 cm(vs. NICE-SLAM 1.95 cm)、重建精度 2.37 cm;ScanNet 跟踪也优于 NICE-SLAM。

2. Key Contributions
- 动态稀疏体素分配:不预设场景边界,按 RGB-D 深度投影增量分配体素,支持未知/任意规模场景
- 八叉树 + Morton 码管理:位交织编码体素坐标 (bit interleaving),O(log n) 体素查找 + 位移操作快速定位相邻体素,共享角点 embedding
- 体素隐编码 + 共享 MLP:每体素 16 维 embedding,三线性插值后经单一共享解码器 → SDF + 颜色
- SDF 表示:比 NICE-SLAM 的占用更清晰定义表面,利于网格提取;用 Azinović 2022 方案 SDF→密度
- 极低内存:稀疏分配使嵌入仅 0.149 MB (vs. NICE-SLAM 238.88 MB,节省约 1600×)
3. Method
3.1 稀疏体素八叉树
- 体素边长:0.2 m(所有场景统一)
- 嵌入维度:每体素角点 16 维 embedding,相邻体素共享公共角点的 embedding(减少边界伪影)
- 八叉树:叶节点为体素,自顶向下遍历定位查询点所在体素
- Morton 码:对 坐标做 bit interleaving,生成唯一 Z-order(Z 形空间填充曲线编码,空间相邻的体素对应编码相近,有助于 cache 局部性)索引;位移操作 ( / ) 快速定位相邻体素 → 查找 O(log n)
- 新观测深度点不在任何体素内 → 动态分配新体素
3.2 体素隐编码解码 SDF
任意点 落入某体素后:
- 取体素 8 角点的 16 维 embedding,按 在体素内的相对位置三线性插值得特征
- 共享 MLP 解码器 (2-4 层 FC,256 隐层): SDF 值 + 128 维几何特征
- 颜色头(额外 2 层 FC 256 维 + sigmoid):几何特征 + 位置 颜色
3.3 SDF→密度转换与体渲染
采用 Azinović 2022 (Neural RGB-D) 方案,以 SDF 值转权重:
为 sigmoid, 为第 个采样点的 SDF 值, 为截断距离参数。(表面)处 最大,正负两侧单调递减, 控制响应宽度。(区别于 NeuS 的无偏 SDF→密度——论文仅把 NeuS 当对比)
体渲染(归一化加权和):
:第 采样点的 MLP 解码颜色;:第 采样点的深度(相机到该点的距离,沿光线方向)。
3.4 损失函数
四项 loss(权重未在论文中明确给出):
- :渲染颜色 vs. 观测 L1
- :渲染深度 vs. 观测 L1
- :自由空间约束(远离表面区域 SDF 应 )
- :近表面区域()SDF 值应接近真值深度差
3.5 跟踪与建图
跟踪:固定体素嵌入和解码器,用可微渲染反传优化当前帧位姿(Lie 代数 )。
建图:滑窗随机选 关键帧,联合优化体素嵌入 + MLP 参数 + 关键帧位姿(局部 BA)。
性能:跟踪 ~5 Hz,建图 ~2 Hz (RTX 3090)。时间分解:体素分配 0.1 ms / 射线-体素相交 0.9 ms / 点采样 1 ms / 体渲染 4 ms / 反传 6 ms。
3.6 动态体素分配
新帧跟踪成功后:
- 把深度图反投影到 3D,经位姿变换
- 落在未分配体素内的 3D 点 → 动态新增体素(0.1 ms/帧)
- 关键帧判据:新分配体素数 与已观测体素数 之比 超过阈值,或超过最大帧间隔
结果:只在表面附近分配体素,空旷区域零内存占用。
4. Experiments & Results
数据集
| 数据集 | 评估 |
|---|---|
| Replica (8 场景) | ATE + 重建精度 (acc/comp/comp_ratio) |
| ScanNet (5 场景) | ATE |
Replica 平均 (8 场景)
| Method | ATE (m) ↓ | Acc (cm) ↓ | Comp (cm) ↓ | Comp Ratio (%) ↑ |
|---|---|---|---|---|
| iMAP | 0.1834 | 4.43 | 5.56 | 79.06 |
| NICE-SLAM | 0.0195 | 3.87 | 3.87 | 82.41 |
| Vox-Fusion | 0.0054 | 2.37 | 2.28 | 92.86 |
Vox-Fusion ATE 比 NICE-SLAM 降低 3.6×,重建精度提升约 40%。
ScanNet 跟踪 (ATE, m, 5 场景)
| Scene | DI-Fusion | iMAP* | NICE-SLAM | Vox-Fusion |
|---|---|---|---|---|
| 0000 | 0.6299 | 0.5595 | 0.0864 | 0.0839 |
| 0106 | 0.1850 | 0.1750 | 0.0809 | 0.0744 |
| 0169 | 0.7580 | 0.7051 | 0.1028 | 0.0653 |
| 0181 | 0.8788 | 0.3210 | 0.1293 | 0.1220 |
| 0207 | 1.0019 | 0.1191 | 0.0559 | 0.0557 |
内存对比 (Replica office-0)
| Method | Decoder (MB) | Embeddings (MB) | Total (MB) |
|---|---|---|---|
| NICE-SLAM | 0.22 | 238.88 | ~239 |
| Vox-Fusion | 1.04 | 0.149 | ~1.19 |
嵌入内存节省 约 1600×(稀疏 vs. 密集网格)。
5. Ablation & Discussion
论文无专门消融章节;技术讨论要点:
- Morton 码 + 八叉树使相邻体素 embedding 共享公共角点,减少边界处几何不连续伪影
- SDF 相比占用(iMAP/NICE-SLAM)的优势:零值面清晰定义表面,提网格质量更高;Azinović 方案相比 NeuS 计算更简单
- 动态分配的代价:首帧/新区域进入时体素初始化引入短暂延迟(0.1 ms 可忽略)
局限:无回环检测(GO-SLAM 的解决方向);长轨迹漂移未处理;动态物体处理缺失(论文自认限制)。
6. Strengths / Limitations / Future Work
Strengths
- 动态体素分配:无需预知场景,支持任意规模增量扩展
- 嵌入内存极低 (0.149 MB),对比 NICE-SLAM 省约 1600×
- Replica ATE 0.0054 m,优于 NICE-SLAM 0.0195 m
Limitations
- 无回环闭合,长距离漂移不可纠正
- 无法处理动态物体
- 跟踪和建图速率较低(~5 Hz / ~2 Hz),不及 Orbeez-SLAM 等实时系统
- 损失函数权重未公开,复现需调参
Future Work (论文)
- 动态物体处理
- 长时间跟踪漂移抑制(回环)
References
- Yang, X., et al. (2022). Vox-Fusion: Dense Tracking and Mapping with Voxel-based Neural Implicit Representation. ISMAR 2022. arXiv:2210.15858
- 代码: github.com/zju3dv/Vox-Fusion
- Azinović et al. (2022). Neural RGB-D Surface Reconstruction — SDF→密度转换方案
- NICE-SLAM 笔记:主要对比方法(固定边界密集网格 vs. 动态稀疏体素)
- iMAP 笔记:单 MLP 基线
- GO-SLAM 笔记:在此基础上加回环的后续工作