流程范式对比

以下是 GwcNetRAFT-Stereo 的流程范式对比。通过两章流程图,直观的对比“传统 3D 卷积正则化”到“现在循环迭代优化”的架构跃迁。

GwcNet 流程范式:3D 卷积正则化的巅峰

GwcNet 代表了典型的静态前馈网络(Feed-forward Network)架构,核心思想是“构建极其精细的特征代价体,再用重型 3D 卷积去慢慢过滤噪声”。

RAFT-Stereo 流程范式:基于全对相关场的迭代优化

RAFT-Stereo 完全抛弃了 3D 卷积 。它通过计算全局的相关性金字塔,并利用多级 GRU 网络不断查询该金字塔,一步步(迭代)地修正初始视差 。


核心区别直观对比

  • 代价体的形态与计算

    • GwcNet:费尽心机构建一个庞大且信息丰富的 4D 融合代价体(包含了特征拼接和分组相关)。这个代价体本身占用极大显存。

    • RAFT-Stereo:化繁为简。直接对同行像素的特征向量做内积(点乘),生成轻量级的 3D 相关体 ,并通过在视差维度做 1D 池化构建金字塔(Correlation Pyramid) 。它不提前做复杂的拼接。

  • 正则化/优化的手段(核心差异)

    • GwcNet:是一次性推断。数据流过串联的 3D Hourglass 网络(非常耗时耗显存),一次性输出结果。
    • RAFT-Stereo:是循环迭代(RNN 的逻辑)。抛弃了 3D 卷积 。网络维护一个起始为 0 的视差场,每次循环时,网络拿着 当前的视差估计 去“查找(Lookup)”金字塔里的匹配度 ,加上左图的上下文特征 ,送入多级卷积 GRU 中计算出一个“视差修正值($\Delta d$)” ,不断叠加逼近真实视差。
  • 工作分辨率

    • GwcNet:由于 3D 卷积的限制,通常需要在较低分辨率下运行,对百万像素级图片处理困难。

    • RAFT-Stereo:由于只使用 2D 卷积和轻量级代价体,可以直接处理高分辨率图像 。预测过程在低分辨率($1/8$ 或 $1/4$)进行,最后通过凸上采样(Convex Upsampling)还原出全分辨率的高精度边缘 。

RAFT-Stereo

综述

这篇论文开启了立体匹配的新范式,主要创新点是:轻量化 3D 相关体、多级卷积 GRU 迭代。

预备知识

GRU

门控循环单元 Gated Recurrent Unit。

是 RNN 循环卷积网络 的变体。传统的 RNN 处理长序列数据时,存在 梯度消失问题(后面节点记不住前面的信息),于是有了 LSTM(长短期记忆网络),但 LSTM 内部复杂,参数复杂。于是有了 GRU,是 LSTM 的轻量优化版。它引入了 Gate 的机制来控制信息的流动。

数学原理

虽然 Mermaid 不支持原生 LaTeX,但它 完全支持基础的 HTML 标签。你可以使用 <sub>(下标)和 <sup>(上标)来手动把公式“撑”起来。