SMURF: Spatial Multi-Representation Fusion for3D Object Detection with 4D Imaging Radar

发表于:IEEE TIV (2023)。

原文链接: https://ieeexplore.ieee.org/document/10274127

大家好,很荣幸今天能有机会来分享笔者自己的工作,这也是笔者的第一篇文章,请多多指教。该笔记内容可能也曾在其他地方出现,均已得到笔者授权,且无需担心。

该文以及更多内容在微信公众号“自动驾驶与雷达感知”同步更新。

Part1 引言

传统汽车雷达已经广泛应用于先进驾驶辅助系统(ADAS)和自动驾驶领域,在未来的合作感知系统中也具有潜在应用。近年来,4D 成像雷达正逐渐成为一种新型的优良传感器。

我们提出了一种新颖的用于 3D 目标检测的空间多表达融合(SMURF)模型。该模型基于单模态的 4D 毫米波雷达数据,并利用体柱化和 KDE 从雷达点云中提取多表达特征。这是首次尝试使用 KDE 从 4D 毫米波雷达点云中提取额外的密度特征用于 3D 目标检测的研究。通过提取多维高斯混合分布的密度特征,KDE有效地减轻了点云中的固有噪声和稀疏性的影响。SMURF 可以成为未来研究和应用的基线模型。

Part2 方法

我们提出的 SMURF 模型由两个阶段组成。第一阶段是特征编码阶段,包括体柱化分支和点间 KDE 分支,用于提取点云体柱化特征和 KDE 特征。然后,在接下来的颈部和头部阶段,颈部由两部分组成,包括多表达特征融合(MRFF)模块和多尺度特征融合(MSFF)模块,其中 MRFF 用于融合多个表达的特征,而 MSFF 负责进一步提取和整合多尺度特征。最后,我们采用基于锚框的检测头生成预测结果,包括 3D 边界框和物体类别等。
请添加图片描述

A. 特征编码阶段——体柱化分支

在这里插入图片描述

在体柱化分支中,我们沿 XXXYYY 轴将 4D 雷达点云划分为柱体。设 PPP 表示非空柱体的数量。每个非空柱体内的点数可能会有所不同,并且可以分配一个参考值 NNN。对于包含超过 NNN 个点的柱体,我们提取 NNN 个点的随机子集。对于少于 NNN 个点的柱体,我们人为地添加具有零值的附加点,以确保点的总数等于 NNN。接下来,我们将每个单独点 ppp 的特征扩展到维度 DDD

D=[Draw,xc,yc,zc,xp,yp,zp],D=[D_{raw},x_c,y_c,z_c,x_p,y_p,z_p],D=[Draw,xc,yc,zc,xp,yp,zp],

其中,DrawD_{raw}Draw 表示点的原始特征,[xc,yc,zc][x_c, y_c, z_c][xc,yc,zc] 表示每个点相对于体柱质心的距离,[xp,yp,zp][x_p, y_p, z_p][xp,yp,zp] 表示每个点相对于体柱几何中心的距离。因此,我们以结构化方式获取了一个大小为 (D,P,N)(D, P, N)(D,P,N) 的稀疏张量,它包含了点云信息。之后再通过线性连接层、最大池化层等进一步提取特征,得到尺寸为 (C1,P)(C_1,P)(C1,P) 的特征向量。最后通过结合位置编码,将其还原为BEV下的尺寸为 (C1,H,W)(C_{1},H,W)(C1,H,W) 的特征图。

B. 特征编码阶段——KDE分支

在这里插入图片描述

为了增强点云的语义特征,我们在特征编码阶段引入了基于非参数估计的 KDE 方法。在这条核密度估计分支中,我们将输入形状为 (Np,Craw)(N_p,C_{raw})(Np,Craw) 的点云张量,其中 NpN_pNp 表示雷达点的数量,CrawC_{raw}Craw 表示每个雷达点的 (x,y,z)(x,y,z)(x,y,z) 坐标以及其他原始特征。为了提取密度特征,我们使用如下图所示的 KDE 模块:

在这里插入图片描述

每个点 ppp 的密度特征 ρ(p)ρ(p)ρ(p) 是通过考虑 (x,y,z)(x, y, z)(x,y,z) 坐标和多普勒信息(以多普勒为例)来计算的:

ρ(p)=1MpR3∑i=1Mp∏t∈(x,y,z,Dop)KR(t,ti),s.t.{∣x−xi∣≤R∣y−yi∣≤R∣z−zi∣≤R, \rho(p)=\frac{1}{M_{p}R^3}\sum_{i=1}^{M_{p}}\prod_{t\in(x,y,z,Dop)}K_{R}(t,t_{i}), s. t. \left\{ \begin{aligned} |x-x_i|\leq R\\ |y-y_i|\leq R\\ |z-z_i|\leq R , \end{aligned} \right. ρ(p)=MpR31i=1Mpt(x,y,z,Dop)KR(t,ti),s.t.xxiRyyiRzziR,

其中,DopDopDop 表示点的多普勒特征,MpM_pMp 表示与 ppp 之间的距离在一定范围内具有 (xi,yi,zi)(x_i, y_i, z_i)(xi,yi,zi) 坐标的其他点 pip_ipi。核函数KR(⋅,⋅)K_R(·, ·)KR(⋅,⋅) 被定义为高斯核:

KR(t,ti)=e∣∣t−tiR∣∣2,t∈(x,y,z,Dop,…). K_{R}(t,t_{i})=e^{||\frac{t-t_{i}}{R}||^2}, t\in(x,y,z,Dop,\ldots).KR(t,ti)=e∣∣Rtti2,t(x,y,z,Dop,).

由于使用了高斯核函数,所以雷达检测点的KDE也同时反映了点的多维高斯混合分布。此外,用于调节核函数影响范围的带宽 RRR 对于控制估计密度函数的平滑程度和振荡非常重要。

当使用由所有点组成的输入张量进行 KDE 计算时,密度值可能对所有点都为非零值,包括来自干扰物的噪声点。为此,我们希望为孤立的噪声点分配负的密度值,所以采用接下来的归一化步骤:
μ=∑i=1Npρi,\mu=\sum_{i=1}^{N_{p}}\rho_{i},μ=i=1Npρi,
σ2=1Np∑i=1Np(ρi−μ)2,\sigma^{2}=\frac{1}{N_{p}}\sum_{i=1}^{N_{p}}(\rho_{i}-\mu)^{2},σ2=Np1i=1Np(ρiμ)2,
ρbi=ρi−μσ2+ϵ,\rho_{bi}=\frac{\rho_{i}-\mu}{\sqrt{\sigma^{2}+\epsilon}},ρbi=σ2+ϵρiμ,
其中 μ\muμσ\sigmaσ 分别表示点的密度特征的均值和方差;ϵ\epsilonϵ 是一个参数,用于防止由于零方差导致的除零错误。

4D 雷达点云中的噪声点通常呈现出随机分布和孤立现象,导致密度值低于真实信号点。此外,属于同一对象的点倾向于相对集中。通过使用 KDE,可以有效地提取关于点的空间分布和集中程度的有价值信息:

在这里插入图片描述

为了降低计算成本,该分支也引入了体素化方法。在上述归一化过程之后,点云被分割成体素,生成一个形状为 (C2,D,H,W)(C_2,D,H,W)(C2,D,H,W) 的张量,随后应用稀疏卷积等操作。

C. 颈部和头部阶段

SMURF的颈部网络由两个关键组件组成:MRFF模块和MSFF模块。

在MRFF模块中,从体柱化分支获取的形状为 (C1,H,W)(C_1,H,W)(C1,H,W) 的伪图像与从KDE分支获取的伪图像进行组合,其形状分别为 (C2,1,H,W)(C_{2,1},H,W)(C2,1,H,W)(C2,2,H,W)(C_{2,2},H,W)(C2,2,H,W)。为了防止过拟合并简化模型结构,我们使用直接沿特征维度进行连接的融合方法。这个融合过程生成了一个形状为 (Cf,H,W)(C_f,H,W)(Cf,H,W)的伪图像,其中 Cf=C1+C2,1+C2,2C_f = C_1 + C_{2,1} + C_{2,2}Cf=C1+C2,1+C2,2

为了有效检测多个类别(如汽车和行人)的检测目标,MSFF模块使用不同数量的卷积层来获得多尺度的特征图,形状分别为 (Cm1,H,W)(C_{m1},H,W)(Cm1,H,W)(Cm2,H/2,W/2)(C_{m2},H/2,W/2)(Cm2,H/2,W/2)(Cm3,H/4,W/4)(C_{m3},H/4,W/4)(Cm3,H/4,W/4)。为了确保后续操作的兼容性,多尺度特征图接着被上采样到相同的尺寸,沿通道维度进行连接,生成一个形状为 (Cm,H,W)(C_m,H,W)(Cm,H,W) 的特征图,其中Cm=Cm1+Cm2+Cm3C_m = C_{m1} + C_{m2} + C_{m3}Cm=Cm1+Cm2+Cm3

最后,为了得到目标检测的预测结果,我们提出的SMURF模型采用一个基于锚框的单阶段检测头,类似于 PointPillars 中使用的方法。网络通过计算损失函数来优化预测的边界框,最后给出3D边界框、类别等预测结果。

Part3 实验

A. 数据集与评估指标

在本研究中,我们使用 VoD 和 TJ4DRadSet 数据集评估了所提出的 SMURF 方法的有效性和泛化能力。对于 VoD 数据集,我们利用从点云提取的原始特征,这些特征由七个维度组成:
Draw=[x,y,z,RCS,vr,vrc,t],D_{raw} = [x, y, z, RCS, v_r, v_{rc}, t],Draw=[x,y,z,RCS,vr,vrc,t],
其中 (x,y,z)(x, y, z)(x,y,z) 表示雷达点的坐标,RCSRCSRCS 表示雷达信号反射强度,vrv_rvr 表示相对于自车的径向多普勒速度,vrcv_{rc}vrc 表示绝对多普勒速度,ttt 表示点所属的扫描的时间ID。

另一方面,对于 TJ4DRadSet 数据集,我们也利用从点云提取的原始特征,这些特征由五个维度组成:
Draw=[x,y,z,vr,SNR],D_{raw} = [x, y, z, v_r, SNR],Draw=[x,y,z,vr,SNR],
其中 SNRSNRSNR 表示检测的信噪比。

以 VoD 数据集为例,我们利用累积的5帧雷达点云数据来评估三个不同目标类别的检测结果:汽车、行人和自行车。所采用的评估指标包括每个目标类别的 3D 平均精度 (AP3D)(AP_{3D})(AP3D)值,以及平均 3D AP (mAP3D)(mAP_{3D})(mAP3D) 和平均 BEV AP (mAPBEV)(mAP_{BEV})(mAPBEV) 值。这些指标分别是在官方指南中指定的整个注释区域和可驾驶区域上进行计算。按照官方设置,用于计算性能指标的IoU阈值分别设为 0.5 (汽车)、0.25 (行人) 和 0.25 (自行车)。

B. 部分实验结果

在这项研究中,我们对 VoD 和 TJ4DRadSet 数据集上的 SMURF 方法的实验性能进行了全面评估。

以在 VoD 数据集上评估为例,相比于无锚点检测器CenterPoint,我们取得了显著的改进,在整个标注区域和可驾驶区域的 mAP3DmAP_{3D}mAP3D 分别增加了 5.55%5.55%5.554.66%4.66%4.66。尽管无锚点检测器PillarNeXt在利用LiDAR点云进行3D目标检测方面取得了最新的最优结果,我们的SMURF方法在 mAP3DmAP_{3D}mAP3D 方面仍然超过它,在整个标注区域和可驾驶区域分别提高了 8.74%8.74%8.746.11%6.11%6.11。与基于锚点的检测器PointPillars和RadarPillarNet相比,我们的方法始终表现出更优越的性能,在整个标注区域的 mAP3DmAP_{3D}mAP3D 至少提高了 4.96%4.96%4.96,在可驾驶区域的 mAP3DmAP_{3D}mAP3D 至少提高了 2.24%2.24%2.24
在这里插入图片描述

尽管仅依赖雷达单模态数据,SMURF 也展示了有竞争力的性能,并在某些情况下优于最新的多模态融合方法 RCFusion。例如,在 VoD 数据集上,SMURF 在整个标注区域和可驾驶区域上显著改善了所有三类目标的 AP3DAP_{3D}AP3D

另外,我们提出的 SMURF 模型在 MMDetection3D 框架中实现时,具有高效的推断速度。在 VoD 数据集的验证集上,每帧的平均推断时间约为 0.033 秒,在 TJ4DRadSet 数据集的测试集上约为 0.04 秒。这些结果表明我们的模型可以有效满足实际应用中实时目标检测的要求。

Part4 结论

4D 雷达数据的利用面临着检测点稀疏、噪声以及现有方法特征提取能力有限等挑战。在本文中,我们提出了 SMURF 方法,使用 4D 成像雷达点云进行 3D 目标检测。在特征编码阶段,我们采用基于体柱化的点云表达来降低计算开销。同时,为了减轻原始点云中固有噪声带来的不利影响,并从稀疏点云中提取更丰富的语义信息,我们引入了 KDE 方法。通过融合点云的多种特征表达,我们成功提高了 3D 目标检测的精度。

通过在 VoD 和 TJ4DRadSet 数据集上进行大量实验评估,我们已经展示了 SMURF 方法的有效性和泛化能力。我们的结果表明,即使与利用 4D 雷达和图像信息融合的最先进多模态模型相比,SMURF 也提供了有竞争力的性能。

更多推荐