TY - JOUR
T1 - Velocity First? Rethinking 3D Object Detection with 4D Millimeter Wave Radar
AU - Zeng, Changxian
AU - Chu, Wenbo
AU - Fan, Lili
AU - Ding, Yulong
AU - Tian, Yue
AU - Tang, Xiaolin
AU - Li, Keqiang
N1 - Publisher Copyright:
© 1999-2012 IEEE.
PY - 2026
Y1 - 2026
N2 - Propelled by advances in autonomous driving, accurate vehicle perception is essential for reliable decision-making. Compared with LiDAR, 4D millimeter-wave radar (4D MMW) provides stronger robustness under adverse conditions, lower deployment cost, and direct velocity measurements, motivating increasing research. However, its sparse point clouds limit scene description. This work presents Velo3DF (3D Velocity-aware Multimodal Fusion Network), a radar-camera fusion model that incorporates 3D velocity vectors into 4D MMW-based 3D detection. To mitigate positional redundancy and better utilize velocity information, a lightweight Velocity-Component-Aware module is introduced, compatible with backbones such as PointPillars. For cross-modal integration, an Alignment-Fusion module performs geometric alignment and deep fusion of image and point-cloud features. A single-modality variant, Velo3DF-R, contains 0.702M parameters and runs at 74.02 FPS while maintaining competitive accuracy.
AB - Propelled by advances in autonomous driving, accurate vehicle perception is essential for reliable decision-making. Compared with LiDAR, 4D millimeter-wave radar (4D MMW) provides stronger robustness under adverse conditions, lower deployment cost, and direct velocity measurements, motivating increasing research. However, its sparse point clouds limit scene description. This work presents Velo3DF (3D Velocity-aware Multimodal Fusion Network), a radar-camera fusion model that incorporates 3D velocity vectors into 4D MMW-based 3D detection. To mitigate positional redundancy and better utilize velocity information, a lightweight Velocity-Component-Aware module is introduced, compatible with backbones such as PointPillars. For cross-modal integration, an Alignment-Fusion module performs geometric alignment and deep fusion of image and point-cloud features. A single-modality variant, Velo3DF-R, contains 0.702M parameters and runs at 74.02 FPS while maintaining competitive accuracy.
KW - 3D Object Detection
KW - 4DMMW Radar
KW - Multimodal Fusion
KW - Vehicle Perception
UR - https://www.scopus.com/pages/publications/105039665114
U2 - 10.1109/TMM.2026.3696138
DO - 10.1109/TMM.2026.3696138
M3 - Article
AN - SCOPUS:105039665114
SN - 1520-9210
JO - IEEE Transactions on Multimedia
JF - IEEE Transactions on Multimedia
ER -