LATIDIA · Robótica
Hacia la detección robusta de objetos 3D multimodales a través de modelos de cimentación visual
arXiv:2609.23541v1 Tipo de anuncio: Cross Resumen: La detección de objetos 3D multimodal es fundamental para una percepción robusta en la conducción autónoma porque integra información complementaria de LiDAR y sensores de cámara. Ho
WhatsApp ↗Telegram ↗
La noticia
arXiv:2609.23541v1 Announce Type: cross Abstract: Multimodal 3D object detection is fundamental to robust perception in autonomous driving because it integrates complementary information from LiDAR and camera sensors. However, existing methods often fail to maintain robustness under out-of-distribution (OOD) corruptions caused by sensor noise, adverse weather, and environmental changes. To address this problem, we propose RoboDistill, a robust and generalizable multimodal 3D object detection framework that leverages visual foundation models (VFMs), such as the Segment Anything Model (SAM). First, we introduce SAM-AD, a domain-specific pretraining strategy that fine-tunes SAM on autonomous-driving imagery to extract feature representations with rich semantic information. Second, we design the AD Feature Pyramid Network (AD-FPN) to refine