LATIDIA · Robótica
Modelos de Vision Foundation con capacitación solo sintética para la estimación de posturas de naves espaciales monoculares
arXiv: 2609.26561v1Tipo de anuncio: Cross Resumen: Presentamos una mejora en las arquitecturas de estimación de poses de naves espaciales anteriores que da como resultado los errores de rotación media publicados más bajos que conocemos en la caja de VELOCIDAD+ luz
WhatsApp ↗Telegram ↗
La noticia
arXiv:2609.26561v1 Announce Type: cross Abstract: We present an improvement on previous spacecraft pose estimation architectures that results in the lowest published mean rotation errors we know of on the SPEED+ lightbox and sunlamp test sets for a known, non-cooperative spacecraft. By using a previously established heatmap-based pose estimation architecture and adapting a large self-supervised ViT foundation model (DINOv3) in place of the smaller convolutional and ViT encoders of previous work, we show that pose estimation accuracy improves from 300M to 840M parameters with no saturation yet observed. We also evaluate our 840M model on a Jetson Orin NX 16GB, measuring single-pass network inference at 133.8 ms per crop with a