LATIDIA · Robótica
OPTED: Ajuste fino en la política para la conducción de extremo a extremo utilizando un profesor sin renderización
arXiv: 2609.20756v1 Tipo de anuncio: nuevo Resumen: A medida que la ampliación de los datos previos a la capacitación por sí sola produce rendimientos decrecientes, la capacitación posterior se está volviendo cada vez más importante en todos los dominios físicos de la IA, como la conducción autónoma. Fin-t
WhatsApp ↗Telegram ↗
La noticia
arXiv:2609.20756v1 Announce Type: new Abstract: As scaling pre-training data alone yields diminishing returns, post-training is becoming increasingly important across physical AI domains such as autonomous driving. End-to-end driving policies are pre-trained in open loop with behavior cloning on human demonstrations. However, compounding errors during closed-loop deployment can take the vehicle outside the training data distribution, increasing the risk of safety-critical incidents. Closed-loop post-training can mitigate this risk but requires costly simulation for sensor-based policies. We propose OPTED (on-policy fine-tuning for end-to-end driving) which decouples reinforcement learning from the post-training of the end-to-end policy: a privileged teacher is trained using RL on vectorized inputs (HD-map and bounding boxes). This teacher then