UNA NUEVA PERSPECTIVA

LATIDIA

Preparando tu experiencia…

Tu lugar en este universo.

Con tu autorización. Las coordenadas se muestran sólo en esta página y no se guardan.

CONECTANDO FUENTES
← Actualidad

LATIDIA · Robótica

OPTED: Ajuste fino en la política para la conducción de extremo a extremo utilizando un profesor sin renderización

arXiv: 2609.20756v1 Tipo de anuncio: nuevo Resumen: A medida que la ampliación de los datos previos a la capacitación por sí sola produce rendimientos decrecientes, la capacitación posterior se está volviendo cada vez más importante en todos los dominios físicos de la IA, como la conducción autónoma. Fin-t

WhatsApp ↗Telegram ↗
Ilustración editorial relacionada con OPTED: Ajuste fino en la política para la conducción de extremo a extremo utilizando un profesor sin renderización
Ilustración conceptual de LATIDIA.

La noticia

arXiv:2609.20756v1 Announce Type: new Abstract: As scaling pre-training data alone yields diminishing returns, post-training is becoming increasingly important across physical AI domains such as autonomous driving. End-to-end driving policies are pre-trained in open loop with behavior cloning on human demonstrations. However, compounding errors during closed-loop deployment can take the vehicle outside the training data distribution, increasing the risk of safety-critical incidents. Closed-loop post-training can mitigate this risk but requires costly simulation for sensor-based policies. We propose OPTED (on-policy fine-tuning for end-to-end driving) which decouples reinforcement learning from the post-training of the end-to-end policy: a privileged teacher is trained using RL on vectorized inputs (HD-map and bounding boxes). This teacher then

← Volver a los modelos

Cargando ficha del modelo…

LATIDIA / lectura con contexto