LATIDIA · Robótica
RynnValue: Escalado de modelos de base de valor robótico con distancia temporal
arXiv:2608.09853v2 Anuncio Tipo: reemplazar Resumen: Los modelos de recompensa de propósito general son cada vez más el cuello de botella para escalar el aprendizaje de robots, sin embargo, la receta para aprender capacidades relacionadas con el valor a partir de heterogeneidad a gran escala
WhatsApp ↗Telegram ↗
La noticia
arXiv:2608.09853v2 Announce Type: replace Abstract: General-purpose reward models are increasingly the bottleneck for scaling robot learning, yet the recipe for learning value-related capabilities from large-scale heterogeneous corpora remains underexplored. Existing approaches tie supervision to task-internal anchors such as preferences or normalized progress, none of which transfer cleanly across embodiments and data sources. We introduce RynnValue, an open-source value foundation model for robotic manipulation that replaces these anchors with temporal distance, the directed cost-to-go from an observation to the language-specified goal. Because temporal-distance labels can be derived directly from timestamps, RynnValue scales to over 7,000 hours and roughly 3M instruction-conditioned clips without preference or progress annotations. To make temporal-value learning reliable