LATIDIA · Robótica
Just Noticeable Difference Modeling for Token Compression in Vision-Language-Action Models
arXiv: 2608.21247v2Tipo de anuncio: replace-cross Resumen: La compresión de tokens se ha convertido en una técnica clave para reducir el costo de inferencia de los modelos de bases grandes, con enfoques como la poda de tokens y la reutilización de la caché KV
WhatsApp ↗Telegram ↗
La noticia
arXiv:2608.21247v2 Announce Type: replace-cross Abstract: Token compression has become a key technique for reducing the inference cost of large foundation models, with approaches such as token pruning and KV-cache reuse widely adopted in vision-language models and recently explored for embodied agents. In embodied agents, tokens not only support perception and semantic understanding but also directly affect latency-sensitive closed-loop robot action prediction. Existing schemes typically guide compression using redundancy or importance cues, such as visual similarity, attention scores, and saliency. However, these cues only indirectly measure the key factor for safe compression: how much a token can change before causing an unacceptable deviation in downstream actions. This receiver-dependent tolerance is closely