LATIDIA · Ciberseguridad
Evaluación de seguridad de cuatro estados de modelos de lenguaje grande de peso abierto en entradas no canónicas
arXiv: 2610.09033v1Tipo de anuncio: Cross Resumen: Las evaluaciones de seguridad estándar de los modelos de lenguaje grandes evalúan las solicitudes dañinas escritas en texto sin formato canónico, mientras que los modelos en implementación en el mundo real reciben rutinariamente información
WhatsApp ↗Telegram ↗
La noticia
arXiv:2610.09033v1 Announce Type: cross Abstract: Standard safety evaluations of large language models assess harmful requests written in canonical plain text, while models in real-world deployment routinely receive inputs containing emojis, altered spellings, encoded strings, and character-level variations. This work introduces the Adversarial Surface-Form Robustness Dataset (ASRD), comprising 2,100 prompts across seven distinct surface-form families. Five open-weight language models are evaluated across these prompts, producing 10,500 responses. The Quad-State Evaluation Rubric classifies each response into one of four outcomes: harmful compliance, safe response, comprehension failure, or indeterminate. Emoji and invisible Unicode variations cause almost no comprehension failure, with pooled harmful compliance of 20.27% and 17.20% against a 22.87% baseline that is