UNA NUEVA PERSPECTIVA

LATIDIA

Preparando tu experiencia…

Tu lugar en este universo.

Con tu autorización. Las coordenadas se muestran sólo en esta página y no se guardan.

CONECTANDO FUENTES
← Actualidad

LATIDIA · Ciberseguridad

Evaluación de seguridad de cuatro estados de modelos de lenguaje grande de peso abierto en entradas no canónicas

arXiv: 2610.09033v1Tipo de anuncio: Cross Resumen: Las evaluaciones de seguridad estándar de los modelos de lenguaje grandes evalúan las solicitudes dañinas escritas en texto sin formato canónico, mientras que los modelos en implementación en el mundo real reciben rutinariamente información

WhatsApp ↗Telegram ↗
Ilustración editorial relacionada con Evaluación de seguridad de cuatro estados de modelos de lenguaje grande de peso abierto en entradas no canónicas
Ilustración conceptual de LATIDIA.

La noticia

arXiv:2610.09033v1 Announce Type: cross Abstract: Standard safety evaluations of large language models assess harmful requests written in canonical plain text, while models in real-world deployment routinely receive inputs containing emojis, altered spellings, encoded strings, and character-level variations. This work introduces the Adversarial Surface-Form Robustness Dataset (ASRD), comprising 2,100 prompts across seven distinct surface-form families. Five open-weight language models are evaluated across these prompts, producing 10,500 responses. The Quad-State Evaluation Rubric classifies each response into one of four outcomes: harmful compliance, safe response, comprehension failure, or indeterminate. Emoji and invisible Unicode variations cause almost no comprehension failure, with pooled harmful compliance of 20.27% and 17.20% against a 22.87% baseline that is

← Volver a los modelos

Cargando ficha del modelo…

LATIDIA / lectura con contexto