UNA NUEVA PERSPECTIVA

LATIDIA

Preparando tu experiencia…

Tu lugar en este universo.

Con tu autorización. Las coordenadas se muestran sólo en esta página y no se guardan.

CONECTANDO FUENTES
← Actualidad

LATIDIA · Investigación

Cómo el envoltorio narrativo afecta el rechazo de LLM: un punto de referencia y defensa entre idiomas

arXiv: 2610.11005v1Tipo de anuncio: nuevo Resumen: Los modelos de lenguaje alineados con la seguridad a menudo rechazan una solicitud dañina declarada directamente, pero responden a la misma solicitud dentro de un juego de roles o envoltorio narrativo. Medimos esta vulnerabilidad

WhatsApp ↗Telegram ↗
Ilustración editorial relacionada con Cómo el envoltorio narrativo afecta el rechazo de LLM: un punto de referencia y defensa entre idiomas
Ilustración conceptual de LATIDIA.

La noticia

arXiv:2610.11005v1 Announce Type: new Abstract: Safety-aligned language models often refuse a harmful request stated directly but answer the same request inside a role-play or narrative wrapper. We measure this vulnerability across languages and registers: attack success on Qwen3-1.7B is already 89.4% in English and 93.0% in modern Chinese, and reaches 95.7% in Classical Chinese. We build GUISE, a benchmark for systematically studying this vulnerability. It includes parallel requests in English, modern Chinese, and Classical Chinese, matched harmful and benign pairs, wrapper types held out for evaluation, and a stricter criterion that counts warn-then-answer responses as attack successes. Representation analysis shows that language and register move harmful-request representations only slightly away

← Volver a los modelos

Cargando ficha del modelo…

LATIDIA / lectura con contexto