UNA NUEVA PERSPECTIVA

LATIDIA

Preparando tu experiencia…

Tu lugar en este universo.

Con tu autorización. Las coordenadas se muestran sólo en esta página y no se guardan.

CONECTANDO FUENTES
← Actualidad

LATIDIA · Ciberseguridad

El modelo planta el desencadenante: ataques de puerta trasera del lado de la respuesta en modelos de lenguaje grande de varios turnos

arXiv:2610.07723v1 Anuncio Tipo: nuevo Resumen: La alineación de seguridad en los modelos de lenguaje grandes (LLM) sigue siendo vulnerable a ataques de puerta trasera. Las puertas traseras de LLM existentes son casi todas centradas en la entrada: la activación depende de la entrada explícita.

WhatsApp ↗Telegram ↗
Ilustración editorial relacionada con El modelo planta el desencadenante: ataques de puerta trasera del lado de la respuesta en modelos de lenguaje grande de varios turnos
Ilustración conceptual de LATIDIA.

La noticia

arXiv:2610.07723v1 Announce Type: new Abstract: Safety alignment in Large Language Models (LLMs) remains vulnerable to backdoor attacks. Existing LLM backdoors are almost all input-centric: activation depends on explicit trigger patterns in the user input, so modern guardrails are built to sanitize the input space. We challenge this assumption with a novel answer-side backdoor for multi-turn dialogue. Instead of inserting the trigger into the input, the adversary uses a benign first-turn prompt to naturally induce the model to generate a specific, seemingly innocuous word. Once merged into the dialogue history, this self-generated word becomes the trigger. When a later harmful query arrives, the model detects its own trigger and bypasses its

← Volver a los modelos

Cargando ficha del modelo…

LATIDIA / lectura con contexto