UNA NUEVA PERSPECTIVA

LATIDIA

Preparando tu experiencia…

Tu lugar en este universo.

Con tu autorización. Las coordenadas se muestran sólo en esta página y no se guardan.

CONECTANDO FUENTES
← Observatorio P(Doom)

Ciberseguridad / ANTECEDENTE 2024

Experimento

AgentDojo prueba qué ocurre cuando los datos intentan dar órdenes

Lo documentado

AgentDojo ofrece un entorno para evaluar ataques de inyección de instrucciones y defensas en agentes que utilizan herramientas. El contenido que un agente consulta puede intentar desviar la tarea legítima.

Por qué importa

El problema aparece cuando un correo, documento o resultado externo se interpreta como autoridad para actuar. Separar datos e instrucciones ayuda a analizar dónde se rompe esa frontera.

Alcance de la evidencia

Es un banco de pruebas. La vulnerabilidad concreta depende del modelo, las herramientas, la defensa y la versión evaluados.

Qué conviene examinar

Para comparar este antecedente con un sistema actual, identificá la versión, el entorno de uso, los permisos disponibles y las medidas de supervisión. Distinguí la conducta observada de su interpretación y verificá si la fuente publicó correcciones o mitigaciones posteriores.

La existencia de este caso no permite calcular por sí sola un porcentaje de riesgo catastrófico. Su valor es documentar un mecanismo o una consecuencia y orientar preguntas concretas de seguridad.

Fuente y documentación

ETH Zurich e Invariant Labs ↗

Año del antecedente: 2024. Síntesis original de LATIDIA; no reproduce íntegramente el artículo original ni implica una investigación independiente del hecho.

WhatsApp ↗Telegram ↗

Seguí investigando

← Volver a los modelos

Cargando ficha del modelo…

LATIDIA / lectura con contexto