Ciberseguridad / ANTECEDENTE 2024
ExperimentoAgentDojo prueba qué ocurre cuando los datos intentan dar órdenes
Lo documentado
AgentDojo ofrece un entorno para evaluar ataques de inyección de instrucciones y defensas en agentes que utilizan herramientas. El contenido que un agente consulta puede intentar desviar la tarea legítima.
Por qué importa
El problema aparece cuando un correo, documento o resultado externo se interpreta como autoridad para actuar. Separar datos e instrucciones ayuda a analizar dónde se rompe esa frontera.
Alcance de la evidencia
Qué conviene examinar
Para comparar este antecedente con un sistema actual, identificá la versión, el entorno de uso, los permisos disponibles y las medidas de supervisión. Distinguí la conducta observada de su interpretación y verificá si la fuente publicó correcciones o mitigaciones posteriores.
La existencia de este caso no permite calcular por sí sola un porcentaje de riesgo catastrófico. Su valor es documentar un mecanismo o una consecuencia y orientar preguntas concretas de seguridad.
WhatsApp ↗Telegram ↗Seguí investigando
Ciberseguridad · 2026
Informe del proveedorEl informe de septiembre de 2026 amplía el mapa del uso indebido de IA
Anthropic publicó una actualización sobre usos indebidos detectados, medidas de interrupción y nuevos ámbitos de evaluación de capacidades.
Ciberseguridad · 2025
Informe del proveedorAnthropic reportó una campaña de ciberespionaje asistida por agentes
Anthropic comunicó que detectó e interrumpió una campaña de ciberespionaje en la que actores humanos utilizaron capacidades de IA para automatizar parte de sus operaciones.