UNA NUEVA PERSPECTIVA

LATIDIA

Preparando tu experiencia…

Tu lugar en este universo.

Con tu autorización. Las coordenadas se muestran sólo en esta página y no se guardan.

CONECTANDO FUENTES
← Observatorio P(Doom)

Agentes / ANTECEDENTE 2024

Experimento

AgentHarm: rechazar una pregunta y frenar una acción son problemas distintos

Lo documentado

AgentHarm reúne tareas dañinas de varios pasos para evaluar agentes con herramientas. Sus autores encontraron que algunos modelos podían mantener capacidad operativa después de intentos de eludir sus protecciones.

Por qué importa

Una evaluación de seguridad debe distinguir entre lo que un modelo dice y lo que efectivamente hace con sus herramientas. Los permisos y la revisión de acciones modifican las consecuencias posibles.

Alcance de la evidencia

Las tareas son escenarios de evaluación; no se presentan como delitos consumados. No se publican aquí instrucciones para reproducir acciones dañinas.

Qué conviene examinar

Para comparar este antecedente con un sistema actual, identificá la versión, el entorno de uso, los permisos disponibles y las medidas de supervisión. Distinguí la conducta observada de su interpretación y verificá si la fuente publicó correcciones o mitigaciones posteriores.

La existencia de este caso no permite calcular por sí sola un porcentaje de riesgo catastrófico. Su valor es documentar un mecanismo o una consecuencia y orientar preguntas concretas de seguridad.

Fuente y documentación

Investigadores · arXiv ↗

Año del antecedente: 2024. Síntesis original de LATIDIA; no reproduce íntegramente el artículo original ni implica una investigación independiente del hecho.

WhatsApp ↗Telegram ↗

Seguí investigando

← Volver a los modelos

Cargando ficha del modelo…

LATIDIA / lectura con contexto