UNA NUEVA PERSPECTIVA

LATIDIA

Preparando tu experiencia…

Tu lugar en este universo.

Con tu autorización. Las coordenadas se muestran sólo en esta página y no se guardan.

CONECTANDO FUENTES
← Actualidad

LATIDIA · Ciberseguridad

Dynamic Deep Prompt Optimization para defenderse de los ataques de jailbreak en LLM

arXiv:2609.26185v1 Tipo de anuncio: nuevo Resumen: los modelos de lenguaje grandes (LLM) demuestran capacidades impresionantes en muchas aplicaciones, pero siguen siendo vulnerables a los ataques de jailbreak, que provocan con

WhatsApp ↗Telegram ↗
Ilustración editorial relacionada con Dynamic Deep Prompt Optimization para defenderse de los ataques de jailbreak en LLM
Ilustración conceptual de LATIDIA.

La noticia

arXiv:2609.26185v1 Announce Type: new Abstract: Large Language Models (LLMs) demonstrate impressive capabilities across many applications but remain vulnerable to jailbreak attacks, which elicit harmful or unintended content. While model fine-tuning is an option for safety alignment, it is costly and prone to catastrophic forgetting. Prompt optimization has emerged as a promising alternative, yet existing prompt-based defenses typically rely on static modifications (e.g., fixed prefixes or suffixes) that cannot adapt to diverse and evolving attacks. We propose Dynamic Deep Prompt Optimization (DDPO), the first jailbreak defense based on deep prompt optimization. DDPO uses the target LLM's own intermediate layers as feature extractors to dynamically generate defensive embeddings via a lightweight multilayer

← Volver a los modelos

Cargando ficha del modelo…

LATIDIA / lectura con contexto