LATIDIA · Ciberseguridad
Dynamic Deep Prompt Optimization para defenderse de los ataques de jailbreak en LLM
arXiv:2609.26185v1 Tipo de anuncio: nuevo Resumen: los modelos de lenguaje grandes (LLM) demuestran capacidades impresionantes en muchas aplicaciones, pero siguen siendo vulnerables a los ataques de jailbreak, que provocan con
WhatsApp ↗Telegram ↗
La noticia
arXiv:2609.26185v1 Announce Type: new Abstract: Large Language Models (LLMs) demonstrate impressive capabilities across many applications but remain vulnerable to jailbreak attacks, which elicit harmful or unintended content. While model fine-tuning is an option for safety alignment, it is costly and prone to catastrophic forgetting. Prompt optimization has emerged as a promising alternative, yet existing prompt-based defenses typically rely on static modifications (e.g., fixed prefixes or suffixes) that cannot adapt to diverse and evolving attacks. We propose Dynamic Deep Prompt Optimization (DDPO), the first jailbreak defense based on deep prompt optimization. DDPO uses the target LLM's own intermediate layers as feature extractors to dynamically generate defensive embeddings via a lightweight multilayer