UNA NUEVA PERSPECTIVA

LATIDIA

Preparando tu experiencia…

Tu lugar en este universo.

Con tu autorización. Las coordenadas se muestran sólo en esta página y no se guardan.

CONECTANDO FUENTES
← Actualidad

LATIDIA · Ciberseguridad

Desbloqueo de modelos LLM de peso abierto mediante perturbaciones de incrustación aleatoria

arXiv:2610.07125v1 Anuncio Tipo: nuevo Resumen: Si bien los modelos de peso abierto han experimentado un progreso constante en sus capacidades y una amplia adopción en múltiples dominios, su seguridad sigue siendo una preocupación importante. Una característica clave

WhatsApp ↗Telegram ↗
Ilustración editorial relacionada con Desbloqueo de modelos LLM de peso abierto mediante perturbaciones de incrustación aleatoria
Ilustración conceptual de LATIDIA.

La noticia

arXiv:2610.07125v1 Announce Type: new Abstract: While open-weight models have enjoyed steady progress in capabilities and wide adoption across multiple domains, their safety remains an important concern. One key feature is the ability to refuse or deflect harmful, malicious, or insensitive prompts. In this paper, we expose safety vulnerabilities across six common open-weight LLMs of various sizes that consistently lead to harmful or unsafe responses on the JailbreakBench benchmark dataset. Our proposed attack, Perturbed Embedding Vector (PEV), is a simple and fast "jailbreaking" technique that is cheaper than prior approaches, which typically require gradient computations, per-prompt optimizations, or altering internal weights of the models. PEV just adds independent Gaussian noise in

← Volver a los modelos

Cargando ficha del modelo…

LATIDIA / lectura con contexto