UNA NUEVA PERSPECTIVA

LATIDIA

Preparando tu experiencia…

Tu lugar en este universo.

Con tu autorización. Las coordenadas se muestran sólo en esta página y no se guardan.

CONECTANDO FUENTES
← Actualidad

LATIDIA · Ciberseguridad

Seguridad más allá de la interfaz: detección de daños a través de estados latentes en modelos de lenguaje grandes

arXiv: 2609.19472v1Tipo de Anuncio: Cross Resumen: Los sistemas autónomos dependen cada vez más de los Modelos de Lenguaje Grande (LLM), sin embargo, la infraestructura de seguridad que rodea a estos modelos introduce latencia y sobrecarga de cómputo. Esto

WhatsApp ↗Telegram ↗
Ilustración editorial relacionada con Seguridad más allá de la interfaz: detección de daños a través de estados latentes en modelos de lenguaje grandes
Ilustración conceptual de LATIDIA.

La noticia

arXiv:2609.19472v1 Announce Type: cross Abstract: Autonomous systems increasingly rely on Large Language Models (LLMs) yet the safety infrastructure surrounding these models introduces latency and compute overhead. This limits utility in resource-constrained, time-critical deployments. Existing external guardrail models remain blind to the model's internal workings, creating a fundamental assurance gap. We ask: does the model already know when the content is harmful? We extract activations from LLaMA-3.1-8B and train lightweight MLP classifier probes (12.6M parameters) to detect harmful prompts. Evaluated on WildJailbreak, Beavertails, and AEGIS 2.0, our probes achieve F1 scores of 99%, 83%, and 84%, respectively competitive with 1000x larger guard models while cutting latency and compute costs.

← Volver a los modelos

Cargando ficha del modelo…

LATIDIA / lectura con contexto