LATIDIA · Ciberseguridad
¿Las defensas contra la extracción de LLM funcionan en todos los ataques? Un punto de referencia del ciclo de vida de la extracción del modelo de caja negra
arXiv: 2610.00839v1Tipo de anuncio: nuevo Resumen: los modelos de lenguaje grandes (LLM) implementados a través de API de solo texto enfrentan riesgos de extracción de modelos, ya que los adversarios pueden recopilar sus respuestas para entrenar sustitutos que reproducen el
WhatsApp ↗Telegram ↗
La noticia
arXiv:2610.00839v1 Announce Type: new Abstract: Large language models (LLMs) deployed through text-only APIs face model extraction risks, as adversaries can collect their responses to train surrogates that reproduce their capabilities. While prior work has developed diverse attacks and defenses, evaluations remain fragmented across access assumptions, model configurations, query budgets, and security objectives, limiting comparability across methods. To address this gap, we introduce a unified benchmark covering six extraction attacks, ten defenses, and two adaptive attacks that paraphrase or back-translate protected responses before surrogate training. The benchmark controls model configurations, query data, budgets, and held-out evaluation conditions within each comparison while preserving attack-specific querying and training procedures. We measure surrogate capability,