LATIDIA · Ciberseguridad
La toma de huellas dactilares del modelo de lenguaje requiere repensar a los maestros de marcas de agua
arXiv: 2610.04169v1 Tipo de anuncio: nuevo Resumen: la huella digital LLM a través de la destilación de marca de agua incorpora una señal estadística de marca de agua en los pesos del modelo, lo que permite a los propietarios de modelos identificar sus modelos detrás de las API de caja negra
WhatsApp ↗Telegram ↗
La noticia
arXiv:2610.04169v1 Announce Type: new Abstract: LLM fingerprinting via watermark distillation embeds a statistical watermark signal into model weights, enabling model owners to identify their models behind black-box APIs. Revisiting a recent protocol, we find that its utility evaluation understates text quality degradation in open-ended generation, favoring overly strong watermark teachers. Weakening the watermark improves text quality but sacrifices detectability. To move beyond this trade-off, we rethink whether text watermarks designed for verifying generated text are suitable distillation teachers for model fingerprinting. Such watermarks are typically designed to remain detectable from an individual output, limiting how sparse the watermark signal can be. In contrast, fingerprint verification can aggregate signal across queries,