LATIDIA · Ciberseguridad
¿Quién juzga a los jueces? Un referente chino de control de calidad en seguridad para evaluar las respuestas de los LLM y a los jueces de seguridad.
arXiv:2609.01210v2 Anuncio Tipo: reemplazar Resumen: Los puntos de referencia de seguridad para grandes modelos de lenguaje a menudo evalúan el riesgo de una consulta de usuario, aunque el resultado de la respuesta a la pregunta depende de si la respuesta viola un
WhatsApp ↗Telegram ↗
La noticia
arXiv:2609.01210v2 Announce Type: replace Abstract: Safety benchmarks for large language models often assess the risk of a user query, although the outcome of question answering depends on whether the response violates a policy. This distinction is critical in Chinese harmful-content evaluation, where linguistic variation and adversarial transformations can obscure risky intent. We introduce C-SafeQA, a policy-grounded benchmark for response-level Chinese safety evaluation. It comprises 538 base queries and 8,877 adversarial queries answered by four full-model LLM deployments, yielding 37,660 query-response records labeled safe, unsafe, or disputed. Reference labels are generated through agreement-aware multi-model adjudication and blind audits of stratified subsets by three safety experts. C-SafeQA supports both evaluation of target-model