UNA NUEVA PERSPECTIVA

LATIDIA

Preparando tu experiencia…

Tu lugar en este universo.

Con tu autorización. Las coordenadas se muestran sólo en esta página y no se guardan.

CONECTANDO FUENTES
← Actualidad

LATIDIA · Ciberseguridad

¿Quién juzga a los jueces? Un referente chino de control de calidad en seguridad para evaluar las respuestas de los LLM y a los jueces de seguridad.

arXiv:2609.01210v2 Anuncio Tipo: reemplazar Resumen: Los puntos de referencia de seguridad para grandes modelos de lenguaje a menudo evalúan el riesgo de una consulta de usuario, aunque el resultado de la respuesta a la pregunta depende de si la respuesta viola un

WhatsApp ↗Telegram ↗
Ilustración editorial relacionada con ¿Quién juzga a los jueces? Un referente chino de control de calidad en seguridad para evaluar las respuestas de los LLM y a los jueces de seguridad.
Ilustración conceptual de LATIDIA.

La noticia

arXiv:2609.01210v2 Announce Type: replace Abstract: Safety benchmarks for large language models often assess the risk of a user query, although the outcome of question answering depends on whether the response violates a policy. This distinction is critical in Chinese harmful-content evaluation, where linguistic variation and adversarial transformations can obscure risky intent. We introduce C-SafeQA, a policy-grounded benchmark for response-level Chinese safety evaluation. It comprises 538 base queries and 8,877 adversarial queries answered by four full-model LLM deployments, yielding 37,660 query-response records labeled safe, unsafe, or disputed. Reference labels are generated through agreement-aware multi-model adjudication and blind audits of stratified subsets by three safety experts. C-SafeQA supports both evaluation of target-model

← Volver a los modelos

Cargando ficha del modelo…

LATIDIA / lectura con contexto