LATIDIA · Investigación
Auditoría de confiabilidad basada en pruebas de la predicción de resultados tempranos basada en la trayectoria para agentes de LLM: la transferencia de calibración específica del objetivo persiste dentro de un solo punto de referencia
arXiv: 2609.25647v1Tipo de anuncio: nuevo Resumen: La predicción de resultados tempranos basada en la trayectoria puede disminuir los gastos asociados con la evaluación del agente al finalizar una ejecución una vez que el resultado se vuelve lo suficientemente predictivo
WhatsApp ↗Telegram ↗
La noticia
arXiv:2609.25647v1 Announce Type: new Abstract: Predicting early outcomes based on trajectory can decrease the expenses associated with agent evaluation by terminating a run once the outcome becomes sufficiently predictable, assuming that the predictor's confidence is properly calibrated. Calibration is at risk when a predictor is applied to an agent on which it was never trained, but it is not known whether such transfer failures are broad across agent systems or concentrated in specific target agent/head combinations. Using public SWE-bench Verified trajectories and a frozen dual-head early-outcome prediction pipeline, we ran a leave-one-agent-out calibration audit, a shared-predictor leave-two-agents-out control, oracle prior correction, and a robustness battery over training cohorts, task resampling,