Los grandes modelos de lenguaje (LLM) usados como jueces permiten una evaluación escalable, pero sus veredictos pueden ser sensibles al orden en que se presentan las respuestas y, aun eliminando ese efecto de posición, pueden divergir sistemáticamente de las preferencias humanas. Así lo plantea un nuevo artículo publicado en arXiv con el identificador 2609.31215v1, titulado DIAL: Position-Debiased LLM Judges with Adaptive Human Preference Calibration.
El trabajo introduce DIAL, un marco unificado que combina comparaciones abundantes entre LLM con comparaciones humanas limitadas. El objetivo es triple: separar los efectos de posición propios de cada juez, aprender una estructura compartida en las preferencias de los LLM una vez eliminado el sesgo de orden, y calibrar adaptativamente esa estructura hacia el objetivo de preferencia humana.
Tres frentes teóricos y una validación empírica
En el plano teórico, los autores estudian tres aspectos del marco. Primero, la identificación de las preferencias latentes de los LLM, los efectos de posición y la calibración humana. Segundo, una estimación adaptativa que equilibra el anclaje que aportan los LLM con la evidencia humana limitada. Tercero, la cuantificación de incertidumbre con pesos fijos para la preferencia humana calibrada.
En el plano empírico, la evaluación se divide en dos partes: el sesgo de posición y la alineación con humanos se analizan por separado en simulaciones controladas y en tres benchmarks de preferencia humana. Según el resumen, DIAL se mantiene robusto ante un orden de respuestas desbalanceado, logra rankings fuertemente alineados con humanos usando pocas etiquetas y se adapta hacia la evidencia humana cuando la información de los LLM es imperfecta.
Un recurso con más de 410.000 juicios
El estudio de datos reales recopiló más de 410.000 juicios de 21 jueces LLM, presentados en ambos órdenes de visualización. Ese conjunto se ofrece como recurso para futuras investigaciones sobre sesgo de los jueces automáticos, heterogeneidad entre modelos y alineación con preferencias humanas.
El artículo se enmarca en el área de Computer Science > Artificial Intelligence y está disponible en arXiv con versión PDF y HTML experimental. No se precisa en el material disponible la afiliación de los autores ni una fecha de publicación distinta a la indicada por el repositorio.









Comentarios
Comparte tu opinión de manera respetuosa.
Inicia sesión para dejar un comentario.