인공지능/논문 리뷰 or 진행

Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge

이게될까 2026. 7. 23. 01:58
728x90
728x90

https://aclanthology.org/2025.ijcnlp-long.18/

 

Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge

Lin Shi, Chiyu Ma, Wenhua Liang, Xingjian Diao, Weicheng Ma, Soroush Vosoughi. Proceedings of the 14th International Joint Conference on Natural Language Processing and the 4th Conference of the Asia-Pacific Chapter of the Association for Computational Lin

aclanthology.org

 

IJCNLP 2025에 붙은 논문입니다. 

llm 두개 이상의 응답을 평가할 때 실제 응답 품질보다 위치에 따라 판단이 달라지는 것을 체계적으로 분석합니다. 

2026.07.22 - [인공지능/논문 리뷰 or 진행] - Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

 

Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

https://arxiv.org/abs/2306.05685 Judging LLM-as-a-Judge with MT-Bench and Chatbot ArenaEvaluating large language model (LLM) based chat assistants is challenging due to their broad capabilities and the inadequacy of existing benchmarks in measuring human p

yoonschallenge.tistory.com

이 논문과 유사하네요 

 

Repetition stability - 반복 안정성 : Judge 판단의 안정성 확인 

Position Consistency - 위치 일관성 : 위치 선호도를 확인할 수 있게 함. 

Preference Fairness - 선호 공정성 : 위치 일관적인 판단도 공정한 판단으로 반영함 

수준 분석 요인 설명
Judge-Level 모델 계열 GPT, Claude, Gemini, Llama 등 Judge의 계열적 특성
Candidate-Level Answer Quality Gap 후보 응답 간 품질 차이
Candidate/Task-Level 출력 길이 후보 응답의 평균 길이
Task-Level 입력 길이 질문 자체의 길이
전체 Prompt Prompt 길이 지시문, 질문, 후보 응답을 포함한 전체 길이

Claude, GPT는 높은 일관성을 가지고 거의 공정한 모델임. 

task에 따라 편향 방향이 변하기도 함. 

품질 차이가 작을수록 편향이 심해지는건 동일함. 

연구 목적 LLM-as-a-Judge가 후보 응답의 실제 품질이 아니라 프롬프트에서 제시된 위치에 따라 판단을 바꾸는 Position Bias를 Pairwise 및 List-wise 비교 환경에서 체계적으로 분석한다.
핵심 문제 기존 연구는 주로 응답 순서를 바꿨을 때 결과가 일치하는지만 측정했기 때문에, 판단 변화가 무작위 생성 때문인지, 특정 위치에 대한 체계적 선호 때문인지, 후보 수가 증가해도 동일한 현상이 나타나는지 충분히 설명하지 못했다.
Position Bias 정의 원래 순서 [A, B]와 교체 순서 [B, A]를 평가했을 때 동일한 후보가 아니라 항상 첫 번째 또는 두 번째 위치의 응답을 선택하는 현상이다.
첫 번째 위치 선호는 Primacy Preference, 뒤쪽 위치 선호는 Recency Preference로 정의한다.
제안 지표 1: Repetition Stability (RS) 동일한 평가 프롬프트를 반복 제시했을 때 같은 판단을 내리는 정도이다.
높은 RS는 관찰된 위치 편향이 단순한 sampling 변동이 아니라 안정적으로 반복되는 판단 패턴임을 의미한다.
제안 지표 2: Position Consistency (PC) 후보 응답의 순서를 바꾸어도 동일한 후보를 승자로 선택하는 비율이다.
높을수록 위치에 영향을 덜 받으며, 낮을수록 위치 편향이 강하다.
제안 지표 3: Preference Fairness (PF) 위치 불일치가 발생했을 때 특정 위치를 어느 정도 선호하는지를 -1~1로 측정한다.
-1은 완전한 Primacy Preference, 0은 위치 공정성, 1은 완전한 Recency Preference를 의미한다.
실험 구성 GPT, Claude, Gemini, Llama 계열의 15개 LLM Judge를 평가했다.
MTBench와 DevBench의 22개 Task, 약 40개 응답 생성 모델, 10만 건 이상의 평가 인스턴스를 사용했다.
Pairwise가 주 실험이며, 일부 모델을 대상으로 3개 후보의 List-wise 평가도 수행했다.
핵심 결과 1 성능이 높은 Judge들은 대부분 RS > 0.85였으며 GPT-4, Claude-3.5-Sonnet, Llama-3.3-70B 등은 약 0.95 이상의 RS를 기록했다.
따라서 위치 편향은 단순한 무작위 출력이 아니라 체계적이고 재현 가능한 현상이다.
핵심 결과 2 위치 편향은 Judge와 Task에 따라 크게 달라진다.
동일한 모델도 MTBench와 DevBench에서 선호 방향이 달라질 수 있으며, Coding에서는 안정적이지만 Writing이나 Humanities에서는 불안정할 수 있다.
따라서 Judge의 신뢰성은 모델 단위가 아니라 Judge–Task 조합별로 평가해야 한다.
핵심 결과 3 후보 응답 간 품질 차이(Answer Quality Gap)가 가장 중요한 영향 요인이다.
두 응답의 품질이 비슷할수록 판단이 어려워져 PC가 낮아지고 위치 편향이 증가한다.
반대로 한 응답이 명확히 우수하면 Judge는 위치와 무관하게 더 일관된 판단을 내린다.
핵심 결과 4 질문 길이, 후보 응답 길이, 전체 Prompt 길이와 위치 편향의 관계는 매우 약했다.
출력 길이가 PF에 통계적으로 유의한 경우는 있었지만, Judge·Task·품질 차이에 비해 영향력이 미미했다.
Pairwise vs. List-wise 후보 수가 증가하면 전반적으로 PC가 감소했다.
Claude-3.5-Sonnet과 GPT-4o 같은 강한 Judge는 비교적 안정성을 유지했지만, GPT-3.5-Turbo는 Pairwise PC 0.70에서 List-wise PC 0.34로 크게 하락했다.
Judge 간 합의 분석 평균 PC와 PF가 비슷한 Judge도 개별 사례에서는 서로 다른 판단을 내렸다.
다수 Judge가 합의하는 사례는 평가가 쉬운 반면, 품질 차이가 작고 disagreement가 큰 사례는 어렵고 위치 편향에 취약했다.
MTBench에서 과반수 Judge가 합의하지 못한 극단적 난이도 사례는 2% 미만이었다.
주요 기여 위치 편향을 반복 안정성–위치 일관성–선호 공정성의 세 관점에서 평가하는 통합 프레임워크를 제시하고, 이를 Pairwise에서 List-wise로 확장했다.
또한 Judge-Level, Candidate-Level, Task-Level 요인을 구분해 편향의 주요 원인을 실증적으로 분석했다.
한계 두 Benchmark와 제한된 Judge만 평가했고, List-wise는 세 후보와 네 Judge에 한정된다.
폐쇄형 모델의 구조적 요인을 직접 분석하지 못했으며, 연구의 초점은 편향의 측정과 이해로서 새로운 편향 완화 기법은 제안하지 않는다.
최종 결론 및 실무적 의미 LLM Judge의 단일 순서·단일 실행 결과를 그대로 신뢰해서는 안 된다.
특히 품질이 유사한 답안을 평가할 때는 응답 순서 교환, 반복 평가, 동점 허용, 복수 Judge의 합의 또는 인간 검토를 함께 사용하는 것이 필요하다.
728x90