AI 모델이 다른 모델의 답변을 평가할 때 자신과 유사한 계열의 답변을 더 높게 평가하는 현상이 여러 실험에서 관찰됐다. 이 같은 편향이 모델 순위와 성능 측정 결과에 누적될 수 있다는 지적이 나온다.
크립토브리핑(CryptoBriefing)은 AI 평가자가 자신의 답변을 약 58%의 확률로 선호한다는 연구 결과를 소개했다. 그러나 해당 기사에는 연구 논문명과 원자료 링크가 제시되지 않아 이 수치는 검증된 연구 결과로 보기 어렵다.
◇ AI 평가자 편향의 구조
Chatbot Arena는 두 모델의 답변을 익명으로 비교한 뒤 이용자가 더 선호하는 답변을 선택하도록 설계된 평가 플랫폼이다. 관련 연구는 2024년 1월 기준 24만3329건의 대화와 50개 모델 데이터를 바탕으로 인간 선호에 따른 모델 평가 구조를 설명했다. Chatbot Arena 연구는 평가자가 인간 이용자라는 점에서 AI 평가와 구분된다.
문제는 평가자를 인간이 아닌 AI 모델로 바꿀 때 커질 수 있다. KAIST·KRAFTON 연구는 대규모 언어 모델 평가자가 정확성뿐 아니라 답변의 길이와 권위적인 문체 같은 표면적 특성에도 영향을 받는다고 분석했다. 두 답변을 직접 비교하는 방식에서는 이런 편향이 더 커질 수 있다고 설명했다. 관련 연구
IOV Labs는 6월 6일 공개한 통제 실험에서 4개 프런티어 모델을 대상으로 1152건의 쌍대 비교를 진행했다. 4개 모델 모두 자기 계열 답변을 상대적으로 선호했고, 자기 선호 지수 평균은 +0.14였다. GPT-4o의 지수는 +0.21로 제시됐다. IOV Labs 연구
다만 모델이 자기 답변의 작성자를 실제로 식별한 경우는 4개 중 1개에 그쳤다. 연구진은 이를 자기 답변을 알아보고 편드는 현상이라기보다, 자신과 유사한 문체·구성·표현 분포를 더 자연스럽거나 우수하다고 판단하는 현상으로 분석했다.
실험에서는 답변 순서와 길이에 따른 편향도 나타났다. 첫 번째로 제시된 답변이 선택된 비율은 63%였고, 답변 길이와 평가 결과의 상관계수는 0.98이었다. 답변의 실제 품질과 별개로 제시 순서와 분량이 결과에 영향을 줄 수 있다는 의미다.
◇ 리더보드 신뢰도에 미치는 영향
AI 평가자가 모델의 답변을 채점하고 그 결과가 모델 순위나 학습 데이터에 다시 반영되면 평가자의 선호가 순위에 누적될 수 있다. 특히 단일 평가 모델이 반복적으로 사용되면 특정 문체나 답변 구조에 유리한 결과가 만들어질 가능성이 있다.
AAAI에 게재된 2026년 연구는 모델마다 선호 편향이 달라 평가자별 순위가 일관되지 않을 수 있다고 지적했다. 연구진은 여러 평가자의 결과를 조정해 평가자 간 불일치를 줄이는 방법을 제안했다. AAAI 연구
대응책으로는 서로 다른 모델을 평가 패널에 포함하고, 인간 평가 표본과 결과를 대조하는 방식이 제시된다. 답변 순서를 바꿔 재평가하고 길이와 문체에 따른 효과를 별도로 측정하는 절차도 필요하다.
커뮤니티 실험에서도 인간과 AI 평가 결과를 비교해야 한다는 문제의식이 확인됐다. 한 Reddit 실험에서는 인간 29명과 AI 평가자 13개가 1181건의 쌍대 비교를 수행했고, 32개 질문 가운데 26개에서 같은 방향의 선호를 보였다고 작성자가 밝혔다. 다만 공식 학술 연구가 아닌 커뮤니티 실험인 만큼 결과를 일반화하기는 어렵다. 실험 결과
자기 선호 편향이 곧 평가 결과가 틀렸다는 뜻은 아니다. 모델이 자기 계열 답변을 선호한 일부 원인은 실제 답변 품질 차이일 수 있어, 편향과 품질 차이를 분리하는 추가 실험이 필요하다.
평가의 독립성과 검증 인프라를 둘러싼 논쟁은 앞서 AI 평가자의 접근권과 편집권, 보복 방지 장치를 요구한 사례에서도 제기됐다. 평가 대상 기업과 평가자가 어떤 정보를 공유하고 결과를 어떻게 공개할지까지 평가 체계의 신뢰도에 영향을 줄 수 있다.
현재 확인된 연구들은 AI 평가자에게 자기 선호와 순서·길이 편향이 나타날 수 있음을 보여준다. 그러나 이를 모든 모델과 평가 환경에 동일한 비율로 적용할 수는 없다.
가상자산 가격이나 블록체인 프로젝트에 대한 직접적인 영향은 제시되지 않았다. 이번 논의의 핵심은 AI 모델 순위와 벤치마크를 단일 평가자의 결과만으로 판단하기보다 평가자 다변화, 인간 표본 대조, 답변 순서 교차, 길이·문체 편향 검사를 함께 적용해야 한다는 점이다.

이도현 기자
댓글0
첫 댓글을 남겨 보세요.