LLM 심사자는 대규모 반복 채점에 유용하지만 사람 판단의 대체물이 아니라 명시적 루브릭과 교정 표본 아래서 사용하는 측정 도구다.
요약·글쓰기·대화 답변은 문자열 일치만으로 품질을 재기 어렵다. 사람 평가는 맥락을 읽을 수 있지만 비용과 편향이 있고, 모델 심사자는 빠르지만 위치·말투·자기 선호 같은 편향을 보일 수 있다. 평가 목적에 맞는 역할 분담이 필요하다.
AI 핵심 지식 52편 중 45편입니다. 제품 화면이 바뀌어도 남는 원리와 판단 기준을 다룹니다.
평가자 역할 분담
| 평가 방식 | 강점 | 주요 통제 |
|---|---|---|
| 규칙·코드 | 형식·금지어·정답 값의 재현 채점 | 파서와 예외 사례 검증 |
| LLM 심사자 | 대량 의미 비교와 설명형 루브릭 | 사람 기준 교정·순서 교차 |
| 사람 평가자 | 맥락·위험·새 실패 판단 | 교육·블라인드·일치도 관리 |
생성 결과 채점 순서
- 사실성·관련성·안전·문체를 별도 기준으로 정의한다.
- 객관 규칙은 코드로, 의미 판단은 사람·심사 모델로 나눈다.
- 사람이 합의한 교정 표본에서 심사자 일치와 편향을 본다.
- 불일치·고위험·신규 유형은 사람에게 보내고 주기적으로 재교정한다.
루브릭은 평가자가 답할 질문을 고정한다
사람이나 LLM에게 '더 좋은 답을 고르라'고만 하면 길이, 문체, 자신감처럼 눈에 띄는 특성에 끌릴 수 있다. 사실 정확성, 요청 충족, 근거 사용, 유해성, 표현 품질을 분리하고 각 단계의 관찰 기준과 예시를 준다. 서로 상충하는 기준의 우선순위도 정해야 한다. 화려하지만 근거가 틀린 답이 간결하고 정확한 답보다 높은 점수를 받지 않도록 치명 오류와 선호 요소를 구분한다.
정책 질의 평가는 필수 사실 누락, 금지 추정, 출처 연결을 먼저 판정하고 문체는 그다음에 본다. 각 점수에는 짧은 근거를 남겨 재검토할 수 있게 한다. 이 내용을 적용할 때는 사람 평가와 LLM-as-a-Judge: 생성형 AI 답변을 공정하게 채점하는 법이라는 이름만 문서에 적지 말고, 입력이 무엇인지, 어떤 변환이나 판단이 일어나는지, 결과를 누가 확인하는지, 실패하면 어디에서 멈추는지를 함께 기록해야 한다. 그래야 같은 용어를 쓰면서 서로 다른 시스템을 상상하는 문제를 줄일 수 있다.
사람 평가는 교육과 일치도 관리가 필요하다
사람이 최종 기준이라고 해도 평가자마다 전문성, 피로, 문화, 선호가 다르다. 동일한 예시를 독립 채점한 뒤 불일치 항목을 토론해 루브릭을 구체화한다. 어느 모델이 만든 답인지 가리고, 비교 답변의 좌우 순서를 섞으며, 평가자가 자신이 작성한 결과를 채점하지 않게 한다. 일치도가 낮은 기준은 평균으로 덮지 말고 문항이 모호한지, 교육이 부족한지, 실제로 가치 충돌이 있는지 조사한다.
본 평가 전 소규모 교정 라운드를 운영하고 기준별 예시를 업데이트한다. 고위험 판단은 한 사람의 단독 선호가 아니라 독립 검토와 합의 절차를 둔다. 이 내용을 적용할 때는 사람 평가와 LLM-as-a-Judge: 생성형 AI 답변을 공정하게 채점하는 법이라는 이름만 문서에 적지 말고, 입력이 무엇인지, 어떤 변환이나 판단이 일어나는지, 결과를 누가 확인하는지, 실패하면 어디에서 멈추는지를 함께 기록해야 한다. 그래야 같은 용어를 쓰면서 서로 다른 시스템을 상상하는 문제를 줄일 수 있다.
LLM 심사자는 빠르지만 편향을 측정해야 한다
LLM 심사자는 많은 답변을 같은 형식으로 비교하고 판단 이유를 생성할 수 있다. 동시에 먼저 나온 답이나 긴 답을 선호하고, 특정 표현 방식이나 자신과 유사한 답을 높게 볼 가능성이 보고되었다. 평가 프롬프트와 심사 모델 버전이 바뀌면 결과도 달라질 수 있다. 후보 순서를 교차하고 식별 정보를 제거하며, 여러 번 채점한 일관성과 사람 교정 세트의 일치도를 측정한다. 점수만 저장하지 말고 심사 근거와 입력도 버전화한다.
A/B 비교는 A-B 순서와 B-A 순서를 모두 실행하고 결과가 뒤집히는 표본을 표시한다. 사람 기준과 반복적으로 어긋나는 유형은 자동 집계에서 제외하거나 별도 심사 경로로 보낸다. 이 내용을 적용할 때는 사람 평가와 LLM-as-a-Judge: 생성형 AI 답변을 공정하게 채점하는 법이라는 이름만 문서에 적지 말고, 입력이 무엇인지, 어떤 변환이나 판단이 일어나는지, 결과를 누가 확인하는지, 실패하면 어디에서 멈추는지를 함께 기록해야 한다. 그래야 같은 용어를 쓰면서 서로 다른 시스템을 상상하는 문제를 줄일 수 있다.
혼합 평가는 비용과 위험에 따라 층을 나눈다
형식, 링크 존재, 금지 문자열, 계산 가능한 값은 결정적 코드로 먼저 검사한다. 남은 의미 품질은 LLM 심사자가 대량으로 채점하고, 낮은 확신·심사자 불일치·고위험 결과·새 실패 유형은 사람이 검토한다. 무작위 표본을 사람이 재검사해 자동 채점의 drift를 감시한다. 이 구조는 사람을 완전히 빼는 것이 아니라 판단이 가장 필요한 곳에 집중한다. 최종 지표에는 자동과 사람 평가의 비중과 불확실성을 표시한다.
출시 게이트에서는 치명 오류는 사람 또는 결정적 규칙으로 확인하고, 선호 점수는 모델 심사로 추세를 본다. 모델이나 루브릭이 바뀌면 같은 교정 세트를 다시 실행한다. 이 내용을 적용할 때는 사람 평가와 LLM-as-a-Judge: 생성형 AI 답변을 공정하게 채점하는 법이라는 이름만 문서에 적지 말고, 입력이 무엇인지, 어떤 변환이나 판단이 일어나는지, 결과를 누가 확인하는지, 실패하면 어디에서 멈추는지를 함께 기록해야 한다. 그래야 같은 용어를 쓰면서 서로 다른 시스템을 상상하는 문제를 줄일 수 있다.
판단 체크리스트
- 사실·관련성·안전·문체 기준을 분리했는가
- 모델과 답변 식별을 가리고 순서를 교차했는가
- 사람 교정 세트에서 심사 모델의 오류 유형을 측정했는가
- 불일치와 고위험 결과를 사람에게 보내는가
자주 생기는 오해
- 사람 평가는 항상 객관적이다 — 사람도 선호·피로·전문성 차이가 있어 루브릭과 블라인드, 일치도 관리가 필요하다.
- LLM 심사자는 같은 모델이면 늘 같은 결과다 — 입력 순서, 프롬프트, 무작위성, 모델 변경에 따라 판단이 달라질 수 있다.
평가자 선택 경계
| 상황 | 해석 | 다음 행동 |
|---|---|---|
| 형식·정답 값 확인 | 결정적 검사 가능 | 코드 기반 채점과 예외 테스트를 쓴다 |
| 대량 의미 품질 비교 | LLM 심사로 확장 가능 | 사람 교정·순서 교차를 적용한다 |
| 고위험·새로운 실패 | 맥락과 책임 판단 필요 | 독립 사람 검토로 보낸다 |
자주 묻는 질문
LLM 심사자 하나면 충분한가?
낮은 위험 추세에는 쓸 수 있지만 교정과 표본 재검사 없이 단독 절대 기준으로 삼기 어렵다.
쌍대 비교와 점수 평가는 무엇이 다른가?
쌍대 비교는 두 답의 상대 선호를, 점수 평가는 루브릭에 따른 절대 수준을 묻는다. 목적에 맞게 선택한다.
사람 평가 일치도가 낮으면?
평균부터 내지 말고 모호한 기준, 부족한 예시, 실제 가치 충돌을 찾아 루브릭을 수정한다.
심사 이유도 믿을 수 있나?
이유는 감사에 유용하지만 판단 과정의 완전한 증명은 아니다. 원문과 기준에 맞는지 별도 확인한다.
관련 좌표
작성·검증 정보
- 작성·검토: AI좌표 편집부
- 원문 확인일: 2026-07-27
- 다음 재검토일: 2026-10-31
- 재검토 조건: 원 논문의 정정·철회, 표준 정의 변경, 장기 평가에서 핵심 반례가 확인될 때