좋은 골든 세트는 어려운 질문 모음이 아니라 실제 업무 분포와 고비용 실패를 대표하고 누구나 같은 기준으로 다시 채점할 수 있는 테스트 자산이다.
임의의 열 문항으로 모델을 비교하면 결과가 담당자의 취향과 예시 선택에 흔들린다. 평가하려는 업무 결정, 입력 범위, 허용 가능한 답, 금지해야 할 오류를 먼저 정의해야 한다. 세트는 한 번 만들고 끝나는 문서가 아니라 실패가 발견될 때 버전으로 갱신하는 운영 자산이다.
AI 핵심 지식 52편 중 42편입니다. 제품 화면이 바뀌어도 남는 원리와 판단 기준을 다룹니다.
골든 세트의 네 구성
| 구성 | 담아야 할 것 | 빠지면 생기는 문제 |
|---|---|---|
| 사례 | 실제 입력·조건·위험 태그 | 데모성 예시에 과적합 |
| 기대 결과 | 정답·허용 변형·근거 | 채점자마다 다른 결론 |
| 루브릭·버전 | 오류 등급·가중치·변경 이력 | 개선 전후 비교 불가능 |
골든 세트 구축 순서
- 업무 흐름과 잘못된 결과의 비용을 먼저 적는다.
- 일반·경계·고위험·거절 사례를 실제 자료에서 표본화한다.
- 전문가가 기대 결과와 허용 변형, 채점 근거를 작성한다.
- 평가 버전과 실행 조건을 고정해 변경 전후를 비교한다.
평가 문항은 업무 결정에서 거꾸로 만든다
평가의 시작은 '모델이 똑똑한가'가 아니라 '이 출력으로 누가 어떤 결정을 내리는가'다. 고객 문의 분류라면 최종 라벨과 잘못된 라우팅 비용이 중요하고, 요약이라면 핵심 의사결정 누락과 근거 왜곡이 중요하다. 먼저 성공 기준과 실패 비용을 정한 뒤 그 판단을 흔드는 입력을 수집한다. 자주 발생하는 평범한 사례와 빈도는 낮지만 피해가 큰 사례를 구분해 구성해야 평균 점수가 위험을 숨기지 않는다.
업무 담당자와 함께 입력, 기대 행동, 금지 행동, 사람에게 넘길 조건을 한 줄씩 적는다. 각 문항이 어떤 운영 결정을 검증하는지 설명할 수 없는 예시는 세트에서 제외한다. 이 내용을 적용할 때는 AI 평가 세트 만드는 법: 실제 업무 과제와 골든 세트의 기준이라는 이름만 문서에 적지 말고, 입력이 무엇인지, 어떤 변환이나 판단이 일어나는지, 결과를 누가 확인하는지, 실패하면 어디에서 멈추는지를 함께 기록해야 한다. 그래야 같은 용어를 쓰면서 서로 다른 시스템을 상상하는 문제를 줄일 수 있다.
골든 답은 하나의 문장보다 채점 가능한 기준이다
생성형 과제에는 표현이 다른 여러 정답이 있을 수 있다. 이때 하나의 모범 문구와 문자열 일치만 쓰면 좋은 답을 오답으로 만들고, 자연스럽지만 사실이 틀린 답을 놓칠 수 있다. 필수 포함 사실, 금지 주장, 근거 인용, 형식 제약, 불확실할 때의 행동을 루브릭으로 나눈다. 정답을 만든 전문가와 검토자가 의견이 다르면 합의 규칙과 남은 불확실성을 기록한다. 참조 답 자체도 오류가 있을 수 있다는 전제를 둔다.
정책 안내 답변은 필수 조항, 적용 조건, 예외, 출처 링크, 추정 금지를 각각 채점한다. 문체 점수와 사실 정확도 점수를 합치지 않고 실패가 어느 축인지 남긴다. 이 내용을 적용할 때는 AI 평가 세트 만드는 법: 실제 업무 과제와 골든 세트의 기준이라는 이름만 문서에 적지 말고, 입력이 무엇인지, 어떤 변환이나 판단이 일어나는지, 결과를 누가 확인하는지, 실패하면 어디에서 멈추는지를 함께 기록해야 한다. 그래야 같은 용어를 쓰면서 서로 다른 시스템을 상상하는 문제를 줄일 수 있다.
대표성은 평균과 경계 사례를 함께 담는 일이다
운영 로그에서 무작위로 뽑은 사례는 빈도가 높은 쉬운 입력에 치우칠 수 있다. 반대로 어려운 예시만 모으면 실제 처리량과 평균 경험을 왜곡한다. 일반 사례, 길거나 불완전한 입력, 모호한 요청, 악성 입력, 다국어, 도구 장애, 사람 전환이 필요한 사례를 층화한다. 개인정보와 기밀은 평가 목적에 필요한 최소 범위로 비식별화하거나 합성 대체하고, 원본과 대체본의 차이를 기록한다.
세트 목록에는 발생 빈도, 실패 영향, 사용자 집단, 입력 품질, 기대 경로 태그를 붙인다. 각 층의 결과를 따로 보고 새 실패 유형이 생기면 회귀 사례로 추가한다. 이 내용을 적용할 때는 AI 평가 세트 만드는 법: 실제 업무 과제와 골든 세트의 기준이라는 이름만 문서에 적지 말고, 입력이 무엇인지, 어떤 변환이나 판단이 일어나는지, 결과를 누가 확인하는지, 실패하면 어디에서 멈추는지를 함께 기록해야 한다. 그래야 같은 용어를 쓰면서 서로 다른 시스템을 상상하는 문제를 줄일 수 있다.
버전과 실행 조건이 있어야 비교가 된다
모델, 프롬프트, 검색 인덱스, 도구, 시스템 정책 중 하나만 바뀌어도 결과가 달라질 수 있다. 평가 실행에는 세트 버전, 시스템 구성, 무작위성 설정, 반복 횟수, 채점기 버전을 남긴다. 평가 세트를 수정하면서 과거 점수와 바로 비교하면 분모가 바뀌므로 공통 문항 결과와 신규 문항 결과를 나눠야 한다. 개발자가 평가 답을 보고 조정했다면 보이지 않는 보류 세트로 과적합을 점검한다.
출시 전에는 기존 회귀 세트와 신규 위험 세트를 각각 실행하고, 통과 기준과 예외 승인자를 기록한다. 실패 문항은 삭제하지 않고 원인·수정·재발 여부를 연결한다. 이 내용을 적용할 때는 AI 평가 세트 만드는 법: 실제 업무 과제와 골든 세트의 기준이라는 이름만 문서에 적지 말고, 입력이 무엇인지, 어떤 변환이나 판단이 일어나는지, 결과를 누가 확인하는지, 실패하면 어디에서 멈추는지를 함께 기록해야 한다. 그래야 같은 용어를 쓰면서 서로 다른 시스템을 상상하는 문제를 줄일 수 있다.
판단 체크리스트
- 각 문항이 실제 업무 결정과 연결되는가
- 일반·경계·고위험·거절 사례가 층화되어 있는가
- 필수·금지·근거·형식 기준이 채점 가능하게 적혔는가
- 세트와 시스템·채점기 버전을 함께 기록하는가
자주 생기는 오해
- 골든 세트는 정답 문장만 모은 파일이다 — 입력 조건, 허용 변형, 근거, 오류 등급, 버전이 함께 있어야 재현 가능한 평가가 된다.
- 문항 수가 많으면 대표성이 높다 — 업무 분포와 고위험 층을 어떻게 표본화했는지가 단순 개수보다 중요하다.
평가 세트 포함 경계
| 상황 | 해석 | 다음 행동 |
|---|---|---|
| 자주 발생하는 일반 요청 | 운영 분포 대표 사례 | 빈도에 맞게 기본 세트에 포함한다 |
| 드물지만 피해 큰 오류 | 고위험 경계 사례 | 별도 통과 기준과 사람 전환을 둔다 |
| 개발자가 반복해서 본 문항 | 평가 과적합 가능성 | 보류 세트로 일반화를 확인한다 |
자주 묻는 질문
몇 개의 문항이 필요하나?
고정 답은 없다. 중요한 실패 층을 대표하고 변경의 차이를 감지할 만큼 구성한 뒤 불확실성을 보고한다.
실제 고객 데이터를 써야 하나?
현실성은 중요하지만 목적·접근·보존·비식별을 검토하고 민감 정보는 최소화하거나 대체한다.
정답이 주관적인 과제는?
여러 평가자가 적용할 세부 루브릭과 예시를 만들고 의견 일치와 불일치 원인을 기록한다.
평가 문항을 학습에 써도 되나?
학습에 사용한 문항은 독립 평가가 아니다. 사용 사실을 표시하고 별도 보류 세트를 유지한다.
관련 좌표
작성·검증 정보
- 작성·검토: AI좌표 편집부
- 원문 확인일: 2026-07-27
- 다음 재검토일: 2026-10-31
- 재검토 조건: 원 논문의 정정·철회, 표준 정의 변경, 장기 평가에서 핵심 반례가 확인될 때