SFT·RLHF·DPO: 언어 모델의 응답 행동을 조정하는 세 경로

SFT·RLHF·DPO: 언어 모델의 응답 행동을 조정하는 세 경로

SFT는 좋은 응답 시범을 모방하고, RLHF는 선호로 학습한 보상을 강화학습으로 최적화하며, DPO는 선호 응답 쌍에서 정책을 직접 조정하지만 어느 방식도 진실성이나 안전을 자동 보장하지 않습니다.

사전학습 모델에서 SFT 시범 경로와 RLHF 보상 경로, DPO 선호 쌍 경로가 갈라지는 비교도

세 방법의 차이는 이름보다 어떤 인간 신호를 수집하고 그 신호를 어떤 목적 함수로 모델 파라미터에 전달하는지에 있습니다.

AI 핵심 지식 52편 중 17편입니다. 제품 화면이 바뀌어도 남는 원리와 판단 기준을 다룹니다.

후속학습 방식의 입력과 최적화 대상

방식주요 학습 신호대표 운영 위험
SFT지시와 모범 응답의 짝시범 범위 밖 일반화·비싼 작성 품질
RLHF응답 선호 비교로 만든 보상보상 대리목표 과최적화·복잡한 학습
DPO선호·비선호 응답 쌍과 기준 정책오프라인 선호 데이터 편향·목표 민감도
공통 평가업무별 행동·사실·안전 시험단일 선호 점수로 실패를 숨김
지시·모범 응답으로 학습하는 SFT와 선호 비교를 쓰는 RLHF·DPO의 데이터 흐름

후속학습 방식을 선택하는 순서

  1. 원하는 행동과 허용하지 않을 실패를 관찰 가능한 기준으로 쓴다.
  2. 좋은 시범과 선호 비교 중 안정적으로 수집할 신호를 정한다.
  3. 평가자 지침과 의견 불일치 처리 규칙을 먼저 시험한다.
  4. SFT 기준선 뒤 RLHF 또는 DPO의 추가 이득을 분리 측정한다.
  5. 선호도와 사실성·안전·과업 성공을 각각 독립 평가한다.

SFT는 모범 응답의 행동 패턴을 직접 모방한다

Supervised Fine-Tuning은 지시와 원하는 응답으로 이루어진 데이터에서 다음 토큰 손실을 줄이도록 사전학습 모델을 추가 학습한다. 답변 형식, 말투, 과업 절차와 거부 예시를 명시적으로 보여 줄 수 있어 후속학습의 기준선을 만들기 좋다. 그러나 모델은 시범에 없는 모든 상황의 원칙을 자동으로 추론하지 않는다. 작성자의 오류와 편향, 상충하는 지침도 함께 배울 수 있으며 드문 실패를 충분히 보여 주기 어렵다. 데이터 양보다 한 지시에 대해 무엇이 좋은 답인지 일관되게 정의했는지가 중요하다. 훈련 전에 평가자 지침을 만들고, 같은 입력을 여러 작성자가 처리해 합의가 낮은 유형을 찾는다. SFT 결과는 원 모델과 비교해 지시 준수뿐 아니라 사실 정확도, 과도한 거부와 기존 유용성 저하를 함께 측정해야 한다.

선호도 상승과 사실성·안전·유용성 회귀를 독립 축으로 확인하는 평가 보드

RLHF는 인간 선호를 보상 모델과 정책 학습으로 연결한다

대표적인 RLHF 절차에서는 한 입력에 대한 여러 모델 응답을 사람이 비교해 선호 순서를 만든다. 이 비교 데이터로 어떤 응답이 더 선호될지 예측하는 보상 모델을 학습하고, 언어 모델 정책이 높은 보상을 받도록 강화학습으로 조정한다. 기준 정책에서 너무 멀어지지 않도록 제약을 두는 이유는 보상 모델의 빈틈을 과도하게 이용하거나 언어 품질이 무너지는 일을 줄이기 위해서다. 인간 선호는 유용한 행동 신호지만 진실의 직접 측정값은 아니다. 평가자가 그럴듯한 오류를 선호하거나 문화와 맥락별 가치가 하나의 점수에 압축될 수 있다. 보상 상승만 성공 기준으로 쓰지 말고, 보상 모델이 보지 않은 독립 표본과 적대적 입력에서 사실성, 안전성과 일관성을 확인해야 한다.

DPO는 선호 쌍에서 정책을 직접 최적화한다

Direct Preference Optimization은 별도의 보상 모델을 명시적으로 학습한 뒤 강화학습 루프를 돌리는 대신, 선호 응답과 비선호 응답의 상대 확률을 조정하는 분류 형태의 목적을 사용한다. 기준 정책과의 관계를 포함한 유도식을 통해 선호 데이터에서 정책을 직접 업데이트하므로 구현 파이프라인이 단순해질 수 있다. 그렇다고 선호 데이터 수집과 목표 설정의 어려움이 사라지는 것은 아니다. 비교 응답이 너무 쉽거나 한정된 분포에 몰리면 실제 경계 상황을 배우기 어렵고, 평가자 편향이 그대로 반영된다. 기준 모델, 손실의 강도 설정과 데이터 혼합이 결과에 영향을 준다. RLHF와 DPO를 비교할 때는 이름이나 학습 안정성만 보지 말고 같은 초기 모델, 같은 선호 데이터와 동일한 평가 세트에서 추가 이득과 회귀를 측정해야 한다.

정렬 평가는 선호, 사실, 안전과 유용성을 나눠야 한다

후속학습은 관찰된 인간 신호에 모델 행동을 맞추는 과정이지 모든 인간 가치와 사실을 하나의 정답으로 완성하는 절차가 아니다. 친절하고 길게 설명하는 응답이 선호도는 높지만 질문에 없는 사실을 덧붙일 수 있고, 안전을 강조한 모델이 무해한 요청까지 거부할 수 있다. 평균 승률 하나로 평가하면 이런 절충이 보이지 않는다. 평가 묶음에는 과업 성공, 근거 정확성, 불확실성 표현, 유해 요청 거부, 무해 요청 수용과 집단별 차이를 넣는다. 자동 평가자는 대규모 비교에 유용하지만 학습 모델과 유사한 편향을 공유할 수 있어 사람 검토와 규칙 기반 확인을 섞는다. 배포 후 새 입력이 쌓이면 실패 유형을 분류해 시범이나 선호 데이터로 되돌리되, 같은 평가 항목을 학습 데이터에 오염시키지 않도록 계보를 분리한다.

판단 체크리스트

  1. 원하는 행동과 금지 실패를 평가 가능한 문장으로 정의한다.
  2. 작성자·평가자 지침과 불일치 처리 방식을 버전 관리한다.
  3. 같은 초기 모델에서 SFT 기준선과 추가 선호학습을 비교한다.
  4. 선호도와 사실성·안전·유용성 회귀를 별도 보고한다.

자주 생기는 오해

  • RLHF는 사람이 모든 답을 실시간으로 교정하는 학습이다 — 보통 수집된 응답 비교로 보상 모델을 만들고 그 대리 보상을 정책 최적화에 사용한다.
  • DPO를 쓰면 보상 해킹과 선호 편향이 사라진다 — 학습 루프는 단순해질 수 있지만 선호 데이터와 목적 함수가 만든 대리목표 문제는 남는다.

후속학습 결과를 정렬 완료로 부르면 안 되는 신호

상황해석다음 행동
선호 승률만 상승사실성·안전 회귀가 숨을 수 있음지표 축을 분리해 재평가
평가자 합의가 낮은 데이터목표 행동 자체가 불명확함지침 보완과 불일치 보존
학습 세트와 같은 평가 문항암기와 일반화 구분이 어려움독립·적대적 평가 세트 사용

자주 묻는 질문

SFT 없이 바로 DPO를 할 수 있나?

수학적으로 가능한 설정이 있을 수 있지만, 실제 비교에서는 초기 정책과 선호 데이터의 품질이 중요합니다. SFT 기준선을 두면 추가 효과를 해석하기 쉽습니다.

RLHF의 인간 피드백은 사실 판정인가?

항상 그렇지 않습니다. 평가자는 지침에 따라 더 나은 응답을 고르며 선호에는 유용성, 문체와 안전 판단이 섞일 수 있어 사실성 평가를 따로 해야 합니다.

DPO는 보상 모델을 전혀 가정하지 않나?

별도의 명시적 보상 모델 학습 단계를 생략하지만, 선호 최적화의 유도에는 보상과 기준 정책의 관계가 들어갑니다. 단순한 지도 분류와 완전히 같지는 않습니다.

후속학습을 많이 하면 환각이 없어지나?

원하지 않는 행동을 줄일 수는 있지만 학습 신호 밖의 사실 오류를 제거한다고 보장할 수 없습니다. 검색, 검증과 거부 기준을 함께 설계해야 합니다.

관련 좌표

작성·검증 정보

  • 작성·검토: AI좌표 편집부
  • 원문 확인일: 2026-07-27
  • 다음 재검토일: 2027-01-27
  • 재검토 조건: 원 논문의 정정·철회, 표준 정의 변경, 장기 평가에서 핵심 반례가 확인될 때

출처

댓글