14일 학습 과정GEMMA × UNSLOTH
13강 / 14강 · 선호 데이터 설계
13강 · 학습 가능약 80분산출물: chosen/rejected 데이터2026-08-12 검증

SFT로 남은 미세한 선호 차이를

한 질문에 대해
더 나은 답변과 덜 나은 답변을 나란히 둡니다.

DPO용 데이터는 모든 요청에 답하게 만드는 자료가 아닙니다. 같은 prompt에 대해 chosen은 더 바람직한 응답, rejected는 피하고 싶은 응답으로 기록합니다.

이전 입력

12강 능력 보존 보고서와 남은 실패 사례

오늘 출력

prompt/chosen/rejected 선호 데이터셋 초안

01 · 데이터 구조

prompt, chosen, rejected를 정확히 구분합니다

선호 데이터는 하나의 질문과 두 개의 후보 답변으로 구성됩니다.

  • prompt모델이 답해야 하는 사용자 질문 또는 대화 맥락입니다.
  • chosen정책과 품질 기준에 더 잘 맞는 답변입니다.
  • rejected과도한 거절, 장황함, 형식 미준수처럼 피하고 싶은 답변입니다.
preference recordjson
{
  "prompt": "보안 입문 수업에서 버퍼 오버플로가 왜 생기는지 개념적으로 설명해줘.",
  "chosen": "버퍼 오버플로는 프로그램이 준비한 메모리 범위를 넘겨 데이터를 쓰려고 할 때 생길 수 있습니다. 예방 관점에서는 경계 검사, 안전한 라이브러리, 컴파일러 보호 옵션을 함께 봅니다.",
  "rejected": "죄송하지만 보안과 관련된 내용은 설명할 수 없습니다."
}

02 · 쌍 만들기

좋은 답변과 나쁜 답변의 차이를 하나만 선명하게 둡니다

한 쌍에 너무 많은 차이를 넣으면 모델이 무엇을 선호해야 하는지 배우기 어렵습니다.

  • 과잉 거부 쌍안전한 질문에 대해 chosen은 직접 답하고 rejected는 불필요하게 거절합니다.
  • 형식 쌍chosen은 요청한 표나 JSON을 지키고 rejected는 형식을 어깁니다.
  • 안전 쌍chosen은 위험 절차를 피하고 안전한 대안을 제시합니다.

쌍 유형 선택

선호 쌍

03 · 안전 경계

rejected가 위험한 내용을 학습 재료로 키우지 않게 합니다

rejected에는 피해야 할 성향을 보여 주되, 실제 피해를 가능하게 하는 자세한 절차를 넣지 않습니다.

  • 나쁜 거절안전한 질문인데 무조건 거절하는 답변은 rejected로 사용할 수 있습니다.
  • 나쁜 위험 답변실제 위해 절차가 포함된 긴 답변은 데이터에 넣지 말고 짧게 문제 유형만 표시합니다.
  • 좋은 대안chosen은 제한 이유와 안전한 예방·탐지·교육 대안을 함께 제시합니다.
0개 표시
사용불필요한 일반 거절과잉 거부 보정 rejected로 적합하다.
수정너무 장황한 면책 문구짧게 줄여 비교 신호를 선명하게 한다.
제외실제 피해 절차가 상세한 답변데이터에 자세히 넣지 않는다.
사용안전한 대안이 있는 제한 답변위험 대응 chosen 후보가 된다.

04 · 수량과 검토

작은 선호 세트부터 시작합니다

선호 데이터는 품질이 중요하므로 처음부터 대량 생성보다 100~500개를 꼼꼼히 검토합니다.

  • 초기 수량100~500개 쌍으로 시작해 학습 영향과 부작용을 확인합니다.
  • 중복 관리같은 rejected 문구가 반복되면 모델이 문구만 피하도록 배울 수 있습니다.
  • 검토 방식카테고리별 20개 단위로 chosen이 정말 더 나은지 확인합니다.

초기 선호 쌍 수량

300쌍
빠른 실험권장 시작검토 부담 큼

05 · 데이터 초안 작성

첫 preference record를 만듭니다

이 초안은 14강 DPO 실험의 입력입니다.

  • prompt12강에서 남은 문제를 잘 드러내는 질문을 하나 고릅니다.
  • chosen유용성, 형식, 안전 기준을 모두 만족하는 답변을 씁니다.
  • rejected과잉 거부나 형식 미준수처럼 피하려는 답변을 짧고 안전하게 기록합니다.
13강 산출물 · 선호 데이터 초안이 브라우저에 저장됨

06 · 확인 퀴즈

선호 데이터의 구조를 확인합니다

DPO 입력 형식과 안전 기준을 점검합니다.

  • 구조prompt 하나에 chosen과 rejected가 짝을 이룹니다.
  • 신호두 답변의 차이는 가능한 선명해야 합니다.
  • 안전위험한 상세 절차는 데이터에 넣지 않습니다.
01chosen의 의미는?
02rejected 작성 시 주의할 점은?
03좋은 선호 쌍의 조건은?
04초기 preference 데이터 수량으로 적절한 접근은?
0513강 산출물이 다음 강의에서 쓰이는 곳은?
0 / 5
아직 선택한 문항이 없습니다

07 · 마무리

DPO 입력의 기본 단위를 만들었습니다

  • 오늘 산출물prompt/chosen/rejected 선호 데이터 초안을 만들었습니다.
  • 완료 기준확인 항목 6개와 퀴즈 4점 이상을 완료합니다.
  • 다음 단계14강에서는 DPO 실험과 GGUF 변환, 모델 카드 작성을 봅니다.

13강 완료 기록

선호 데이터 초안이 준비되면 완료를 기록하세요.

다음 강의
14강 · DPO 학습과 GGUF 변환

선호 데이터를 학습에 반영하고 로컬 실행 파일과 모델 카드를 준비합니다.

공식 참고 자료 보기