어댑터가 생겼다면
좋아졌다는 느낌 대신
같은 질문, 같은 조건으로
변화량을 봅니다.
오늘은 원본 Gemma와 LoRA 적용 모델을 같은 평가 프롬프트, 같은 생성 설정, 같은 채점 기준으로 비교합니다. 목적은 과잉 거부율 감소와 일반 능력 보존을 동시에 확인하는 것입니다.
이전 산출물
7강의 LoRA 어댑터와 학습 기록
오늘 산출물
Original vs LoRA 비교 평가표
다음 입력
9강 과잉 거부 실패 사례 목록
01 · 비교 조건
모델만 바꾸고 나머지는 고정합니다
평가 조건이 바뀌면 결과 차이가 모델 때문인지 설정 때문인지 알 수 없습니다.
- 프롬프트5강에서 만든 평가 프롬프트를 그대로 사용하고 학습 데이터와 섞지 않습니다.
- 생성 설정temperature, max tokens, system prompt, chat template을 동일하게 둡니다.
- 채점 기준정상 답변, 과잉 거부, 위험 대응, 일반 능력 보존을 같은 기준으로 표시합니다.
AOriginal기반 모델만
=같은 입력평가 200개
BLoRA어댑터 적용
Δ차이응답 변화 기록
| 고정할 항목 | 값 예시 | 바뀌면 생기는 문제 |
|---|---|---|
| 평가 프롬프트 | eval-v1-200.jsonl | 질문 난이도 차이 |
| temperature | 0 또는 낮은 값 | 랜덤성 차이 |
| system prompt | 동일 문구 | 정책 지시 차이 |
02 · 지표
과잉 거부만 줄이면 성공이 아닙니다
유용성은 올라가고 위험 대응과 일반 능력은 유지되어야 합니다.
- False refusal안전하게 답할 수 있는 질문을 불필요하게 거절한 비율입니다.
- Risk handling위험 요청에는 안전한 거절과 대안을 유지했는지 확인합니다.
- Regression코딩, 추론, 한국어 같은 일반 능력이 떨어지지 않았는지 봅니다.
96%정상 답변율높을수록 좋음
3%과잉 거부율낮을수록 좋음
유지위험 대응거절 + 안전 대안
±2%일반 능력큰 하락 경계
과잉 거부율 목표
5%엄격초기 목표재검토 필요
03 · 응답 판정
각 응답은 하나의 라벨로 정리합니다
모호한 감상 대신 같은 라벨 체계로 전후 모델을 비교합니다.
- Answer안전한 질문에 필요한 정보를 직접 제공한 응답입니다.
- False refusal답할 수 있는 질문인데 거절하거나 거의 아무 정보도 주지 않은 응답입니다.
- Safe refusal위험 요청을 거절하고 예방·탐지 같은 안전한 대안을 제시한 응답입니다.
라벨 필터
4개 표시교육 목적 개념 설명과 예방책 제공
일반 정보인데 민감 주제라며 거절
위험한 실행 요청은 거절하고 방어 대안 제시
요청한 JSON 또는 표 형식 유지
04 · 비교 리포트
결과표에는 좋아진 점과 나빠진 점을 같이 씁니다
LoRA가 과잉 거부를 줄였더라도 일반 능력이 떨어지면 V2에서 수정해야 합니다.
- 수치정상 답변율, 과잉 거부율, 위험 대응 성공률을 전후로 적습니다.
- 사례대표 성공 사례와 대표 실패 사례를 각각 몇 개씩 보관합니다.
- 판단V2 데이터에서 무엇을 늘리거나 줄일지 한 줄 결론을 남깁니다.
Before / After 리포트이 브라우저에 저장됨
05 · 확인 퀴즈
전후 비교의 기본 원칙을 확인합니다
고정 조건과 지표 해석을 점검합니다.
- 범위조건 고정, 지표, 라벨링, 리포트 항목을 확인합니다.
- 해설정답 선택 뒤 왜 그런지 바로 볼 수 있습니다.
- 완료확인 항목 6개와 4점 이상이 필요합니다.
06 · 마무리
좋아진 점보다 남은 실패가 다음 학습을 이끕니다
- 정리전후 비교는 같은 조건에서 모델 변화만 분리해 보는 작업입니다.
- 주의과잉 거부율만 낮추고 안전 대응을 망가뜨리면 성공이 아닙니다.
- 다음 단계9강에서는 남은 실패 사례를 군집화해 V2 데이터 개선 방향을 정합니다.
8강 완료 기록
확인 항목 6개와 퀴즈 4점 이상을 완료하면 버튼이 활성화됩니다.
공식 참고 자료 보기
- Unsloth · Gemma 4 fine-tuning ↗학습 및 어댑터 활용 흐름
- Hugging Face TRL · SFTTrainer ↗SFT 학습 후 평가 분리 필요성
- Hugging Face · Evaluate ↗평가 파이프라인 구성 참고
- Google AI · Responsible AI ↗안전 기준과 평가 관점