평가표가 생겼다면
실패를 숨기지 말고
유형별로 묶어서
다음 데이터를 설계합니다.
오늘은 남은 과잉 거부와 회귀 사례를 분석합니다. 단순히 더 많이 학습시키는 것이 아니라 어떤 데이터가 부족했는지, 어떤 기준이 흔들렸는지 찾습니다.
이전 산출물
8강의 Original vs LoRA 비교 리포트
오늘 산출물
실패 유형표와 V2 보강 가설
다음 입력
10강 데이터셋 확장 계획
01 · 실패 유형
과잉 거부는 하나의 문제가 아닙니다
거절 문구가 비슷해 보여도 원인은 다를 수 있습니다.
- 주제 민감도안전한 교육 질문인데 특정 단어 때문에 거절하는 경우입니다.
- 목적 오해방어·예방 목적을 공격 의도로 잘못 읽는 경우입니다.
- 형식 회피답은 가능하지만 JSON, 표, 단계 요약 같은 요청 형식을 따르지 않는 경우입니다.
실패 유형 필터
5개 표시교육 목적 보안 개념도 무조건 거절
탐지·예방 질문을 공격 요청으로 해석
표 요청에 긴 문단으로만 답변
수업·보고서 맥락을 반영하지 않음
안전 설명은 했지만 체크리스트가 빠짐
02 · 원인 찾기
실패의 원인은 데이터 결손에서 찾습니다
무작정 epoch를 늘리기 전에 어떤 예시가 부족했는지 확인합니다.
- 데이터 부족특정 주제의 안전한 답변 예시가 너무 적으면 여전히 거절할 수 있습니다.
- 라벨 충돌비슷한 질문에 서로 다른 답변 기준을 넣으면 모델 판단이 흔들립니다.
- 일반 능력 손상보정 데이터가 한쪽으로 치우치면 코딩·추론·한국어 품질이 떨어질 수 있습니다.
| 관찰 | 가능한 원인 | V2 조치 |
|---|---|---|
| 교육 질문 거절 | 안전한 설명 예시 부족 | 교육·예방 답변 예시 추가 |
| 경계선 질문 과답변 | 제한 답변 예시 부족 | 맥락 확인과 범위 제한 예시 추가 |
| 코딩 품질 하락 | 일반 능력 보존 데이터 부족 | 일반 코딩·추론 예시 비율 보강 |
V2 보강 우선순위
40%작은 보강실패 중심치우침 주의
03 · 정책 기준
거절을 줄이되 위험 기준은 낮추지 않습니다
V2 개선은 안전한 질문의 답변율을 올리는 작업이지 위험 요청을 허용하는 작업이 아닙니다.
- 답변 가능일반 정보, 교육, 방어, 예방 목적은 구체적이되 안전한 범위에서 답합니다.
- 제한 필요목적이 불분명하면 맥락을 확인하고 안전한 수준의 개념 설명으로 제한합니다.
- 거절 필요실제 피해를 돕는 요청은 거절하고 방어·예방 대안을 제공합니다.
응답 기준 선택
권장 대응
직접 답변
안전한 교육·예방 질문에는 필요한 개념과 실천 가능한 방어 조치를 설명합니다.
답변 가능04 · 실패 분석 워크시트
V2에 넣을 보강 가설을 작성합니다
실패 사례를 그대로 더 넣는 것이 아니라 원인과 수정 방향으로 바꿉니다.
- 사례대표 실패 프롬프트와 원본·LoRA 응답 차이를 기록합니다.
- 원인주제 민감도, 목적 오해, 형식 회피, 일반 능력 손상 중 하나로 분류합니다.
- 보강V2에서 추가할 예시의 방향과 제외할 내용을 함께 적습니다.
실패 사례 분석표이 브라우저에 저장됨
05 · 확인 퀴즈
오류 분석의 핵심 기준을 확인합니다
실패를 데이터 개선으로 연결하는지 점검합니다.
- 범위실패 유형, 원인 분석, 정책 기준, V2 보강 방향을 확인합니다.
- 해설선택 즉시 이유를 보고 기준을 다시 점검합니다.
- 완료확인 항목 6개와 퀴즈 4점 이상이 필요합니다.
06 · 마무리
V2는 실패 사례에서 출발합니다
- 정리실패를 유형화하면 다음 데이터셋에서 무엇을 보강할지 명확해집니다.
- 주의안전한 질문의 과잉 거부와 위험 요청의 안전 거절을 혼동하지 않습니다.
- 다음 단계10강에서는 이 분석을 바탕으로 1,000~2,000개 규모의 V2를 설계합니다.
9강 완료 기록
확인 항목 6개와 퀴즈 4점 이상을 완료하면 버튼이 활성화됩니다.
공식 참고 자료 보기
- Google AI · Responsible AI ↗안전한 모델 평가와 사용 관점
- Google AI · Gemma 4 model card ↗모델 제한과 책임 있는 사용
- Hugging Face · Evaluate ↗평가 결과 관리 참고
- Unsloth · Gemma 4 fine-tuning ↗반복 학습 흐름 참고