10강 V2 설계안을 실행 가능한 실험으로
두 번째 학습은
가설을 바꾸고 기록을 남기는 일입니다.
V2 학습은 “더 오래 돌리기”가 아닙니다. 바꾼 데이터와 설정이 무엇인지 기록하고, 같은 평가로 V1과 비교할 수 있게 만드는 실험입니다.
이전 입력
V2 데이터셋 설계와 품질 검사 기준
오늘 출력
LoRA V2 설정표, 학습 로그 체크포인트, 어댑터 저장 기록
01 · 실험 가설
V1에서 무엇을 바꾸는지 한 문장으로 씁니다
V2 학습은 데이터만 바꿀 수도 있고 rank, learning rate, epoch 같은 설정을 함께 조정할 수도 있습니다.
- 한 번에 적게데이터와 설정을 모두 크게 바꾸면 원인을 알기 어렵습니다.
- 비교 가능성V1과 같은 평가 세트로 비교할 수 있어야 합니다.
- 목표 지표과잉 거부율 감소와 일반 능력 보존을 동시에 적습니다.
변경점V2 데이터 비율부족 유형 중심으로 예시를 보강합니다.
고정점평가 세트5강의 고정 질문을 그대로 씁니다.
판단점성공 기준false refusal과 회귀 점수를 같이 봅니다.
02 · 설정 선택
설정값은 메모리와 성향 변화 속도를 함께 바꿉니다
초기에는 보수적인 LoRA 설정으로 시작하고, V1 로그에서 불안정했던 부분만 조정합니다.
- rank어댑터가 표현할 변화량의 폭을 정하지만 크다고 항상 좋은 것은 아닙니다.
- learning rate너무 높으면 성향이 급격히 흔들리고, 너무 낮으면 변화가 작을 수 있습니다.
- epoch작은 모델과 작은 데이터에서는 과학습을 먼저 의심해야 합니다.
변경할 설정 선택
실험 결정
| 설정 | 처음 권장 | 올리는 경우 | 내리는 경우 |
|---|---|---|---|
| rank | 16 | 변화량이 부족하고 회귀가 작을 때 | 과학습이나 파일 크기가 부담될 때 |
| learning rate | 1e-4~2e-4 | 성향 변화가 거의 없을 때 | 출력이 불안정하거나 일반 능력이 떨어질 때 |
| epochs | 1~3 | 평가 개선이 꾸준할 때 | 정책 문구를 외우거나 품질이 떨어질 때 |
03 · 학습 실행
실행 코드는 기록 가능한 형태로 남깁니다
환경에 따라 정확한 옵션은 바뀔 수 있으므로, 모델 ID와 데이터 경로, 저장 경로가 분명해야 합니다.
- 모델 ID학습 대상은 지시 튜닝 모델
google/gemma-4-E2B-it로 고정합니다. - 데이터 경로V2 데이터셋 파일과 train/eval 분리를 실행 로그에 남깁니다.
- 저장 경로V1과 섞이지 않도록 V2 어댑터 폴더명을 별도로 둡니다.
model_id = "google/gemma-4-E2B-it"
dataset_path = "data/sft_v2.jsonl"
adapter_out = "outputs/gemma-e2b-lora-v2"
# 실제 실행 전에는 Unsloth 공식 Gemma 4 예제와 현재 설치 버전을 확인합니다.
# 기록할 것: seed, rank, learning_rate, epochs, batch, gradient_accumulation, eval set01데이터 확인샘플 50개 수동 검토
02짧은 실행로그와 loss 흐름 확인
03어댑터 저장V2 경로로 분리
04동일 평가8강 방식으로 비교
04 · 로그 읽기
loss만 보지 말고 출력 샘플을 함께 봅니다
학습 loss가 내려가도 원하는 방향으로 좋아졌다는 뜻은 아닙니다. 짧은 샘플 평가를 중간에 확인합니다.
- loss학습 데이터 예측이 쉬워지는 흐름을 보여 주지만 품질 전체를 대표하지는 않습니다.
- 샘플 출력안전한 질문, 경계 질문, 위험 요청을 각각 몇 개씩 확인합니다.
- 중단 기준일반 답변이 나빠지거나 제한 기준이 흐려지면 추가 학습을 멈춥니다.
중간 점검 주기
100 step자주 확인보통드물게 확인
중단 신호
위험 요청에 대한 거절이 약해지거나, 한국어 답변이 짧은 정책 문구로만 굳어지면 학습을 멈추고 데이터 품질을 다시 봅니다.
05 · 실험 기록 작성
V2 어댑터 기록을 완성합니다
이 기록은 12강 회귀 테스트의 입력입니다.
- 가설V2 데이터와 설정 변경으로 어떤 지표가 좋아질지 씁니다.
- 실행값rank, learning rate, epoch, seed, 저장 경로를 남깁니다.
- 관찰loss와 샘플 출력에서 본 이상 징후나 개선점을 적습니다.
11강 산출물 · LoRA V2 실험 기록이 브라우저에 저장됨
06 · 확인 퀴즈
V2 학습 실험을 확인합니다
설정과 기록의 의미를 점검합니다.
- 가설바꾼 것과 고정한 것을 분리합니다.
- 로그loss와 샘플 출력을 같이 봅니다.
- 저장V1과 V2 어댑터 경로를 분리합니다.
07 · 마무리
이제 V2 어댑터를 평가할 준비가 됐습니다
- 오늘 산출물V2 학습 가설, 설정, 로그, 저장 경로를 남겼습니다.
- 완료 기준확인 항목 6개와 퀴즈 4점 이상을 완료합니다.
- 다음 단계12강에서는 원래 능력이 유지되는지 회귀 테스트를 합니다.
11강 완료 기록
실험 기록이 준비되면 완료를 기록하세요.
공식 참고 자료 보기
- Unsloth · Gemma 4 파인튜닝 ↗Gemma 4 SFT, LoRA, 저장 예제
- Hugging Face TRL · SFTTrainer ↗SFT 학습 구성 개념
- Hugging Face PEFT ↗LoRA 어댑터 개념
- Google AI · Gemma 문서 ↗Gemma 모델 사용 지침