14일 학습 과정GEMMA × UNSLOTH
1강 / 14강 · 파인튜닝 기초
1강 · 학습 가능 약 70분 설치 없이 시작 2026-08-10 검증

파인튜닝을 시작하기 전에

무엇을 배우고,
무엇이 바뀌는지부터
눈으로 확인해 봅시다.

긴 설명 대신 직접 눌러 보고 비교합니다. 이 강의가 끝나면 모델, 학습 데이터, 학습 방식, 결과 파일의 차이를 구분할 수 있습니다.

  1. 모델 선택어디서 시작할까?
  2. 예시 준비무엇을 보여줄까?
  3. 형식 변환어떻게 입력할까?
  4. 학습어디까지 바꿀까?
  5. 결과 저장무엇이 남을까?

오늘 할 일

비교 2개, 변환 실습 1개, 사례 판단 1개, 목표 문장 작성

완료 기준

확인 항목 6개 + 퀴즈 5문항 중 4문항 이상

01 · 모델 비교

같은 질문을 두 모델에 보내보세요

아래 답변은 개념 이해를 위한 짧은 예시입니다. 실제 출력은 모델 설정에 따라 달라질 수 있습니다.

  • 기반 모델다음 토큰을 예측하며 문장을 이어 쓰도록 사전학습된 출발점입니다.
  • 지시 튜닝 모델질문과 답변 예시를 추가로 학습해 사용자의 요청과 출력 형식을 더 잘 따릅니다.
  • 이 과정의 선택대화 응답을 조정하는 것이 목표이므로 google/gemma-4-E2B-it에서 시작합니다.
선택한 질문이 글을 세 문장으로 요약해 줘.
기반 모델google/gemma-4-E2B
예상 경향

요약은 핵심 내용을 짧게 정리하는 방법으로, 글의 중요한 부분을 선택하고…

문장 이어 쓰기에 가까운 반응이 나올 수 있음
지시 튜닝 모델google/gemma-4-E2B-it
예상 경향

① 핵심 주장 ② 주요 근거 ③ 결론으로 나누어 세 문장으로 요약하겠습니다.

질문의 지시와 출력 형식을 따르도록 추가 학습됨
!

이 과정은 -it 모델에서 시작합니다. 이름 끝의 -assistant는 일반 대화용 모델이 아니라 추론 속도를 높이는 보조 모델이므로 학습 대상으로 선택하지 않습니다.

02 · 학습 방식

SFT와 LoRA는 서로 다른 질문에 답합니다

SFT는 무엇을 배우는지, FFT·LoRA·QLoRA는 모델을 어떻게 바꾸는지 설명합니다.

  • SFT입력과 원하는 답변의 짝을 보여 주어 모델이 어떤 응답 방식을 배울지 정합니다.
  • FFT와 LoRA전체 가중치를 바꿀지, 작은 추가 가중치만 학습할지 결정하는 방식입니다.
  • QLoRA양자화한 모델 본체에 LoRA를 적용해 로컬 학습의 메모리 부담을 더 줄입니다.
학습 목적SFT

입력과 원하는 답변의 예시를 보고 응답 방식을 배웁니다.

가중치 변경 방식FFT / LoRA / QLoRA

전체를 바꿀지, 작은 추가 가중치만 학습할지 정합니다.

방식을 눌러 비교해 보세요

LoRA

원본 모델은 그대로 두고, 작은 추가 가중치만 학습합니다.

상대적 메모리 부담개념 비교
낮음
주요 결과물
LoRA 어댑터
모델 가중치학습됨 고정됨

색이 채워진 칸이 학습되는 부분을 뜻합니다.

03 · 데이터 형식

대화 데이터가 모델 입력으로 바뀌는 과정을 확인하세요

대화 템플릿(chat template)은 역할이 있는 메시지를 모델이 학습할 문자열 형식으로 바꿉니다.

  • 대화 데이터사용자 질문과 모델 답변을 역할별로 나누어 원하는 대화 예시를 기록합니다.
  • 대화 템플릿각 역할과 발화의 경계를 모델이 알아볼 수 있는 토큰 순서로 변환합니다.
  • 일관성학습할 때와 실제로 질문할 때 같은 템플릿을 사용해야 응답 형식이 안정적입니다.
사람이 읽는 데이터messages.json
user
"피싱 예방 교육 자료를 만들어 줘."

assistant
"예방 중심 자료는 도와드릴 수 있습니다."
  • 사용자 역할
  • 모델 역할
모델에 입력되는 형식토큰 시퀀스
버튼을 누르면역할과 대화 경계가 표시됩니다
사용자 역할
피싱 예방 교육 자료를 만들어 줘.
대화 경계
모델 답변 시작
예방 중심 자료는 도와드릴 수 있습니다.
대화 경계

아직 변환하지 않았습니다.

01역할 구분누가 말했는지 표시
02대화 경계한 발화가 끝나는 위치
03답변 시작모델이 이어 쓸 위치

04 · 용어 정리

카드를 눌러 뜻을 확인하세요

영문 약어는 그대로 익히되, 설명은 일관된 한국어로 정리했습니다.

  • 출발점기반 모델과 지시 튜닝 모델은 학습을 시작하기 전 모델의 상태를 나타냅니다.
  • 학습 과정데이터셋·대화 템플릿·SFT·LoRA는 무엇을 어떤 방식으로 학습하는지 설명합니다.
  • 결과물어댑터·병합 모델·GGUF는 학습 뒤 저장하고 로컬에서 실행할 파일과 관련된 용어입니다.
1모델2데이터셋3대화 템플릿4SFT5어댑터6병합·GGUF

05 · 응답 기준

질문에 따라 원하는 대응이 어떻게 달라지는지 살펴보세요

목표는 거절을 없애는 것이 아니라, 안전한 질문을 불필요하게 거절하지 않도록 기준을 더 정확하게 만드는 것입니다.

  • 안전한 질문예방·교육·일반 정보처럼 안전하게 답할 수 있는 요청에는 필요한 내용을 직접 제공합니다.
  • 맥락 확인용도에 따라 위험성이 달라지는 질문은 목적과 범위를 확인한 뒤 안전한 수준에서 답합니다.
  • 위험한 요청실제 피해를 돕는 내용은 거절하되, 예방·탐지처럼 안전한 대안을 함께 제시합니다.
권장 대응

안전한 질문 · 직접 답변

피싱 예방 수칙, 의심 링크 확인법, 2단계 인증 사용법을 중심으로 교육 자료를 구성합니다.

도움이 되는 답변
안전 기준 유지
과잉 거부(false refusal)안전하게 답할 수 있는 질문인데도 모델이 불필요하게 거절하는 현상

06 · 내 목표 정하기

네 칸을 채워 파인튜닝 목표 문장을 만드세요

입력 내용은 이 브라우저에만 자동 저장됩니다.

  • 사용 상황누가 어떤 목적으로 모델을 사용할지 정하면 필요한 데이터의 범위가 선명해집니다.
  • 응답과 경계강화할 행동과 유지할 안전 기준을 함께 적어 한쪽으로 치우친 학습을 피합니다.
  • 성공 조건과잉 거부율이나 정답률처럼 학습 전후에 같은 방법으로 측정할 기준을 정합니다.
내 목표 문장

나는 [사용 상황]에서 [원하는 응답]을 강화하되, [안전 경계]는 유지하고 [성공 조건]으로 확인한다.

목표 입력이 브라우저에 저장됨

07 · 확인 퀴즈

마지막으로 핵심 개념을 확인하세요

선택 즉시 결과와 해설이 표시됩니다. 언제든 답을 다시 고를 수 있습니다.

  • 확인 범위모델의 종류, SFT와 LoRA, 대화 템플릿, 안전 목표를 구분할 수 있는지 확인합니다.
  • 즉시 해설답을 선택하면 정답 여부와 이유가 바로 표시되므로 틀린 개념을 곧바로 다시 볼 수 있습니다.
  • 통과 기준다섯 문항 중 네 문항 이상을 맞히고 앞의 확인 항목 여섯 개를 완료해야 합니다.
01기반 모델에 대한 설명으로 가장 정확한 것은?
02SFT의 핵심 목적은?
03LoRA에 대한 설명 중 틀린 것은?
04대화 템플릿이 중요한 이유는?
05이 과정의 안전 목표로 가장 적절한 것은?
0 / 5
아직 선택한 문항이 없습니다

08 · 마무리

이제 네 가지를 구분할 수 있으면 됩니다

  • 구분하기모델의 출발점, 학습 목표, 가중치 변경 방식, 최종 결과물을 서로 섞지 않고 설명합니다.
  • 기록하기확인 항목과 퀴즈를 마치면 1강 완료 상태가 이 브라우저에 저장됩니다.
  • 다음 단계2강에서는 LoRA와 QLoRA의 주요 설정값이 학습 결과와 메모리에 미치는 영향을 배웁니다.
출발점기반 모델 / 지시 튜닝 모델
학습 목표SFT
변경 방식FFT / LoRA / QLoRA
결과어댑터 / 병합 모델 / GGUF

1강 완료 기록

확인 항목 6개와 퀴즈 4점 이상을 완료하면 버튼이 활성화됩니다.

다음 강의
2강 · LoRA와 QLoRA 이해

랭크(rank), 알파(alpha), 적용 모듈(target module)이 메모리 사용량에 어떤 영향을 주는지 시각적으로 살펴봅니다.

공식 참고 자료 보기