AX·실무에서 LLM을 쓰려면 프롬프트 문구만으로는 부족하다. 모델이 무엇을 학습했고, 입력을 어떤 경로로 다음 토큰까지 만드는지 알아야, 같은 문제를 프롬프트로 풀지 RAG로 풀지 파인튜닝까지 갈지 기준이 생긴다. 비개발자 15명에게 맞춘 약 95분 강의의 뼈대다.
LLM 신경망 학습부터 추론 원리 전체를 비개발자 15명에게 설명하는 강의
핵심 요약
- 학습의 본질: 거대한 텍스트(코퍼스)를 토큰으로 쪼개고, “다음 토큰이 무엇일지"를 맞히도록 수조 번 가깝게 가중치(파라미터)를 조정한다. 틀리면 역전파로 수정한다.
- 파인튜닝: 사전학습으로 쌓인 일반 언어 능력 위에, 특정 말투·도메인·지시 따르기를 추가 학습으로 얹는다. 모델의 “전부"를 从头 만드는 것이 아니다.
- 추론: 입력 토큰을 임베딩하고 Attention으로 맥락 관계를 계산한 뒤, 로짓→Softmax로 확률 분포를 만든다. Temperature·Top-K·Top-P로 샘플링 날카로움을 조절한다.
- 속도: KV Cache가 이전 키·값을 재사용해 생성 속도를 올린다. 파라미터가 클수록 학습·추론 모두 비용이 커지는 트레이드오프가 있다.
- 선택 기준: 최신·사내 지식이 필요하면 RAG, 형식·말투·좁은 스킬이면 파인튜닝, 단순 지시·역할이면 프롬프트. RAG는 검색으로 근거를 붙여 환각을 줄이고, 파인튜닝은 가중치 자체를 바꾼다.
상세 정리
왜 LLM 문해력인가
업계 대화에 끼려면 용어의 최소 이해가 필요하다. 목표가 “어떤 문제를 LLM으로 풀 때 프롬프트 / RAG / 파인튜닝 중 무엇을 고를지"에 답할 수 있는 사람이 되는 것이다.
토큰과 다음 토큰 예측
문장은 모델에게 글자가 아니라 토큰 시퀀스다. 학습은 앞 문맥이 주어졌을 때 다음 토큰 확률을 높이는 일이다. 맞히면 그 경로의 가중치가 강화되고, 틀리면 로스에 따라 역전파로 조정된다.
Attention과 샘플링
Attention은 현재 위치가 과거 토큰 중 어디에 더 주목할지 가중치를 계산한다. Softmax는 점수를 확률로 바꾸고, Temperature를 높이면 분포가 평평해져 다양성이 늘고, 낮추면 확실한 토큰에 쏠린다. Top-K·Top-P는 후보를 잘라 이상 토큰을 줄인다.
RAG vs 파인튜닝
- 프롬프트: 가중치 불변, 지시·예시로 행동 유도. 비용 최저.
- RAG: 외부 문서를 검색해 프롬프트에 첨부. 최신성·출처·사내 지식에 강함.
- 파인튜닝: 가중치 일부를 바꿔 습관을 고정. 반복되는 형식·도메인에 유리하나 데이터·비용·갱신 비용이 든다.
결정적 차이는 “지식을 모델 안에 구워 넣을지, 검색으로 붙일지"다. 자주 바뀌는 사실은 RAG, 변하지 않는 스킬·톤은 파인튜닝에 가깝다.
보는 포인트
- “다음 토큰 예측” 한 문장으로 학습을 설명하는 방식
- Softmax·Temperature가 창의성/안정성에 미치는 영향
- KV Cache가 채팅 응답 속도를 좌우한다는 점
- 프롬프트·RAG·파인튜닝 선택 트리
원본 정보
- 채널: 양실장의 바이브코딩대학
- 게시일: 2026-08-28
- 영상: https://www.youtube.com/watch?v=geY4UO23QA8
- 길이: 약 1시간 35분 · 조회수 약 38만 회 (2026-09 기준)