2025-07-07
INTRO
AI 공부하다가 LLM 기초 정리하기!
기초라고 하지만, 깊이 있는 내용을 다루고자 한다. The Full Stack에서 강의한 LLM Foundations 영상을 참고했다.
내용은 머신러닝 기초 → Transformer 블록 → 대표 LLM 군 → 운영 Tips 까지 포함한다.
1. Software 2.0 사고방식 — “데이터가 코드를 빚는다”

| 구분 | Software 1.0 | Software 2.0 |
| 코드 | 사람이 직접 로직 작성 | “학습 로봇”만 작성 → 데이터가 로직 생성 |
| 검증 | 유닛 테스트‧에지 케이스 명시 | Train / Val / Test 스플릿 + 지표 모니터링 |
| 버전 | Git commit 단위 | 데이터 스냅샷 + 파라미터 파일 |
핵심 키워드:
- 학습 종류
- Unsupervised: 패턴·생성 (ex. GPT pre-train)
- Supervised: 입력→라벨 (ex. 이미지 분류)
- Reinforcement: 상태→행동→보상 (ex. RLHF)
- ➡ Self-Supervised로 수렴: “라벨을 스스로 만들면 다 지도학습으로 표현 가능”
- 텐서 만능주의
- 이미지든 텍스트든 float32 행렬이면 끝
- GPU = 행렬곱 가속기 → 딥러닝 붐
2. Transformer ― Attention is all you need
2-1. 토큰에서 토큰으로
[입력 토큰] → [Embedding] → [Nx Transformer Block] → [Softmax] → 다음 토큰 샘플
- Decoder only (GPT 계열) vs Encoder + Decoder (T5) → 구조만 다르고 핵심 연산은 동일
2-2. 블록별 역할 ― “한 바퀴 돌 때마다 추상화 레벨 상승”
| 단계 | 연산 / 수식 | 개념적 효과 |
| Embedding | X = one_hot ✕ W_e | 희소 벡터 → 512-d 밀집 의미공간 |
| Positional Encoding | X = X + PE(i) | 순서 정보 주입 (사인·코사인 or 학습) |
| Masked Multi-Head Attention | Attn(Q,K,V)=softmax(QKᵀ/√d) V | 과거 토큰 중 중요 부분만 가중합 |
| Feed-Forward (FFN) | σ(XW₁+b₁)W₂+b₂ | “단어” → “개념/생각” 레벨 업 |
| Residual + LayerNorm | Y = LN(X + f(X)) | 그래디언트 경로 확보, 분산 안정화 |
✔ Multi-Head = Q·K·V 투영을 n 세트 동시에 학습
✔ Masked = 예측 시점 이후 토큰 가리기 (언어모델링 규칙)
2-3. 하이퍼파라미터 스케일
- Layers (L): 12 → 96
- Hidden Dim (d): 768 → 12 288
- Heads (H): 12 → 96
- 총 파라미터 ≈ 12Ld² (FFN이 대부분)
3. 대표 LLM 3 형제 + 후속 진화
| 모델 | 구조 | 학습 아이디어 / 데이터 | 파라(억) |
| BERT (2018) | Encoder | 문장 15 % 마스킹 예측 | 1.1 |
| T5 (2019) | Enc-Dec | “translate En→De: …” 식 Text-to-Text | 110 |
| GPT-3 (2020) | Decoder | Common Crawl·Books 300 B | 1750 |
| Chinchilla (2022) | Decoder | 파라↘ 데이터↗ 최적점 70 B / 1.4 T | 700 |
| LLaMA (2023) | Decoder | 공개 코퍼스 1 T (GitHub 5 %) | 650 |
| ChatGPT 3.5/4 | GPT-3 계열 + RLHF | 대화 SFT + 보상모델 | 수백 B |
3-1. Instruction Tuning → RLHF
- SFT: “질문-답” 인간 라벨 ↘
- RM: 답변 쌍 사람 랭킹 → 보상 모델 학습
- PPO: 모델이 보상 최대화하도록 미세조정
⚠ Alignment Tax: Zero-shot 능력↑ 대신 Few-shot 융통성↓, 확률 칼리브레이션 악화
4. 스케일링 법칙 & 컴퓨트 최적화
4-1. Chinchilla Law (참고)
Compute 예산 고정 시
데이터 토큰 수 ≈ (파라미터 수) ^ 1.07
- GPT-3 → 데이터 부족(300 B)
- Chinchilla → 동일 연산으로 정확도↑ > Gopher(280 B)
4-2. Retrieval-Augmented Future
- Retro(DeepMind): “모델은 추론만, 사실은 외부 DB 조회”
- 실제 서비스 → RAG (Retrieval Augmented Generation) 패턴으로 빠르게 수용
마무리
Computer Vision 전공자의 즐거운 LLM 탐구 여정기.
'LLM' 카테고리의 다른 글
| [LLM] LLM은 갑자기 나타나지 않았다! (기초 다지기) (0) | 2026.09.04 |
|---|---|
| [LLM] RAG 고도화 여정기 — Naive RAG에서 GraphRAG까지, 그런데 시작은 Ingestion이다 (0) | 2026.09.04 |
| [LLM] GraphRAG 최신 트렌드 — 벡터 검색이 놓치는 관계와 현실적인 타협점 (0) | 2026.09.04 |
| [LLM] LangSmith와 LLM 옵저버빌리티 — 에이전트도 로그를 남겨야 한다 (0) | 2026.09.03 |
| [LLM] LangChain, 이제 "프레임워크"라고 부르기엔 너무 커졌다 (0) | 2026.09.03 |