LLM

[LLM] LLM Foundations

rubrub 2025. 7. 7. 20:13

2025-07-07


INTRO

AI 공부하다가 LLM 기초 정리하기! 

기초라고 하지만, 깊이 있는 내용을 다루고자 한다. The Full Stack에서 강의한 LLM Foundations 영상을 참고했다. 

 

내용은 머신러닝 기초 → Transformer 블록 → 대표 LLM 군 → 운영 Tips 까지 포함한다. 


1. Software 2.0 사고방식 — “데이터가 코드를 빚는다”

 

구분 Software 1.0 Software 2.0
코드 사람이 직접 로직 작성 “학습 로봇”만 작성 → 데이터가 로직 생성
검증 유닛 테스트‧에지 케이스 명시 Train / Val / Test 스플릿 + 지표 모니터링
버전 Git commit 단위 데이터 스냅샷 + 파라미터 파일

핵심 키워드:

  • 학습 종류
    • Unsupervised: 패턴·생성 (ex. GPT pre-train)
    • Supervised: 입력→라벨 (ex. 이미지 분류)
    • Reinforcement: 상태→행동→보상 (ex. RLHF)
    • ➡ Self-Supervised로 수렴: “라벨을 스스로 만들면 다 지도학습으로 표현 가능”
  • 텐서 만능주의
    • 이미지든 텍스트든 float32 행렬이면 끝
    • GPU = 행렬곱 가속기 → 딥러닝 붐

2. Transformer ― Attention is all you need

2-1. 토큰에서 토큰으로

[입력 토큰]  →  [Embedding]  →  [Nx Transformer Block]  →  [Softmax] →  다음 토큰 샘플
  • Decoder only (GPT 계열) vs Encoder + Decoder (T5) → 구조만 다르고 핵심 연산은 동일

2-2. 블록별 역할 ― “한 바퀴 돌 때마다 추상화 레벨 상승”

단계 연산 / 수식 개념적 효과
Embedding X = one_hot ✕ W_e 희소 벡터 → 512-d 밀집 의미공간
Positional Encoding X = X + PE(i) 순서 정보 주입 (사인·코사인 or 학습)
Masked Multi-Head Attention Attn(Q,K,V)=softmax(QKᵀ/√d) V 과거 토큰 중 중요 부분만 가중합
Feed-Forward (FFN) σ(XW₁+b₁)W₂+b₂ “단어” → “개념/생각” 레벨 업
Residual + LayerNorm Y = LN(X + f(X)) 그래디언트 경로 확보, 분산 안정화

✔ Multi-Head = Q·K·V 투영을 n 세트 동시에 학습
✔ Masked = 예측 시점 이후 토큰 가리기 (언어모델링 규칙)

2-3. 하이퍼파라미터 스케일

  • Layers (L): 12 → 96
  • Hidden Dim (d): 768 → 12 288
  • Heads (H): 12 → 96
  • 총 파라미터 ≈ 12Ld² (FFN이 대부분)

3. 대표 LLM 3 형제 + 후속 진화

모델 구조 학습 아이디어 / 데이터 파라(억)
BERT (2018) Encoder 문장 15 % 마스킹 예측 1.1
T5 (2019) Enc-Dec “translate En→De: …” 식 Text-to-Text 110
GPT-3 (2020) Decoder Common Crawl·Books 300 B 1750
Chinchilla (2022) Decoder 파라↘ 데이터↗ 최적점 70 B / 1.4 T 700
LLaMA (2023) Decoder 공개 코퍼스 1 T (GitHub 5 %) 650
ChatGPT 3.5/4 GPT-3 계열 + RLHF 대화 SFT + 보상모델 수백 B

3-1. Instruction Tuning → RLHF

  1. SFT: “질문-답” 인간 라벨 ↘
  2. RM: 답변 쌍 사람 랭킹 → 보상 모델 학습
  3. PPO: 모델이 보상 최대화하도록 미세조정

⚠ Alignment Tax: Zero-shot 능력↑ 대신 Few-shot 융통성↓, 확률 칼리브레이션 악화


4. 스케일링 법칙 & 컴퓨트 최적화

4-1. Chinchilla Law (참고)

Compute 예산 고정 시
데이터 토큰 수 ≈ (파라미터 수) ^ 1.07

  • GPT-3 → 데이터 부족(300 B)
  • Chinchilla → 동일 연산으로 정확도↑ > Gopher(280 B)

4-2. Retrieval-Augmented Future

  • Retro(DeepMind): “모델은 추론만, 사실은 외부 DB 조회”
  • 실제 서비스 → RAG (Retrieval Augmented Generation) 패턴으로 빠르게 수용

마무리

Computer Vision 전공자의 즐거운 LLM 탐구 여정기.