LLM POST-TRAINING · LoRA · DPO · GRPO · FINANCIAL AI LLM도 입사하면 재교육이 필요하다 Fine-tuning의 수학부터 LoRA·DPO·GRPO, 금융권 Post-training까지 “우리 회사 문서를 학습시키면 모델이 똑똑해질까요?”라는 질문에서 출발해, Gradient Descent와 Cross Entropy부터 QLoRA, Preference Optimization, Reasoning RL, RLVR, Responsible AI, 개인정보보호까지 한 번에 내려가 본다. 어느 월요일 아침, Foundation Model 하나가 금융회사에 입사했다고 상상해보자. ..