콘텐츠로 바로가기

시리즈

LLM Fine-Tuning & Model Alignment

2개 글

  1. 01

    사전 학습된 모델의 지능을 특정 도메인에 수리적으로 최적화하고, 인간의 가치관이나 지시사항에 물리적으로 부합하도록 교정(Alignment)하는 고강도 적응 물리학을 다룹니다.

  2. 02

    사전 학습된 LLM의 행동을 특정 도메인이나 인간 선호도에 맞게 추가 조정하는 기법. 1. SFT (지도 학습 미세 조정) 2. 보상 모델 학습 (인간 선호도 쌍 비교) 3. PPO로 보상 최대화