LLM Fine-Tuning & Alignment
사전 학습된 LLM의 행동을 특정 도메인이나 인간 선호도에 맞게 추가 조정하는 기법. 1. SFT (지도 학습 미세 조정) 2. 보상 모델 학습 (인간 선호도 쌍 비교) 3. PPO로 보상 최대화
이 용어로 연결된 기록을 섹션별로 살펴봅니다.
사전 학습된 LLM의 행동을 특정 도메인이나 인간 선호도에 맞게 추가 조정하는 기법. 1. SFT (지도 학습 미세 조정) 2. 보상 모델 학습 (인간 선호도 쌍 비교) 3. PPO로 보상 최대화
수조 개의 파라미터를 통해 인류의 지식을 수리적으로 압축하고, 자연어와 멀티모달 데이터를 물리적으로 생성하며 추론하는 현대 AI의 정점을 다룹니다.
사전 학습된 모델의 지능을 특정 도메인에 수리적으로 최적화하고, 인간의 가치관이나 지시사항에 물리적으로 부합하도록 교정(Alignment)하는 고강도 적응 물리학을 다룹니다.