LLM Fine-Tuning & Alignment
사전 학습된 LLM의 행동을 특정 도메인이나 인간 선호도에 맞게 추가 조정하는 기법. 1. SFT (지도 학습 미세 조정) 2. 보상 모델 학습 (인간 선호도 쌍 비교) 3. PPO로 보상 최대화
이 용어로 연결된 기록을 섹션별로 살펴봅니다.
사전 학습된 LLM의 행동을 특정 도메인이나 인간 선호도에 맞게 추가 조정하는 기법. 1. SFT (지도 학습 미세 조정) 2. 보상 모델 학습 (인간 선호도 쌍 비교) 3. PPO로 보상 최대화
배터리 구동 사물인터넷(IoT) 기기를 위해 전력 소모를 최소화하면서도 안정적인 무선 연결을 제공하는 BLE, Zigbee, LoRa 등의 물리적 무선 통신 원리를 다루는 학습 노드입니다.
사전 학습된 모델의 지능을 특정 도메인에 수리적으로 최적화하고, 인간의 가치관이나 지시사항에 물리적으로 부합하도록 교정(Alignment)하는 고강도 적응 물리학을 다룹니다.