콘텐츠로 바로가기
용어3

pre-training

이 용어로 연결된 기록을 섹션별로 살펴봅니다.

  1. LLM Scaling Laws

    모델 파라미터(N), 학습 데이터(D), 연산량(C)이 증가할수록 손실(Loss)이 멱함수적으로 감소하는 경험적 법칙. 2022년 DeepMind 연구: 고정 연산 예산 하에서 N과 D를 **1:1 비율**로 함께 키울 때 최적 성능. 이전 GPT-3 패러다임(모...

    machine-learning-ai / llm-rag-engineering / llm-foundations-token-physics / llm-scaling-laws
  2. Next-Token Prediction

    LLM의 유일한 학습 목표: 이전 토큰 시퀀스를 조건으로 다음 토큰의 확률 분포를 예측. 각 위치에서 어휘집 전체에 대한 softmax 확률 벡터를 출력. Cross-entropy loss로 실제 토큰과 비교하여 역전파. 추론 시 예측한 토큰을 컨텍스트에 추가하여...

    machine-learning-ai / llm-rag-engineering / llm-foundations-token-physics / next-token-prediction
  3. LLM Foundations & Token Physics

    방대한 텍스트 데이터를 수리적으로 압축하여 언어의 통계적 지도를 구축하고, 문자를 수치적 단위(Token)로 분해하며 다음 단어를 예측하는 거대 언어 모델의 물리적 근간을 다룹니다.

    machine-learning-ai / llm-rag-engineering / llm-foundations-token-physics