콘텐츠로 바로가기
주제28

machine-learning-ai

이 주제 아래 묶인 기록을 섹션별로 살펴봅니다.

  1. Attention Mechanism

    기술 노트

    Transformer의 핵심: 입력 시퀀스의 각 토큰이 다른 모든 토큰과 관계를 계산하여 문맥 의존적 표현을 생성. 동일 입력에 대해 여러 Attention을 병렬 계산 후 연결: 각 헤드가 서로 다른 의미 관계(통사, 의미, 거리 등)를 포착. O(n²·d) —...

    machine-learning-ai / llm-rag-engineering / llm-foundations-token-physics / attention-mechanism
  2. LLM Fine-Tuning & Alignment

    기술 노트

    사전 학습된 LLM의 행동을 특정 도메인이나 인간 선호도에 맞게 추가 조정하는 기법. 1. SFT (지도 학습 미세 조정) 2. 보상 모델 학습 (인간 선호도 쌍 비교) 3. PPO로 보상 최대화

    machine-learning-ai / llm-rag-engineering / fine-tuning-model-alignment / llm-fine-tuning-alignment
  3. LLM Embedding Spaces

    기술 노트

    단어(토큰)를 고차원 실수 벡터로 매핑하여 의미적 관계를 수치적 거리로 표현하는 공간. 벡터 공간에서 단어 관계가 방향과 크기로 인코딩됨. 문장 전체를 단일 벡터로 압축(Sentence Transformers 등). 이 벡터를 벡터 DB에 저장하여 시맨틱 검색 가...

    machine-learning-ai / llm-rag-engineering / llm-foundations-token-physics / llm-embedding-spaces
  4. LLM Scaling Laws

    기술 노트

    모델 파라미터(N), 학습 데이터(D), 연산량(C)이 증가할수록 손실(Loss)이 멱함수적으로 감소하는 경험적 법칙. 2022년 DeepMind 연구: 고정 연산 예산 하에서 N과 D를 **1:1 비율**로 함께 키울 때 최적 성능. 이전 GPT-3 패러다임(모...

    machine-learning-ai / llm-rag-engineering / llm-foundations-token-physics / llm-scaling-laws
  5. LLM Tokenization & BPE

    기술 노트

    텍스트를 LLM이 연산 가능한 정수 시퀀스로 변환하는 공정. 문자를 직접 사용하면 어휘집이 너무 작아지고, 단어 단위는 미등록어(OOV) 문제가 생긴다.

    machine-learning-ai / llm-rag-engineering / llm-foundations-token-physics / llm-tokenization-bpe
  6. Next-Token Prediction

    기술 노트

    LLM의 유일한 학습 목표: 이전 토큰 시퀀스를 조건으로 다음 토큰의 확률 분포를 예측. 각 위치에서 어휘집 전체에 대한 softmax 확률 벡터를 출력. Cross-entropy loss로 실제 토큰과 비교하여 역전파. 추론 시 예측한 토큰을 컨텍스트에 추가하여...

    machine-learning-ai / llm-rag-engineering / llm-foundations-token-physics / next-token-prediction
  7. Transformer Architecture

    기술 노트

    "Attention Is All You Need"(2017)에서 제안된 아키텍처. RNN의 순차 처리를 Self-Attention으로 대체하여 병렬 학습과 장거리 의존성 포착을 동시에 달성. 입력 시퀀스의 각 토큰이 다른 모든 토큰과의 관련성을 계산: `√d_k`...

    machine-learning-ai / llm-rag-engineering / llm-foundations-token-physics / transformer-architecture