콘텐츠로 바로가기

시리즈

Transformer Architecture & LLM Foundations

7개 글

  1. 01

    고정된 시퀀스의 한계를 넘어 데이터 간의 상관관계를 한꺼번에 주목(Attention)하여 병렬로 처리하고, 현대 LLM의 심장이 된 트랜스포머의 수리적 구조와 물리적 혁신을 다룹니다.

  2. 02

    방대한 텍스트 데이터를 수리적으로 압축하여 언어의 통계적 지도를 구축하고, 문자를 수치적 단위(Token)로 분해하며 다음 단어를 예측하는 거대 언어 모델의 물리적 근간을 다룹니다.

  3. 03

    단어(토큰)를 고차원 실수 벡터로 매핑하여 의미적 관계를 수치적 거리로 표현하는 공간. 벡터 공간에서 단어 관계가 방향과 크기로 인코딩됨. 문장 전체를 단일 벡터로 압축(Sentence Transformers 등). 이 벡터를 벡터 DB에 저장하여 시맨틱 검색 가...

  4. 04

    모델 파라미터(N), 학습 데이터(D), 연산량(C)이 증가할수록 손실(Loss)이 멱함수적으로 감소하는 경험적 법칙. 2022년 DeepMind 연구: 고정 연산 예산 하에서 N과 D를 **1:1 비율**로 함께 키울 때 최적 성능. 이전 GPT-3 패러다임(모...

  5. 05

    텍스트를 LLM이 연산 가능한 정수 시퀀스로 변환하는 공정. 문자를 직접 사용하면 어휘집이 너무 작아지고, 단어 단위는 미등록어(OOV) 문제가 생긴다.

  6. 06

    LLM의 유일한 학습 목표: 이전 토큰 시퀀스를 조건으로 다음 토큰의 확률 분포를 예측. 각 위치에서 어휘집 전체에 대한 softmax 확률 벡터를 출력. Cross-entropy loss로 실제 토큰과 비교하여 역전파. 추론 시 예측한 토큰을 컨텍스트에 추가하여...

  7. 07

    "Attention Is All You Need"(2017)에서 제안된 아키텍처. RNN의 순차 처리를 Self-Attention으로 대체하여 병렬 학습과 장거리 의존성 포착을 동시에 달성. 입력 시퀀스의 각 토큰이 다른 모든 토큰과의 관련성을 계산: `√d_k`...