Next-Token Prediction
LLM의 유일한 학습 목표: 이전 토큰 시퀀스를 조건으로 다음 토큰의 확률 분포를 예측. 각 위치에서 어휘집 전체에 대한 softmax 확률 벡터를 출력. Cross-entropy loss로 실제 토큰과 비교하여 역전파. 추론 시 예측한 토큰을 컨텍스트에 추가하여...
이 용어로 연결된 기록을 섹션별로 살펴봅니다.
LLM의 유일한 학습 목표: 이전 토큰 시퀀스를 조건으로 다음 토큰의 확률 분포를 예측. 각 위치에서 어휘집 전체에 대한 softmax 확률 벡터를 출력. Cross-entropy loss로 실제 토큰과 비교하여 역전파. 추론 시 예측한 토큰을 컨텍스트에 추가하여...
"Attention Is All You Need"(2017)에서 제안된 아키텍처. RNN의 순차 처리를 Self-Attention으로 대체하여 병렬 학습과 장거리 의존성 포착을 동시에 달성. 입력 시퀀스의 각 토큰이 다른 모든 토큰과의 관련성을 계산: `√d_k`...
통계적 수학과 대규모 하드웨어 연산을 결합하여 기계가 스스로 규칙을 추출하고, 인간의 고등 추론을 수리적으로 모사하는 인공지능의 모든 계층을 다룹니다.
수조 개의 파라미터를 통해 인류의 지식을 수리적으로 압축하고, 자연어와 멀티모달 데이터를 물리적으로 생성하며 추론하는 현대 AI의 정점을 다룹니다.
사전 학습된 모델의 지능을 특정 도메인에 수리적으로 최적화하고, 인간의 가치관이나 지시사항에 물리적으로 부합하도록 교정(Alignment)하는 고강도 적응 물리학을 다룹니다.
방대한 텍스트 데이터를 수리적으로 압축하여 언어의 통계적 지도를 구축하고, 문자를 수치적 단위(Token)로 분해하며 다음 단어를 예측하는 거대 언어 모델의 물리적 근간을 다룹니다.
텍스트를 넘어 이미지, 음성, 영상의 서로 다른 물리적 데이터를 단일한 수리 공간(Joint Space)에 통합하고, 세계 모델과 지능형 에이전트로 진화하는 AI의 최신 역학을 다룹니다.