AI KNOWLEDGE · 기초 개념
Transformer 아키텍처 직관적 이해
Self-Attention: 각 토큰이 다른 모든 토큰과 얼마나 관련 있는지 계산. "어텐션은 연관성 가중치". Multi-head: 여러 관점에서 동시 분석. Positional Encoding: 순서 정보 추가. GPT는 다음 토큰 예측, BERT는 마스킹 예측으로 학습.
기초 개념
핵심 설명
Self-Attention: 각 토큰이 다른 모든 토큰과 얼마나 관련 있는지 계산. "어텐션은 연관성 가중치". Multi-head: 여러 관점에서 동시 분석. Positional Encoding: 순서 정보 추가. GPT는 다음 토큰 예측, BERT는 마스킹 예측으로 학습.
Continue Learning
AI Knowledge 학습을 이어가세요
총 100개의 독립 HTML 학습 문서 중 하나입니다. 각 문서는 고유 URL과 canonical 메타데이터를 가집니다.