AI 지식 · 심층 가이드
AI 지식 기초 개념 완전 정리
토큰 과금 구조와 컨텍스트 윈도우, 샘플링 파라미터가 LLM 응답을 어떻게 흔드는지 짚어 모델 선택과 비용을 직접 계산할 수 있게 정리한 기초 개념 모음입니다.
LLM을 다루는 일이 평범한 API 호출과 갈라지는 지점은 두 가지입니다. 입력이 문자열이 아니라 토큰 시퀀스라는 점, 그리고 같은 입력에 같은 출력이 보장되지 않는다는 점입니다. 한국어는 영어보다 글자당 토큰 소모가 커서 동일한 분량의 문서라도 요금과 컨텍스트 점유율이 달라집니다. 모델이 확률 분포에서 다음 토큰을 뽑는다는 사실을 감각으로 받아들이지 못하면, temperature를 이리저리 만지면서도 왜 답이 흔들리는지 설명할 수 없습니다.
읽는 순서에는 이유가 있습니다. 프롬프트 엔지니어링 기초로 지시문의 구조를 잡고, 토큰 이해와 비용 최적화에서 그 지시문이 실제로 얼마를 쓰는지 계산합니다. 그다음 컨텍스트 윈도우 관리 전략이 긴 대화에서 무엇을 버리고 무엇을 남길지를 다루고, Fine-tuning vs Prompting vs RAG가 프롬프트만으로 해결되지 않는 문제를 어디로 넘길지 판단 기준을 줍니다. 뒤쪽의 임베딩과 벡터 유사도 기초는 RAG 계열 주제 전체의 전제가 되므로 건너뛰지 않는 편이 좋습니다.
많이 밟는 함정은 컨텍스트 윈도우가 넓으면 그만큼 잘 읽는다고 가정하는 것입니다. 실제로는 입력 중간에 놓인 정보의 활용도가 떨어지는 경향이 반복해서 보고됩니다. 근거 문서는 앞이나 뒤에 배치하고, 정말 중요한 지시는 두 번 적는 편이 안전합니다. 토큰 수도 마찬가지로, 토크나이저가 모델 계열마다 다르기 때문에 한쪽에서 잰 값을 다른 모델에 그대로 옮기면 어긋납니다. 출력 토큰이 입력보다 단가가 높은 요금제도 흔하므로, 비용 추정은 입력과 출력을 반드시 분리해서 계산해야 합니다.
01프롬프트 엔지니어링 기초
AI에게 명확하고 구체적인 지시를 내리는 기술. 역할(Role), 맥락(Context), 작업(Task), 형식(Format)의 RCTF 구조로 프롬프트를 설계합니다. 모호한 요청보다 구체적 지시가 10배 나은 결과를 냅니다.
02토큰 이해와 비용 최적화
LLM은 토큰 단위로 과금됩니다. GPT-4는 약 4글자=1토큰(한국어는 1글자=2~3토큰). 컨텍스트 윈도우 한계 내에서 중요 정보를 앞에 배치하고, 불필요한 반복을 제거해 비용을 30~50% 줄일 수 있습니다.
03Temperature & Sampling 파라미터
temperature(0~2): 낮을수록 결정적, 높을수록 창의적. top_p: 누적 확률 컷오프. 코드 생성은 temperature 0.1~0.3, 창의적 글쓰기는 0.7~1.0이 적합합니다. top_p와 temperature는 동시 조정보다 하나만 변경하세요.
04LLM 모델 비교와 선택 기준
GPT-4o: 범용 최강, 비쌈. Claude 3.5 Sonnet: 코드·분석 특화, 긴 컨텍스트. Gemini 1.5 Pro: 멀티모달, 100만 토큰 컨텍스트. Llama 3.1: 오픈소스, 로컬 실행. 작업 유형과 비용에 맞게 선택하세요.
05Hallucination(환각) 이해와 방지
LLM이 사실처럼 보이는 거짓 정보를 생성하는 현상. 방지 전략: ①RAG로 사실 기반 컨텍스트 제공 ②"모르면 모른다고 답하라" 명시 ③인용 출처 요청 ④Chain-of-Thought로 추론 과정 노출 ⑤검증 단계 추가.
06컨텍스트 윈도우 관리 전략
긴 대화에서 초기 맥락이 사라지는 "lost in the middle" 문제. 전략: ①중요 정보는 처음과 끝에 배치 ②대화 요약을 주기적으로 삽입 ③슬라이딩 윈도우 방식으로 최근 N턴만 유지 ④RAG로 필요 시 컨텍스트 동적 주입.
07임베딩과 벡터 유사도 기초
텍스트를 의미를 담은 고차원 벡터로 변환. 코사인 유사도로 의미적 유사성을 측정. OpenAI text-embedding-3-small(저비용), text-embedding-3-large(고성능). 한국어는 multilingual-e5-large 등이 효과적입니다.
08Transformer 아키텍처 직관적 이해
Self-Attention: 각 토큰이 다른 모든 토큰과 얼마나 관련 있는지 계산. "어텐션은 연관성 가중치". Multi-head: 여러 관점에서 동시 분석. Positional Encoding: 순서 정보 추가. GPT는 다음 토큰 예측, BERT는 마스킹 예측으로 학습.
09Instruction Tuning & RLHF 이해
Instruction Tuning: 지시-응답 쌍으로 파인튜닝해 지시 따르는 능력 향상. RLHF(인간 피드백 강화학습): 인간이 좋은 응답을 선택 → 보상 모델 학습 → PPO로 정책 최적화. ChatGPT가 채팅에 최적화된 이유입니다.
10Fine-tuning vs Prompting vs RAG
파인튜닝: 특정 스타일/도메인 최적화, 비용 큼. 프롬프팅: 즉시 적용, 유연, 토큰 소비. RAG: 최신 정보 반영, 검증 가능, 복잡. 선택 기준: 업무 특화 → 파인튜닝, 지식 갱신 필요 → RAG, 일반 작업 → 프롬프팅.
11Mixture of Experts(MoE) 아키텍처
하나의 거대 모델 대신 여러 전문가(Expert) 모델의 앙상블. Gating Network가 입력에 따라 적합한 전문가 선택. GPT-4, Mistral Mixtral이 MoE 기반. 장점: 동일 파라미터 대비 성능↑, 추론 속도↑. 단점: 로드 밸런싱 어려움.
12AI 에이전트 메모리 아키텍처
단기 기억: 현재 컨텍스트 윈도우. 장기 기억: 벡터 DB(에피소딕 메모리). 절차적 기억: 실행 가능한 함수/도구 목록. 시맨틱 메모리: 사실/지식 그래프. mem0, Zep 라이브러리로 에이전트 메모리 관리. 메모리 설계가 에이전트 지능의 핵심입니다.
13Retrieval-Augmented Fine-tuning (RAFT)
RAG와 Fine-tuning의 결합. 파인튜닝 데이터에 관련/비관련 문서를 함께 포함해 "문서에서 답을 찾는" 능력을 학습. 일반 파인튜닝보다 도메인 RAG 성능이 35% 이상 향상. 오라클 문서와 함께 Chain-of-Thought 학습이 핵심입니다.
14LLM 추론 최적화 — vLLM & TensorRT
오픈소스 LLM 서빙 최적화. vLLM: PagedAttention으로 메모리 효율 3~4배, 처리량 10~24배↑. TensorRT-LLM: NVIDIA GPU 최적화. Flash Attention: 메모리 효율적 어텐션 계산. 프로덕션 LLM 서빙은 vLLM이 사실상 표준입니다.
15AI 미래 트렌드 2025-2026
주목할 트렌드: ①Agent + 도구 사용 일상화 ②멀티모달(텍스트+이미지+음성+비디오) 통합 ③소형 고효율 모델(Phi-3, Gemma 2) 성장 ④추론 모델(o1 계열) 발전 ⑤물리 AI(로봇, 자율주행) ⑥AI Native 앱 기본화.
16개발자를 위한 AI 학습 로드맵
① 기초: 프롬프트 엔지니어링 → LLM API 호출 → RAG 구현 ② 중급: 에이전트 설계 → LangChain/LlamaIndex → 평가 시스템 ③ 고급: 파인튜닝 → MLOps → 멀티 에이전트. 추천 순서: fast.ai → deeplearning.ai LLM 코스 → 실전 프로젝트.
정리하며
- 한국어 입력은 영어보다 토큰이 더 들어가므로 비용 추정 시 실측 토크나이저로 재야 합니다
- 코드나 추출 작업은 temperature를 낮추고, 발산이 필요한 작업만 올려서 씁니다
- 근거 문서는 컨텍스트 중간이 아니라 앞뒤 끝에 배치해 활용도를 확보합니다
- 프롬프트로 안 되면 RAG, 형식과 말투가 문제면 파인튜닝으로 갈라서 판단합니다
더 깊이 들어가고 싶다면 AI 지식 학습 라이브러리에서 다른 주제 가이드를 이어서 보거나, 언어 비교에서 같은 개념이 다른 언어에서 어떻게 표현되는지 확인해 보세요.