AI KNOWLEDGE · 기초 개념
Instruction Tuning & RLHF 이해
Instruction Tuning: 지시-응답 쌍으로 파인튜닝해 지시 따르는 능력 향상. RLHF(인간 피드백 강화학습): 인간이 좋은 응답을 선택 → 보상 모델 학습 → PPO로 정책 최적화. ChatGPT가 채팅에 최적화된 이유입니다.
기초 개념
핵심 설명
Instruction Tuning: 지시-응답 쌍으로 파인튜닝해 지시 따르는 능력 향상. RLHF(인간 피드백 강화학습): 인간이 좋은 응답을 선택 → 보상 모델 학습 → PPO로 정책 최적화. ChatGPT가 채팅에 최적화된 이유입니다.
Continue Learning
AI Knowledge 학습을 이어가세요
총 100개의 독립 HTML 학습 문서 중 하나입니다. 각 문서는 고유 URL과 canonical 메타데이터를 가집니다.