PHpullh
학습 라이브러리/AI Knowledge/Instruction Tuning & RLHF 이해

AI KNOWLEDGE · 기초 개념

Instruction Tuning & RLHF 이해

Instruction Tuning: 지시-응답 쌍으로 파인튜닝해 지시 따르는 능력 향상. RLHF(인간 피드백 강화학습): 인간이 좋은 응답을 선택 → 보상 모델 학습 → PPO로 정책 최적화. ChatGPT가 채팅에 최적화된 이유입니다.

기초 개념

핵심 설명

Instruction Tuning: 지시-응답 쌍으로 파인튜닝해 지시 따르는 능력 향상. RLHF(인간 피드백 강화학습): 인간이 좋은 응답을 선택 → 보상 모델 학습 → PPO로 정책 최적화. ChatGPT가 채팅에 최적화된 이유입니다.