PHpullh
학습 라이브러리/AI Knowledge/AI Safety & Alignment 기초

AI KNOWLEDGE · 아키텍처 & 패턴

AI Safety & Alignment 기초

AI가 의도대로 동작하도록 설계하는 원칙. ①Constitutional AI(Anthropic): 원칙 기반 훈련 ②RLHF: 인간 피드백으로 정렬 ③Red Teaming: 의도적 공격으로 취약점 발견 ④Guardrails: 응답 전/후 안전 필터. Nemo Guardrails, Llama Guard 활용.

아키텍처 & 패턴

핵심 설명

AI가 의도대로 동작하도록 설계하는 원칙. ①Constitutional AI(Anthropic): 원칙 기반 훈련 ②RLHF: 인간 피드백으로 정렬 ③Red Teaming: 의도적 공격으로 취약점 발견 ④Guardrails: 응답 전/후 안전 필터. Nemo Guardrails, Llama Guard 활용.