PHpullh
학습 라이브러리/AI Knowledge/AI 애플리케이션 평가(Evals) 시스템

AI KNOWLEDGE · 아키텍처 & 패턴

AI 애플리케이션 평가(Evals) 시스템

LLM 앱 품질을 자동 측정. ①기준 답변과 LLM 비교(G-Eval) ②인간 평가자 레이블 수집 ③A/B 테스트 ④지표: 정확도, 관련성, 무해성. LangSmith, Weave(W&B), Phoenix(Arize)로 운영. 에벌 없이 LLM 앱 개선은 블라인드 항법입니다.

아키텍처 & 패턴

핵심 설명

LLM 앱 품질을 자동 측정. ①기준 답변과 LLM 비교(G-Eval) ②인간 평가자 레이블 수집 ③A/B 테스트 ④지표: 정확도, 관련성, 무해성. LangSmith, Weave(W&B), Phoenix(Arize)로 운영. 에벌 없이 LLM 앱 개선은 블라인드 항법입니다.