AI KNOWLEDGE · 아키텍처 & 패턴
AI 애플리케이션 평가(Evals) 시스템
LLM 앱 품질을 자동 측정. ①기준 답변과 LLM 비교(G-Eval) ②인간 평가자 레이블 수집 ③A/B 테스트 ④지표: 정확도, 관련성, 무해성. LangSmith, Weave(W&B), Phoenix(Arize)로 운영. 에벌 없이 LLM 앱 개선은 블라인드 항법입니다.
아키텍처 & 패턴
핵심 설명
LLM 앱 품질을 자동 측정. ①기준 답변과 LLM 비교(G-Eval) ②인간 평가자 레이블 수집 ③A/B 테스트 ④지표: 정확도, 관련성, 무해성. LangSmith, Weave(W&B), Phoenix(Arize)로 운영. 에벌 없이 LLM 앱 개선은 블라인드 항법입니다.
Continue Learning
AI Knowledge 학습을 이어가세요
총 100개의 독립 HTML 학습 문서 중 하나입니다. 각 문서는 고유 URL과 canonical 메타데이터를 가집니다.