평가가 중요한 이유

전통적인 소프트웨어와 달리, LLM 애플리케이션은 비결정적 출력을 가집니다. 단순히 단위 테스트를 작성하는 것이 아니라 체계적인 평가가 필요합니다.

주요 지표

  • 정확도: 출력이 기대되는 답변과 일치하는가?
  • 관련성: 답변이 주제에 맞고 유용한가?
  • 충실함: 답변이 제공된 맥락에 맞는지 여부입니다.
  • 독성: 출력물에 해로운 내용이 포함되어 있습니까?
  • 지연: 생성 시간은 얼마나 걸리나요?
  • 비용: 요청당 비용은 얼마인가요?

평가 접근법

  • 인간 평가: 금본위제이지만 느리고 비용이 많이 듭니다.
  • LLM-as-judge: 강력한 모델(GPT-5, Claude)을 사용해 출력을 평가합니다.
  • 자동화된 지표: 요약을 위한 BLEU, ROUGE; 코드pass@k 필요해.
  • A/B 테스트: 실제 사용자와 두 버전을 비교합니다.

도구

  • RAGAS: RAG 파이프라인(충실성, 관련성, 리콜) 평가.
  • DeepEval: 14+ 지표를 가진 오픈 소스 LLM 평가 프레임워크.
  • LangSmith: LangChain의 추적 및 평가 플랫폼.
  • Braintrust: AI 제품의 평가 및 관측 가능성.

모범 사례

  • 예외 사례를 포함하는 100-500개의 예로 구성된 평가 데이터셋을 구축합니다.
  • 모든 프롬프트 변경에 대해 평가를 실행합니다.
  • 대시보드에서 시간에 따른 지표를 추적합니다.
  • 품질 게이트 설정: 점수가 임계값 이하로 떨어지면 블록이 배포됩니다.