12분
LLM 평가, 왜 이렇게 어려운 걸까 — 지표와 전략 정리
LLM 기반 서비스를 만들다 보면 어느 순간 "이거 평가를 어떻게 하지?"라는 질문에 부딪힌다. 기존 소프트웨어는 테스트 케이스를 작성하면 되지만, LLM은 같은 입력에 다른 출력이 나온다. 정답이 하나가 아니라…
왜 LLM 평가는 어려운지, 어떤 지표를 쓰는지, 골든 데이터셋은 어떻게 만드는지. 연재의 PART IV.
LLM 기반 서비스를 만들다 보면 어느 순간 "이거 평가를 어떻게 하지?"라는 질문에 부딪힌다. 기존 소프트웨어는 테스트 케이스를 작성하면 되지만, LLM은 같은 입력에 다른 출력이 나온다. 정답이 하나가 아니라…
AI 에이전트를 만들고 나면 한 가지 질문이 남는다. "이거 잘 되고 있는 거 맞아?" 프롬프트 바꿨더니 이전보다 나아진 건지, 모델 버전 올렸더니 오히려 퇴보한 건 아닌지. 솔직히 나도 처음엔 수동으로 몇 개…