G·Graph Daily Lab 전체 140회
추가 38 / 40 · 심화 · 약 15분

GraphRAG 평가 질문 세트 만들기

평가 질문이 한쪽으로 치우치면 어떤 시스템이든 좋아 보이게 만들 수 있습니다. Edge et al.(2024)의 질문 생성법과 주장 기반 지표를 바탕으로 내 코퍼스의 GraphRAG 평가셋을 설계해 봅니다.

GraphRAG의 확장과 평가

배운 뒤 돌아올 회차

DAY 94에서 LLM 판정 쌍대 비교를 배웠는데, 그 비교를 믿으려면 어떤 질문으로 몇 번 판정하는지부터 설계해야 합니다.

시작하면 직접 풀기와 퀴즈 기록이 저장됩니다. 본과정 100회 진도와는 별도입니다.

이번에 더 배울 것

Edge et al.은 전역 질문을 코퍼스 설명에서 출발해 만듭니다. LLM에게 데이터셋을 쓸 법한 사용자 페르소나 K명을 묘사하게 하고, 사용자마다 과제 N개, (사용자, 과제)마다 코퍼스 전체 이해가 필요하고 세부 사실 검색은 필요 없는 질문 M개를 만들게 합니다. K=N=M=5로 데이터셋마다 125개를 썼습니다. 공정한 평가를 위해 질문을 코퍼스 자체에서 직접 만들지 않았고, 대안으로 그래프 추출과 평가에 쓰지 않을 일부 문서를 떼어 두고 질문을 만들 수 있다고 씁니다.

LLM 판정만으로는 불안하므로 논문은 두 번째 실험에서 주장(claim) 기반 지표를 씁니다. 답에서 검증 가능한 사실 진술을 추출(Claimify)해, 답마다 주장 수의 평균을 포괄성으로, 주장들을 군집했을 때 군집 수의 평균을 다양성으로 측정했습니다. 판정이 무승부가 아닌 비교에서 LLM 판정과 주장 기반 결과는 포괄성 78%, 다양성 69~70% 일치했습니다.

실무 평가셋은 한 종류의 질문만으로 만들지 않습니다. 전역 질문, 다중 홉 질문(근거 청크 ID를 미리 적어 둠), 단순 사실 질문, 코퍼스에 근거가 없는 질문을 섞어야 GraphRAG가 어디서 이기고 어디서 지는지 드러납니다. 판정은 답의 순서를 바꿔 반복하고, 승률과 함께 답의 주장마다 출처가 있는지 보는 충실성 점검을 따로 기록합니다.

작은 예제로 따라가기

1

물류 코퍼스: 페르소나 3명(운영 관리자, 고객 지원 담당, 재무 분석가) × 과제 2개 × 질문 4개 = 전역 질문 24개입니다.

2

여기에 다중 홉 6개, 단순 사실 6개, 근거 없음 4개를 더해 40문항을 만들고, 다중 홉·단순 사실 질문에는 정답 근거 ID를 적어 둡니다.

3

두 시스템 비교에서 질문 40 × 기준 4 × 반복 3 = 판정 480회입니다. 답 순서를 바꿔 한 번씩 더 하면 960회가 됩니다.

COMPARE & EXPLAIN

평가셋을 만드는 방법에 따라 결론이 바뀔까

다음 평가셋으로 GraphRAG와 벡터 RAG를 비교하면 결과가 어느 쪽으로 기울지 먼저 예상해 보세요.

GraphRAG가 포괄성·다양성에서 유리하게 나오기 쉬움

논문이 의도한 사용처를 평가한 것이며, 단순 사실 질문에서의 성능은 알 수 없습니다.

GraphRAG 평가셋은 페르소나·과제에서 질문을 만들고 질문 유형을 섞으며, LLM 판정·주장 기반 지표·충실성 점검을 함께 기록할 때 믿을 만해집니다.

학습을 시작하면 새 문제를 직접 풀고 확인 퀴즈를 마친 뒤 선택한 본과정 회차로 돌아갑니다.