이번에 더 배울 것
Edge et al.은 전역 질문을 코퍼스 설명에서 출발해 만듭니다. LLM에게 데이터셋을 쓸 법한 사용자 페르소나 K명을 묘사하게 하고, 사용자마다 과제 N개, (사용자, 과제)마다 코퍼스 전체 이해가 필요하고 세부 사실 검색은 필요 없는 질문 M개를 만들게 합니다. K=N=M=5로 데이터셋마다 125개를 썼습니다. 공정한 평가를 위해 질문을 코퍼스 자체에서 직접 만들지 않았고, 대안으로 그래프 추출과 평가에 쓰지 않을 일부 문서를 떼어 두고 질문을 만들 수 있다고 씁니다.
LLM 판정만으로는 불안하므로 논문은 두 번째 실험에서 주장(claim) 기반 지표를 씁니다. 답에서 검증 가능한 사실 진술을 추출(Claimify)해, 답마다 주장 수의 평균을 포괄성으로, 주장들을 군집했을 때 군집 수의 평균을 다양성으로 측정했습니다. 판정이 무승부가 아닌 비교에서 LLM 판정과 주장 기반 결과는 포괄성 78%, 다양성 69~70% 일치했습니다.
실무 평가셋은 한 종류의 질문만으로 만들지 않습니다. 전역 질문, 다중 홉 질문(근거 청크 ID를 미리 적어 둠), 단순 사실 질문, 코퍼스에 근거가 없는 질문을 섞어야 GraphRAG가 어디서 이기고 어디서 지는지 드러납니다. 판정은 답의 순서를 바꿔 반복하고, 승률과 함께 답의 주장마다 출처가 있는지 보는 충실성 점검을 따로 기록합니다.
작은 예제로 따라가기
물류 코퍼스: 페르소나 3명(운영 관리자, 고객 지원 담당, 재무 분석가) × 과제 2개 × 질문 4개 = 전역 질문 24개입니다.
여기에 다중 홉 6개, 단순 사실 6개, 근거 없음 4개를 더해 40문항을 만들고, 다중 홉·단순 사실 질문에는 정답 근거 ID를 적어 둡니다.
두 시스템 비교에서 질문 40 × 기준 4 × 반복 3 = 판정 480회입니다. 답 순서를 바꿔 한 번씩 더 하면 960회가 됩니다.
평가셋을 만드는 방법에 따라 결론이 바뀔까
다음 평가셋으로 GraphRAG와 벡터 RAG를 비교하면 결과가 어느 쪽으로 기울지 먼저 예상해 보세요.
논문이 의도한 사용처를 평가한 것이며, 단순 사실 질문에서의 성능은 알 수 없습니다.
학습을 시작하면 새 문제를 직접 풀고 확인 퀴즈를 마친 뒤 선택한 본과정 회차로 돌아갑니다.