GraphRAG를 평가하고 고르기
전역 질문에는 정답이 하나로 정해져 있지 않습니다. Edge et al.(2024)이 GraphRAG를 어떻게 평가했는지, 그 결과를 어디까지 믿을 수 있는지, 그리고 내 문제에 어떤 검색 방식을 고를지 정리합니다.
이번 회차, 내 속도로.
기초를 더 짚거나 궁금한 주제로 잠깐 넓혀 보세요. 최대 3단계를 거쳐 DAY 94로 돌아옵니다.
난이도·관심 주제 고르기
1/2개 선택 · 새 보충·심화 수업과 본과정 다시 읽기를 선택할 수 있어요.
이렇게 다녀와요 1단계 · 약 12분
- 출발 · DAY 94쌍대 비교·선택 기준
- 1. 관심 주제재귀 군집·요약 트리·접힌 트리 검색추가 37 · 새 추가 수업
- 복귀 · DAY 94원래 회차 이어가기
- 재귀 군집·요약 트리·접힌 트리 검색 · DAY 92에서 GraphRAG의 무거운 인덱싱을 줄이는 방법들을 봤는데, RAPTOR는 엔티티 추출 대신 임베딩 군집으로 요약 계층을 만드는 또 다른 선택지입니다.
선택과 경로 기록은 이 브라우저에 저장됩니다. 본과정의 회차 완료와는 별도입니다.
핵심 개념
Edge et al.은 정답이 없는 전역 질문을 LLM 판정자(LLM-as-a-judge)의 쌍대 비교(head-to-head)로 평가했습니다. 질문은 코퍼스 설명에서 가상 사용자 K명을 만들고, 사용자마다 과제 N개, (사용자, 과제)마다 질문 M개를 LLM이 만들게 했습니다. 코퍼스 전체 이해가 필요하고 세부 사실 검색은 필요 없는 질문들로, K=N=M=5라 데이터셋마다 125개입니다. 판정 LLM은 질문과 두 시스템의 답을 받아 기준별로 승자 또는 무승부를 정하고, 비교마다 5회 반복해 평균했습니다.
기준은 넷입니다. 포괄성(comprehensiveness)은 질문의 모든 측면과 세부를 얼마나 다루는지, 다양성(diversity)은 관점과 통찰이 얼마나 다양한지, 권한 부여(empowerment)는 독자가 주제를 이해하고 판단하도록 얼마나 돕는지, 직접성(directness)은 얼마나 구체적이고 분명하게 답하는지입니다. 직접성은 포괄성·다양성과 반대 방향인 대조 기준(control)으로, 어떤 방법도 네 기준을 모두 이기지 않으리라 예상하고 넣었습니다. 결과에서 전역 방법들은 벡터 RAG보다 포괄성 승률 72~83%(팟캐스트)·72~80%(뉴스), 다양성 75~82%·62~71%를 보였고, 직접성은 벡터 RAG가 가장 높았으며, 권한 부여는 엇갈렸습니다.
논문은 판정을 다른 방식으로도 확인했습니다. 답에서 검증 가능한 주장(claim)을 추출해 주장 수(포괄성)와 주장 군집 수(다양성)를 세었고, 무승부가 아닌 비교에서 LLM 판정과 78%(포괄성)·69~70%(다양성) 일치했습니다. 동시에 평가가 약 100만 토큰 코퍼스 두 개에 한정되고, 지어낸 내용(fabrication) 비율 비교는 앞으로의 과제라고 밝힙니다. 그래서 실무 평가에는 답의 주장마다 출처가 실제로 뒷받침하는지 보는 충실성(faithfulness) 점검을 따로 둡니다.
고르는 기준은 질문 유형과 비용입니다. 답이 한 청크에 있는 단순 사실 질문은 벡터 RAG로 충분하고 더 직접적이며 저렴합니다. 사실을 이어야 하는 다중 홉 질문은 로컬 검색·HippoRAG·Text2Cypher가, 코퍼스 전체를 요약하는 전역 질문은 GraphRAG 전역 검색이나 지연 방식이 맞습니다. Peng et al.(2024) 서베이처럼 흐름을 그래프 기반 색인·그래프 유도 검색·그래프 강화 생성으로 나눠 보면, 평가에서 실패가 어느 단계에서 났는지 찾기 쉽습니다.
작은 예제로 따라가기
질문 10개 × 반복 5회 = 판정 50회로 시스템 A와 B를 비교합니다.
포괄성에서 A 32승, B 13승, 무승부 5였다면, 무승부를 반씩 나누는 이 과정의 규칙으로 A 승률은 (32 + 0.5×5)/50 = 69%입니다.
같은 답 쌍에서 직접성은 B가 31승이라면, 직접성은 대조 기준이므로 ‘A가 더 포괄적인 대신 덜 직접적’이라는 예상된 신호입니다. 승률만으로 끝내지 않고 A의 답에서 주장 몇 개를 뽑아 출처를 확인합니다.
직접 실험해 보기
질문 유형을 ‘단순 사실’과 ‘전역 요약’으로 바꿔 가며 같은 지표(포괄성, 직접성)에서 승자를 먼저 골라 본 뒤 해설과 비교하고, 하단 체크리스트로 GraphRAG가 필요한 경우를 표시하세요.
두 답변을 지표별로 판정해 보기
세 흐름이 보입니다. ① 다온시가 청정에너지 특구로 배터리 창업(가온배터리)을 끌어들였고 ② 가온배터리–누리전자 사이 그린셀 공급망이 생겼으며 ③ 해솔시에선 누리전자 공장 폐수를 두고 시민단체와 갈등이 있었습니다. 다온대 이도 연구실은 두 회사 인재를 이어 줍니다.
가온배터리는 2021년 서윤이 다온시에 세운 회사로, 특구 첫 수혜 기업이며 누리전자에 그린셀을 공급합니다.
언제 GraphRAG가 필요한가
이번에는 직접 풀어 보세요
정답을 보기 전에 계산과 이유를 적어 보세요. 해설과 비교하고 확인 표시를 남기면 완료할 수 있습니다.
힌트 보기
전체 판정 수는 20회입니다.
풀이와 비교하기
(11 + 0.5×3)/20 = 12.5/20 = 62.5%입니다. 질문이 5개뿐이라 질문 몇 개의 성격이 결과를 좌우할 수 있고, LLM 판정에는 답의 순서·길이 같은 편향이 있을 수 있습니다. 질문을 늘리고 답 순서를 바꿔 다시 판정하며, 주장마다 출처를 확인하는 충실성 점검을 함께 해야 합니다.
풀이와 확인 표시는 이 브라우저에 저장됩니다.
오늘 이해한 것과 다시 볼 것
계산이 달라진 이유, 헷갈린 개념, 다음에 확인할 질문을 남겨 보세요.
메모는 이 브라우저에 저장됩니다. 홈에서 전체 기록을 내려받을 수 있습니다.오늘의 이해 확인
Edge et al.(2024)이 직접성(directness)을 평가 기준에 넣은 이유는?
완료 조건: 확인 퀴즈 정답 · / 직접 풀기 0/1
더 깊이 읽기
예제와 실험 데이터는 이 과정을 위해 만든 것입니다. 원문은 선택 자료이며, 강의와 직접 풀기만으로도 다음 회차를 이어갈 수 있습니다.
From Local to Global: A Graph RAG Approach to Query-Focused SummarizationEdge et al. (2024)Graph Retrieval-Augmented Generation: A SurveyPeng et al. (2024)이 자료는 개념 학습용입니다. 실제 데이터베이스·라이브러리·플랫폼의 동작과 설정은 제품과 버전마다 다를 수 있습니다.