복습 · GraphRAG 따라가기
GraphRAG 인덱싱의 전체 흐름, 추출 단계의 청크 크기와 글리닝, 커뮤니티 보고서 작성 방식을 따라왔습니다. 앞 단계의 선택이 뒤 단계의 보고서 품질과 비용으로 어떻게 이어지는지 연결해 봅니다.
이번 회차, 내 속도로.
기초를 더 짚거나 궁금한 주제로 잠깐 넓혀 보세요. 최대 3단계를 거쳐 DAY 90로 돌아옵니다.
난이도·관심 주제 고르기
1/2개 선택 · 새 보충·심화 수업과 본과정 다시 읽기를 선택할 수 있어요.
이렇게 다녀와요 1단계 · 약 12분
- 출발 · DAY 90기억에서 꺼내고 풀이 점검하기
- 1. 관심 주제토큰 예산·선불 비용·질의 비용추가 35 · 새 추가 수업
- 복귀 · DAY 90원래 회차 이어가기
- 토큰 예산·선불 비용·질의 비용 · DAY 86에서 ‘비용은 인덱싱 때 먼저 낸다’고 했는데, 그 크기를 토큰으로 세어 보면 청크 크기·글리닝·커뮤니티 레벨 선택의 무게가 보입니다.
선택과 경로 기록은 이 브라우저에 저장됩니다. 본과정의 회차 완료와는 별도입니다.
기억에서 꺼내어 풀기
앞에서 풀었던 세 문제를 해설 없이 다시 풀어 보세요. 막히면 힌트를 열고, 풀이를 비교한 뒤 고친 점을 기록하세요.
힌트 보기
추출은 청크마다, 요약은 설명이 여러 개인 요소마다, 보고서는 커뮤니티마다 한 번으로 셉니다.
풀이와 비교하기
40+25+8=73회입니다. Leiden 커뮤니티 탐지는 그래프 알고리즘이라 LLM 호출을 더하지 않습니다. 다만 커뮤니티 수가 보고서 호출 수를 정하므로, 계층이 깊고 커뮤니티가 많을수록 보고서 비용이 늘어납니다. 임베딩 계산은 별도 비용입니다.
힌트 보기
문자열이 한 글자라도 다르면 정확한 일치에서는 다른 노드입니다.
풀이와 비교하기
정확한 문자열 일치로는 노드 2개가 됩니다. 관계도 둘로 나뉘어 각 노드의 차수와 근거가 따로 집계되므로, 보고서에서 같은 회사가 두 번 언급되거나 중요도가 낮게 매겨질 수 있습니다. 엔티티 해소 후에는 노드 1개에 설명 4개가 모여 한 번에 요약되고, 관계와 근거도 한곳에 모입니다.
힌트 보기
차수 합이 큰 엣지부터 새 노드 설명과 엣지 설명을 더해 누적합니다.
풀이와 비교하기
A–B: 40+40+20=100, A–C: C 40과 엣지 20을 더해 160입니다. B–D는 D 40과 엣지 20을 더하면 220이라 한도를 넘어 들어가지 못합니다. 따라서 A–B, A–C까지 들어가고 노드 D는 보고서 컨텍스트에서 빠집니다.
풀이와 확인 표시는 이 브라우저에 저장됩니다.
세 문제를 푼 뒤 핵심 개념 펼치기
핵심 개념
GraphRAG 인덱싱의 전체 흐름, 추출 단계의 청크 크기와 글리닝, 커뮤니티 보고서 작성 방식을 따라왔습니다. 앞 단계의 선택이 뒤 단계의 보고서 품질과 비용으로 어떻게 이어지는지 연결해 봅니다.
GraphRAG는 텍스트 단위에서 엔티티·관계를 추출해 그래프를 만들고, 계층 Leiden 커뮤니티마다 보고서를 미리 써 두어 전역 질문에 대비합니다.
큰 청크는 호출을 줄이지만 추출을 놓치기 쉽고, 글리닝은 빠진 엔티티를 다시 묻는 자기 성찰로 그 손실을 메우며, 병합 단계의 이름 일치가 그래프 품질을 좌우합니다.
커뮤니티 보고서는 차수 합이 큰 엣지부터 요소 요약을 채워 만들고, 상위 레벨은 하위 보고서로 대체하며 아래에서 위로 요약을 쌓습니다.
오늘 이해한 것과 다시 볼 것
계산이 달라진 이유, 헷갈린 개념, 다음에 확인할 질문을 남겨 보세요.
메모는 이 브라우저에 저장됩니다. 홈에서 전체 기록을 내려받을 수 있습니다.오늘의 이해 확인
GraphRAG에서 청크 크기 선택이 커뮤니티 보고서의 내용까지 바꾸는 경로로 알맞은 것은?
완료 조건: 확인 퀴즈 정답 · / 직접 풀기 0/3
더 깊이 읽기
예제와 실험 데이터는 이 과정을 위해 만든 것입니다. 원문은 선택 자료이며, 강의와 직접 풀기만으로도 다음 회차를 이어갈 수 있습니다.
From Local to Global: A Graph RAG Approach to Query-Focused SummarizationEdge et al. (2024)GraphRAG DocumentationMicrosoftGraphRAG: Unlocking LLM discovery on narrative private dataMicrosoft Research (2024)From Louvain to Leiden: guaranteeing well-connected communitiesTraag, Waltman & van Eck (2019)HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question AnsweringYang et al. (2018)이 자료는 개념 학습용입니다. 실제 데이터베이스·라이브러리·플랫폼의 동작과 설정은 제품과 버전마다 다를 수 있습니다.