전역 검색과 로컬 검색
인덱스를 만들었으니 이제 질문에 답할 차례입니다. 커뮤니티 보고서를 맵-리듀스로 모으는 전역 검색과, 질문의 엔티티에서 출발하는 로컬 검색이 각각 무엇을 컨텍스트에 넣는지 비교합니다.
이번 회차, 내 속도로.
기초를 더 짚거나 궁금한 주제로 잠깐 넓혀 보세요. 최대 3단계를 거쳐 DAY 89로 돌아옵니다.
난이도·관심 주제 고르기
1/2개 선택 · 새 보충·심화 수업과 본과정 다시 읽기를 선택할 수 있어요.
이렇게 다녀와요 1단계 · 약 12분
- 출발 · DAY 89맵-리듀스·엔티티 중심
- 1. 관심 주제토큰 예산·선불 비용·질의 비용추가 35 · 새 추가 수업
- 복귀 · DAY 89원래 회차 이어가기
- 토큰 예산·선불 비용·질의 비용 · DAY 86에서 ‘비용은 인덱싱 때 먼저 낸다’고 했는데, 그 크기를 토큰으로 세어 보면 청크 크기·글리닝·커뮤니티 레벨 선택의 무게가 보입니다.
선택과 경로 기록은 이 브라우저에 저장됩니다. 본과정의 회차 완료와는 별도입니다.
핵심 개념
전역 검색(Global Search)은 한 레벨의 커뮤니티 보고서 전체를 맵-리듀스로 처리합니다. 논문에 따르면 보고서를 무작위로 섞어 정해진 토큰 크기로 묶습니다(관련 정보가 한 컨텍스트에 몰려 잃지 않도록). 맵 단계에서는 묶음마다 병렬로 중간 답을 만들고 LLM이 그 답이 질문에 얼마나 도움이 되는지 0~100점 유용성 점수를 매기며, 0점은 버립니다. 리듀스 단계에서는 중간 답을 점수 내림차순으로 새 컨텍스트에 한도까지 넣어 최종 답을 만듭니다. 공식 문서는 중간 답을 중요도 점수가 붙은 요점 목록으로 설명합니다.
레벨 선택이 비용을 정합니다. 논문 표 2에서 팟캐스트 데이터의 질의 컨텍스트는 C0 보고서 34개 26,657토큰, C3 보고서 1,310개 746,100토큰, 원문을 직접 맵-리듀스하는 방식(TS) 1,014,611토큰이었습니다. C0는 TS보다 97% 넘게 적은 토큰을 씁니다. 공식 문서도 낮은 레벨의 자세한 보고서일수록 철저한 답이 나오기 쉽지만 시간과 LLM 자원이 더 든다고 설명합니다.
로컬 검색(Local Search)은 특정 엔티티에 관한 질문용입니다. 엔티티 설명 임베딩으로 질문과 의미가 가까운 엔티티를 찾고, 거기서 연결된 엔티티·관계·공변량(주장)·커뮤니티 보고서·원문 텍스트 단위를 후보로 모은 뒤, 우선순위를 매겨 미리 정한 크기의 컨텍스트 창 하나에 맞게 걸러 답합니다. 문서의 예시 질문은 “캐모마일의 치유 효과는?”처럼 입력 문서에 나온 특정 엔티티를 이해해야 하는 질문입니다.
DRIFT 검색은 둘을 섞습니다. 질문과 가장 가까운 상위 K개 커뮤니티 보고서로 폭넓은 첫 답과 후속 질문을 만들고(프라이머), 후속 질문을 로컬 검색으로 다듬어(후속), 질문·답의 계층으로 결과를 냅니다. 고르는 기준은 질문 유형입니다. 전체 주제는 전역, 특정 엔티티는 로컬, 엔티티 질문이지만 넓은 맥락이 필요하면 DRIFT, 단순 사실은 기본 벡터 검색(Basic Search)입니다. 전역 검색은 한 레벨의 보고서 전체를 맵 단계에서 읽으므로 질의당 토큰이 가장 많이 들기 쉽습니다.
작은 예제로 따라가기
맵: 보고서 6개(묶음 하나에 보고서 하나로 단순화)에서 부분 답 6개와 유용성 점수 R1 80, R2 0, R3 55, R4 90, R5 20, R6 0이 나왔습니다.
0점인 R2·R6을 버리고 R4(90), R1(80), R3(55), R5(20) 순으로 정렬합니다.
부분 답이 각 150토큰이고 리듀스 예산이 500토큰이면 R4·R1·R3(450토큰)까지 들어가고 R5는 빠집니다. 이 세 부분 답으로 최종 답을 씁니다.
직접 실험해 보기
Global에서 토큰 예산을 줄여 가며 리듀스에 남는 부분 답 수를 기록한 뒤, Local로 바꿔 질문 엔티티를 클릭하고 컨텍스트가 어떤 종류의 자료(엔티티·관계·원문 청크·보고서)로 채워지는지 비교하세요.
전역 검색과 로컬 검색의 컨텍스트 조립하기
1 · 맵: C2 보고서마다 부분 답 + 유용성 점수(0–100)
- L1가온배터리 창업
특구 첫 수혜 기업 가온배터리가 다온시에서 자라며 지역 산업의 중심이 됐다.
45점 · 70토큰 - L2다온시 청정에너지 특구
다온시는 청정에너지 특구로 지정돼 배터리 기업 세금을 깎아 주며 기업 유치에 나섰다.
80점 · 85토큰 - L3다온대 전고체 연구실
다온대 연구실이 지역 배터리 인재를 길러 낸다.
15점 · 55토큰 - L4그린셀과 누리북0점 제외
질문과 관련된 내용이 없다(제품 탑재 정보뿐).
0점 · 40토큰 - L5누리전자 연구소
누리전자는 연구소를 운영한다. 지역 쟁점과의 관련은 약하다.
20점 · 60토큰 - L6해솔시 폐수 논란
해솔시에선 누리전자 공장 폐수를 두고 푸른바다가 문제를 제기했고, 정화 설비 투자 약속을 받아 냈다.
90점 · 110토큰
2 · 리듀스: 0점 제외 → 점수 높은 순 → 예산이 찰 때까지 추가
| 순위 | 보고서 | 점수 | 토큰 | 누적 | 결합 |
|---|---|---|---|---|---|
| 1 | L6 | 90 | 110 | 110 | 포함 |
| 2 | L2 | 80 | 85 | 195 | 포함 |
| 3 | L1 | 45 | 70 | 265 | 예산 초과 |
| 4 | L5 | 20 | 60 | 325 | 예산 초과 |
| 5 | L3 | 15 | 55 | 380 | 예산 초과 |
해솔시에선 누리전자 공장 폐수를 두고 푸른바다가 문제를 제기했고, 정화 설비 투자 약속을 받아 냈다. 다온시는 청정에너지 특구로 지정돼 배터리 기업 세금을 깎아 주며 기업 유치에 나섰다.
DRIFT 검색은 둘을 섞는다: 커뮤니티 보고서로 첫 답과 후속 질문을 만든 뒤, 로컬 검색으로 후속 질문을 다듬는다.
이번에는 직접 풀어 보세요
정답을 보기 전에 계산과 이유를 적어 보세요. 해설과 비교하고 확인 표시를 남기면 완료할 수 있습니다.
힌트 보기
총 토큰을 보고서 수로 나누면 평균이고, 총 토큰을 8,000으로 나눠 올림하면 맵 호출 수입니다.
풀이와 비교하기
평균은 C0 26,657/34≈784토큰, C3 746,100/1,310≈570토큰입니다. 맵 호출은 C0 26,657/8,000≈3.3이라 4회, C3 746,100/8,000≈93.3이라 94회입니다. 낮은 레벨일수록 보고서 하나는 짧지만 수가 많아 질의 비용이 20배 넘게 커집니다.
풀이와 확인 표시는 이 브라우저에 저장됩니다.
오늘 이해한 것과 다시 볼 것
계산이 달라진 이유, 헷갈린 개념, 다음에 확인할 질문을 남겨 보세요.
메모는 이 브라우저에 저장됩니다. 홈에서 전체 기록을 내려받을 수 있습니다.오늘의 이해 확인
“한결물류가 최근 맺은 계약 상대는?”처럼 특정 엔티티를 묻는 질문에 먼저 고려할 GraphRAG 검색 방식은?
완료 조건: 확인 퀴즈 정답 · / 직접 풀기 0/1
더 깊이 읽기
예제와 실험 데이터는 이 과정을 위해 만든 것입니다. 원문은 선택 자료이며, 강의와 직접 풀기만으로도 다음 회차를 이어갈 수 있습니다.
From Local to Global: A Graph RAG Approach to Query-Focused SummarizationEdge et al. (2024)GraphRAG DocumentationMicrosoftIntroducing DRIFT SearchMicrosoft Research (2024)이 자료는 개념 학습용입니다. 실제 데이터베이스·라이브러리·플랫폼의 동작과 설정은 제품과 버전마다 다를 수 있습니다.