G·Graph Daily Lab
DAY 91 / 100
내 학습 기록
DAY 91개념·실험GraphRAG의 확장과 평가

해마처럼 기억하기, HippoRAG

DAY 19의 개인화 PageRank가 다중 홉 검색의 엔진이 되는 사례입니다. HippoRAG가 그래프를 어떻게 만들고, 질문의 엔티티에서 출발한 PPR 점수를 어떻게 문단 순위로 바꾸는지 작은 그래프로 계산해 봅니다.

약 20분조작형 실험 확인 퀴즈
A SMALL DETOUR

이번 회차, 내 속도로.

기초를 더 짚거나 궁금한 주제로 잠깐 넓혀 보세요. 최대 3단계를 거쳐 DAY 91로 돌아옵니다.

난이도·관심 주제 고르기
이번 회차는 어느 속도로 볼까요?
더 살펴볼 주제 1~2개 선택

1/2개 선택 · 새 보충·심화 수업과 본과정 다시 읽기를 선택할 수 있어요.

이렇게 다녀와요 1단계 · 약 12분

  1. 출발 · DAY 91HippoRAG·개인화 PageRank
  2. 1. 관심 주제재귀 군집·요약 트리·접힌 트리 검색추가 37 · 새 추가 수업
  3. 복귀 · DAY 91원래 회차 이어가기
  • 재귀 군집·요약 트리·접힌 트리 검색 · DAY 92에서 GraphRAG의 무거운 인덱싱을 줄이는 방법들을 봤는데, RAPTOR는 엔티티 추출 대신 임베딩 군집으로 요약 계층을 만드는 또 다른 선택지입니다.

선택과 경로 기록은 이 브라우저에 저장됩니다. 본과정의 회차 완료와는 별도입니다.

복귀: DAY 91 → 본과정 다음 회차: DAY 92

핵심 개념

HippoRAG(Gutiérrez et al. 2024)는 사람의 장기 기억을 설명하는 해마 기억 색인 이론(hippocampal memory indexing theory)에서 설계를 빌려 왔습니다. 신피질에 해당하는 LLM이 코퍼스를 스키마 없는 지식 그래프로 바꾸고, 이 그래프가 기억 단위를 가리키는 해마 색인 역할을 합니다. 오프라인 색인에서는 LLM이 문단마다 먼저 고유명(named entity)을 뽑고, 그것을 넣은 OpenIE 프롬프트로 트리플을 추출합니다. 이어 검색 인코더로 두 노드 임베딩의 코사인 유사도가 임계값 τ 이상이면 동의어(synonymy) 엣지를 추가하고, 각 명사구가 어느 문단에 몇 번 나오는지 행렬로 저장합니다.

온라인 검색에서는 LLM이 질문에서 고유명(질의 고유명)을 뽑고, 인코더로 그래프에서 가장 비슷한 노드(질의 노드)에 연결합니다. 질의 노드에만 같은 확률을 둔 개인화 분포로 개인화 PageRank(DAY 19)를 돌린 뒤, 노드 확률을 문단별 등장 행렬과 곱해 문단 점수를 얻습니다. 또 노드 특이성(node specificity) s = 1/(그 노드가 나온 문단 수)를 질의 노드 확률에 곱해, 드물게 나오는 노드의 영향을 키웁니다. IDF와 비슷한 역할입니다.

핵심은 ‘한 번의 검색으로 다중 홉’입니다. PPR은 질의 노드들의 공통 이웃에 확률을 모으므로, “알츠하이머를 연구하는 스탠퍼드 교수는?”이라면 두 질의 노드 사이에 놓인 교수 노드와 그 문단이 올라옵니다. 논문은 MuSiQue와 2WikiMultiHopQA에서 기존 RAG 방법보다 높은 검색 성능을 보였고, 반복 검색 방법(IRCoT)과 비슷한 성능을 더 적은 비용과 시간으로 냈다고 보고합니다. 설정값은 τ=0.8, 그리고 질의 노드로 걷기를 다시 시작할 확률을 정하는 PPR 감쇠 계수 0.5였습니다.

한계는 그래프에서 옵니다. OpenIE가 놓친 관계는 그래프에 없고, 질의 고유명을 엉뚱한 노드에 연결하면 그 노드의 이웃이 올라갑니다. 동의어 엣지의 임계값이 낮으면 다른 대상이 이어지고, 높으면 같은 대상이 끊깁니다. 후속 연구 HippoRAG 2(Gutiérrez et al. 2025)는 문단 통합을 더 깊게 하고 온라인 단계에서 LLM을 더 효과적으로 쓰도록 고쳤다고 보고합니다.

HippoRAG는 질문의 엔티티를 시작점으로 개인화 PageRank를 돌려 노드 점수를 문단 점수로 바꾸고, 한 번의 검색으로 여러 홉에 걸친 근거를 찾습니다.

작은 예제로 따라가기

01

질문 “알츠하이머를 연구하는 스탠퍼드 교수는?”의 질의 노드 {스탠퍼드, 알츠하이머}에 0.5씩 둡니다. 그래프는 스탠퍼드–토머스, 토머스–알츠하이머, 스탠퍼드–캘리포니아, 알츠하이머–신경과학입니다.

02

재시작 확률 0.5로 PPR을 수렴시키면 스탠퍼드·알츠하이머 1/3≈0.333, 토머스 1/6≈0.167, 캘리포니아·신경과학 1/12≈0.083입니다. 두 시작점의 공통 이웃 토머스가 다른 비시작 노드의 두 배입니다.

03

문단 점수 = 포함 노드 점수의 합: P2(토머스·스탠퍼드) = P3(토머스·알츠하이머) = 0.5, P1(스탠퍼드·캘리포니아) = P4(알츠하이머·신경과학) ≈ 0.417이라 두 홉 근거인 P2·P3가 한 번에 상위에 옵니다.

직접 실험해 보기

‘PPR 계산’을 누르기 전에 어느 문단이 1위일지 예상해 적고, 계산 후 노드 점수와 문단 순위를 벡터 유사도 순위와 비교해 두 시작점 사이의 엔티티를 포함한 문단이 몇 계단 올라가는지 기록하세요.

LIVE EXPERIMENT · HIPPORAG PPR

질문 엔티티에서 개인화 PageRank 퍼뜨리기

질문: 다온대학교 출신으로 해솔시 회사에서 일하는 사람은? · 질문 엔티티(시작점): 다온대학교, 해솔시
다온시0.00특구0.00가온0.00서윤0.00이도0.00다온대0.50강민0.00그린셀0.00누리북0.00누리전자0.00해솔시0.50푸른바다0.00
문단 점수 = 문단에 든 엔티티의 PPR 점수 합 · 정답 근거 문단 C3
PPR 순위 · 문단포함 엔티티PPR 점수
동점 · C2 그린셀 공급 계약해솔시, 누리전자, 가온배터리, 그린셀, 누리북0.500
동점 · C3 누리전자 연구소장누리전자, 강민, 다온대학교, 이도0.500
동점 · C4 이도 연구실이도, 다온대학교, 가온배터리, 서윤0.500
동점 · C6 해솔시 폐수 논란해솔시, 푸른바다, 누리전자0.500
반복 전: 시작점에만 점수가 있어 네 문단이 동점HippoRAG: 오픈 IE로 만든 KG에서 질문 엔티티를 시작점으로 PPR(논문 d = 0.5)을 돌리고 노드 확률을 문단 점수로 모은다. 한 번의 검색으로 다중 홉을 잇는다. 실제로는 노드 특이성(그 노드가 나온 문단 수의 역수)과 동의어 엣지도 쓴다.

이번에는 직접 풀어 보세요

정답을 보기 전에 계산과 이유를 적어 보세요. 해설과 비교하고 확인 표시를 남기면 완료할 수 있습니다.

문제 1
힌트 보기

특이성은 1/문단 수입니다. 곱한 값 0.25와 0.0625를 둘의 합으로 나눕니다.

풀이와 비교하기

스탠퍼드 0.5×1/2=0.25, 알츠하이머 0.5×1/8=0.0625로 합은 0.3125입니다. 정규화하면 0.25/0.3125=0.8, 0.0625/0.3125=0.2입니다. 여러 문단에 흔히 나오는 노드보다 드문 노드 쪽 이웃으로 확률이 더 많이 퍼집니다.

풀이와 확인 표시는 이 브라우저에 저장됩니다.

YOUR NOTES

오늘 이해한 것과 다시 볼 것

계산이 달라진 이유, 헷갈린 개념, 다음에 확인할 질문을 남겨 보세요.

메모는 이 브라우저에 저장됩니다. 홈에서 전체 기록을 내려받을 수 있습니다.

오늘의 이해 확인

HippoRAG에서 개인화 PageRank의 ‘개인화’ 분포는 어디에 확률을 두나요?

완료 조건: 확인 퀴즈 정답 · / 직접 풀기 0/1

FURTHER READING

더 깊이 읽기

예제와 실험 데이터는 이 과정을 위해 만든 것입니다. 원문은 선택 자료이며, 강의와 직접 풀기만으로도 다음 회차를 이어갈 수 있습니다.

HippoRAG: Neurobiologically Inspired Long-Term Memory for Large Language ModelsGutiérrez et al. (2024)From RAG to Memory: Non-Parametric Continual Learning for Large Language ModelsGutiérrez et al. (2025)The anatomy of a large-scale hypertextual Web search engineBrin & Page (1998)

이 자료는 개념 학습용입니다. 실제 데이터베이스·라이브러리·플랫폼의 동작과 설정은 제품과 버전마다 다를 수 있습니다.