이번에 더 배울 것
인덱싱의 가장 큰 항목은 추출입니다. 추출 호출의 입력 토큰은 대략 청크 수 × (청크 길이 + 프롬프트 길이)입니다. 프롬프트에는 지시문과 예시가 들어가므로 청크보다 길 수도 있습니다. 논문의 팟캐스트 데이터는 600토큰 청크 1,669개(약 100만 토큰)였는데, 프롬프트를 1,000토큰으로 가정하면 추출 입력만 1,669 × 1,600 ≈ 267만 토큰이고, 글리닝 1회마다 비슷한 양이 더해집니다.
질의 비용은 검색 방식에 따라 크게 다릅니다. 논문 표 2에 따르면 팟캐스트 데이터에서 전역 검색 한 번의 컨텍스트로 쓰는 토큰은 C0 보고서 26,657, C3 보고서 746,100, 원문을 맵-리듀스로 요약하는 방식(TS) 1,014,611이었습니다. C0는 TS보다 97% 넘게 적습니다. 그래도 질문이 수백 개면 누적되므로, 질문 수 × 질문당 토큰으로 한 달 규모를 따져 봅니다.
이런 계산은 가격이 아니라 규모 감각을 얻기 위한 것입니다. 토큰당 가격, 출력 길이, 재시도, 임베딩 비용은 모델과 서비스마다 다르고, 실제 프롬프트 길이도 설정마다 다릅니다. 표본 문서 몇 개로 인덱싱을 돌려 청크당 실제 토큰을 측정하고 전체로 곱하는 것이 가장 믿을 만한 추정입니다.
작은 예제로 따라가기
추출 입력: 1,669청크 × (600 + 1,000 가정) = 2,670,400토큰입니다. 글리닝 1회를 같은 양으로 치면 약 534만 토큰입니다.
전역 검색 한 번: C0 26,657토큰 대 TS 1,014,611토큰(논문 표 2)으로, 1 − 26,657/1,014,611 ≈ 97.4% 적습니다.
질문 100개: C0는 약 267만 토큰, C3는 약 7,461만 토큰이라 레벨 선택이 질의 비용을 약 28배 바꿉니다.
어느 손잡이가 토큰을 가장 크게 바꿀까
청크를 두 배로 키우기, 글리닝 1회 추가, 전역 검색 레벨을 C0에서 C3로 바꾸기 가운데 무엇이 토큰을 가장 크게 바꿀지 먼저 예상해 보세요.
청크 텍스트 총량은 같고 프롬프트가 반복되는 횟수만 줄어듭니다(835청크 × 2,200, 프롬프트 1,000 가정). 대신 추출 누락이 늘 수 있습니다.
학습을 시작하면 새 문제를 직접 풀고 확인 퀴즈를 마친 뒤 선택한 본과정 회차로 돌아갑니다.