Quick Reference
long context는 가능한 많은 파일을 넣는 기능이 아니라, 답에 필요한 source를 식별 가능하게 배치하는 방식입니다. 20k token 이상 문서나 여러 자료를 비교할 때는 문서를 먼저 두고, source metadata와 최종 질문을 분리합니다. 근거가 중요한 답이라면 분석 전에 관련 quote를 뽑고, source ID를 유지한 채 결론을 씁니다.
| 입력 상황 | 먼저 할 일 | 출력 계약 |
|---|---|---|
| 긴 문서 한 개 | 문서를 위에, 질문을 끝에 배치 | 위치 또는 quote를 포함한 요약 |
| 여러 문서 비교 | 문서별 ID·날짜·version을 분리 | source별 일치·충돌·미확인 표시 |
| 최신 정책 확인 | 최신 source 우선 규칙을 적기 | 기준 날짜와 제외한 source 표시 |
| 문서가 너무 많음 | 질문과 무관한 자료를 먼저 제거 | 사용하지 않은 source를 근거처럼 인용하지 않음 |
| extract 후 판단 | quote 추출과 해석을 두 단계로 나누기 | evidence와 recommendation을 분리 |
<documents>
<document id="policy-2026-04">
<source>policy.md</source>
<updated_at>2026-04-01</updated_at>
<document_content>...</document_content>
</document>
</documents>
<task>위 자료만 사용해 질문에 답하고, source ID와 quote를 붙인다.</task>문서와 질문 배치
긴 document와 data-rich input은 prompt 위쪽에 두고, query·instruction·example은 뒤에 둡니다. 문서 본문과 질문을 섞어 두면 모델과 사람이 모두 "무엇이 evidence이고 무엇이 지시인가"를 구분하기 어려워집니다. source, 작성일, version, authority 같은 metadata는 각 document 안에 본문과 분리해 둡니다.
1. <documents> 안의 원문과 metadata
2. 신뢰 우선순위·시간 기준·제외 범위
3. <task> 안의 질문과 완료 조건
4. <output_format> 안의 citation·표·JSON 계약<document>, <source>, <document_content>처럼 일관된 tag를 쓰면 다중 문서의 출처를 잃지 않습니다. tag 자체가 정확성을 보장하지는 않습니다. 같은 ID가 다른 version을 가리키거나, 작성일이 빠진 source를 섞으면 구조가 좋아도 최신성 판단은 틀릴 수 있습니다.
quote-first 분석
요약·비교·정책 판단을 한 호출에서 끝내야 할 이유가 없다면, 먼저 관련 quote를 추출합니다. 다음 단계는 원문 전체가 아니라 quote 목록과 source metadata만 input으로 받아 evidence를 재검토합니다. 이 구조는 context를 줄이는 최적화가 아니라 claim을 되짚을 수 있게 하는 검증 구조입니다.
1. extract: 질문마다 관련 quote, source ID, 위치를 수집한다.
2. reconcile: source 간 같은 내용·충돌·시간 차이를 분류한다.
3. answer: quote가 지지하는 사실과 해석·추천을 분리해 작성한다.
4. check: 각 핵심 claim이 실제 quote와 맞는지 원문으로 대조한다.한 문서의 누락 여부가 중요한 계약·규정 작업에서는 모델이 "모든 내용을 고려했다"고 말해도 증거가 아닙니다. search 또는 structured extraction 결과가 원문 범위를 충분히 덮는지, quote가 불리한 예외 조항을 빠뜨리지 않았는지 별도 기준으로 검사합니다.
context 예산과 실패 신호
| 신호 | 원인 후보 | 먼저 바꿀 것 |
|---|---|---|
| source를 혼동하거나 가짜 citation을 만듦 | ID·metadata·질문이 뒤섞임 | 문서별 tag와 source ID를 고정합니다. |
| 최신 정책 대신 옛 문서를 인용 | version·날짜·우선순위 부재 | 시간 기준과 신뢰 source를 task에 적습니다. |
| 답이 지나치게 일반적임 | 질문이 넓거나 관련 없는 context가 많음 | 답할 sub-question과 제외할 문서를 줄입니다. |
| output이 길고 근거가 약함 | 한 번에 extract·판단·작성 요구 | quote-first 단계로 분리합니다. |
| 같은 문서를 매 호출에 반복 | context·cache 비용과 지연 | stable prefix와 변경 문서를 분리하고 실제 비용을 관찰합니다. |
context window 안에 들어간다는 것은 문서가 정확히 이해되거나 모든 예외가 고려된다는 보장이 아닙니다. 정확성을 요구하는 작업은 document 구조뿐 아니라 source quality, quote coverage, 사람이 확인할 기준을 함께 가져야 합니다.
참고 링크
2 sources