AI좌표 편집 기록

문서 청킹은 크기보다 의미 경계가 먼저다

고정 길이는 시작점일 뿐이며 하나의 질문에 답할 의미 단위와 출처 관계가 청크 안에 남아야 합니다.

고정 길이와 구조·의미 기반 청킹을 문맥 보존과 검색 실패로 비교한 도식

긴 문서를 작은 조각으로 자르면 검색과 문맥 구성이 쉬워지지만, 잘못 자르면 제목과 본문, 조건과 결론, 표의 행과 열이 분리됩니다. 청킹은 저장 공간 최적화가 아니라 질문이 필요로 하는 근거 단위를 설계하는 작업입니다.

AI 핵심 지식 52편 중 26편입니다. 제품 화면이 바뀌어도 남는 원리와 판단 기준을 다룹니다.

청킹 방식의 비교

방식장점주의할 경계
고정 길이구현과 비용 예측이 단순하다문장·표·절차가 중간에서 끊긴다
구조 기반제목·문단·섹션 관계를 보존한다섹션 크기 편차와 예외 처리가 필요하다
질의·의미 기반답에 필요한 단위를 맞출 수 있다평가 자료와 추가 처리 비용이 필요하다
고정 길이, 구조 기반, 질의·의미 기반 청킹의 장점과 경계 비교표

청크 경계를 정하는 순서

  1. 실제 질문이 요구하는 근거 단위와 인용 범위를 모은다.
  2. 제목·문단·목록·표·코드·절차의 문서 구조를 추출한다.
  3. 너무 큰 섹션만 보조 길이 기준으로 나누고 부모 맥락을 붙인다.
  4. 회수율·중복·문맥 과밀·인용 가능성을 질문별로 평가한다.

청크는 검색 결과이자 인용 단위다

RAG에서 청크는 단순한 저장 조각이 아닙니다. 검색기가 후보로 반환하고 생성기가 읽으며 사용자가 출처로 되짚는 기본 단위입니다. 너무 작은 청크는 질문의 핵심 단어와 가깝게 매칭될 수 있지만 조건과 결론이 분리되어 의미가 불완전해집니다. 너무 큰 청크는 필요한 문장이 포함될 확률은 높아도 주변 정보가 많아 순위와 문맥 사용이 어려워집니다. 좋은 경계는 한 가지 사실 주장, 절차 단계 묶음, 정의와 예외처럼 함께 읽어야 하는 정보를 보존합니다. 문서마다 적합한 단위가 다릅니다. 정책 문서는 조항과 예외, 사용 설명서는 작업 단계와 경고, 연구 논문은 주장과 실험 조건, 표는 머리글과 관련 행이 함께 있어야 합니다. 청크를 설계할 때 ‘몇 토큰인가’만 묻지 말고 ‘이 조각만 읽고 질문에 오해 없이 답할 수 있는가’와 ‘원문 위치로 되돌아갈 수 있는가’를 묻습니다. 검색 결과 화면과 인용 기능까지 고려하면 의미 경계가 크기 숫자보다 먼저라는 점이 분명해집니다.

질문 근거 수집에서 구조 추출, 선택 분할, 검색·인용 평가로 이어지는 순서도

문서 구조를 보존하면 검색 단서가 늘어난다

제목, 소제목, 목록 번호, 표 머리글, 코드 블록, 각주는 내용의 역할을 알려 주는 구조 신호입니다. 본문만 추출하고 구조를 버리면 ‘예외’ 섹션의 문장이 일반 규칙처럼 검색될 수 있고, 표의 숫자가 어떤 열을 뜻하는지 알 수 없게 됩니다. 구조 기반 청킹은 문단을 가능한 한 유지하고, 하위 섹션에 부모 제목 경로를 메타데이터로 붙입니다. 예를 들어 ‘보안 > 접근 권한 > 예외’ 같은 경로는 같은 단어를 쓰는 다른 섹션과 구분하는 단서가 됩니다. 페이지 번호와 원문 오프셋, 문서 버전도 인용과 갱신에 필요합니다. PDF의 머리말·꼬리말이 매 페이지 반복되면 검색 결과를 오염시키므로 정제하되, 반복 여부를 확인하고 제거해야 합니다. 표와 이미지는 대체 텍스트나 구조화된 표현이 필요할 수 있습니다. 구조 추출이 실패한 문서는 별도 품질 상태로 분류합니다. 모든 문서를 같은 규칙으로 자르기보다 문서 유형별 파서를 두고, 공통 메타데이터 계약을 유지하는 편이 운영에 유리합니다.

겹침은 잃어버린 문맥을 보완하지만 중복을 만든다

고정 길이 청킹에서는 경계 근처 문장이 나뉘는 문제를 줄이기 위해 앞뒤 내용을 겹쳐 넣곤 합니다. 겹침은 정의와 설명이 다른 조각으로 갈라지는 것을 완화하지만, 같은 문장이 여러 후보로 검색되어 결과 다양성을 낮출 수 있습니다. 생성 문맥에 거의 같은 청크가 반복되면 제한된 공간을 낭비하고 특정 근거가 과도하게 강조될 수 있습니다. 겹침 길이를 임의로 크게 잡기보다 문장이나 문단 경계를 우선하고, 필요한 경우 부모 제목이나 짧은 맥락 요약을 붙이는 대안을 비교합니다. 검색 후에는 같은 문서의 인접 청크를 합치거나 중복을 제거하는 단계가 필요할 수 있습니다. 다만 합치는 과정에서 권한이나 버전이 다른 조각을 섞지 않도록 합니다. 겹침의 효과는 평균 점수 하나가 아니라 경계 질문에서 정답 회수가 늘었는지, 중복 후보와 지연이 얼마나 증가했는지 함께 봅니다. 청크가 작아질수록 색인 항목 수와 검색 비용도 늘 수 있습니다. 겹침은 기본값이 아니라 특정 경계 실패를 해결하기 위한 선택이어야 합니다.

청킹 평가는 실제 질문과 정답 구간으로 한다

청크 크기를 정할 때 일반적인 권장 숫자를 그대로 적용하면 문서와 질문의 특성을 놓칩니다. 실제 사용자가 묻는 질문을 모으고, 각 질문에 답하는 최소 원문 구간과 필요한 주변 조건을 표시합니다. 서로 다른 청킹 설정에서 그 구간이 상위 검색 결과에 들어오는지 측정합니다. 정답 회수율뿐 아니라 청크 하나가 답에 필요한 조건을 충분히 담는지, 인용했을 때 원문 의미가 유지되는지, 중복 후보가 얼마나 생기는지 봅니다. 짧은 사실 질문, 여러 섹션을 결합해야 하는 질문, 표를 읽어야 하는 질문을 분리하면 한 설정이 모든 유형에 최적이 아님을 확인할 수 있습니다. 생성 답의 정확도만 보면 검색이 우연히 실패했는데 모델 내부 지식으로 맞힌 사례가 섞일 수 있으므로 검색 평가는 독립적으로 수행합니다. 새 문서 유형을 추가하거나 파서를 바꾸면 같은 질문 세트로 회귀 평가합니다. 청킹의 목표는 가장 작은 조각을 만드는 것이 아니라, 질문이 요구하는 근거를 빠짐없이 찾고 출처로 되짚을 수 있는 안정적인 단위를 만드는 것입니다.

판단 체크리스트

  1. 질문별 최소 정답 구간과 필요한 주변 조건을 표시했는가
  2. 제목·목록·표·코드·절차 구조와 원문 위치를 보존했는가
  3. 겹침의 회수 이득과 중복·비용 증가를 함께 측정했는가
  4. 문서 유형과 질문 유형별로 검색 회귀 평가를 수행하는가

자주 생기는 오해

  • 정해진 토큰 크기 하나가 모든 문서에 최적이다 — 문서 구조와 질문이 요구하는 근거 단위에 따라 적합한 경계가 달라집니다.
  • 겹침을 늘리면 문맥 손실만 줄어든다 — 중복 후보, 비용, 문맥 편향도 함께 늘 수 있어 경계 실패에 맞춰 평가해야 합니다.

청크가 너무 작거나 큰 신호

상황해석다음 행동
정답 문장은 나오지만 조건이 없다청크가 의미 단위를 잘랐다부모 제목·앞뒤 문단을 함께 보존한다
관련 문서는 나오나 핵심 문장이 묻힌다청크가 지나치게 크다섹션 내부를 문단·주장 경계로 더 나눈다
같은 문장이 상위 결과를 채운다겹침과 중복이 과하다중복 제거와 인접 청크 병합을 평가한다

자주 묻는 질문

청크 크기는 몇 토큰이 좋나요?

고정 답은 없습니다. 모델 한도보다 실제 질문의 근거 범위와 문서 구조를 먼저 측정해야 합니다.

문장 단위로 모두 나누면 정확한가요?

정의와 조건, 표 관계처럼 여러 문장이 함께 있어야 의미가 완성되는 경우가 많습니다.

부모 섹션 전체를 함께 넣어도 되나요?

관련 맥락은 도움이 되지만 과도한 주변 문장은 잡음이 됩니다. 제목 경로나 선택적 확장을 비교합니다.

청킹만 바꿔도 생성 답을 다시 평가해야 하나요?

예. 검색 후보와 문맥 구성이 바뀌므로 검색 평가와 생성 충실성 회귀를 모두 확인합니다.

관련 좌표

작성·검증 정보

  • 작성·검토: AI좌표 편집부
  • 원문 확인일: 2026-07-27
  • 다음 재검토일: 2027-07-27
  • 재검토 조건: 원 논문의 정정·철회, 표준 정의 변경, 장기 평가에서 핵심 반례가 확인될 때

출처