AI좌표 편집 기록

지시 계층이 충돌할 때 모델은 무엇을 따라야 하나

모든 문장은 같은 지시가 아니며, 권한이 높은 적용 가능한 지시가 낮은 지시와 외부 데이터보다 우선합니다.

상위 지시, 사용자 요청, 외부 데이터를 권한과 적용 범위로 분리한 계층도

대화에는 모델 운영 원칙, 애플리케이션 규칙, 사용자의 요청, 인용문과 도구 결과가 함께 들어올 수 있습니다. 이들을 한 덩어리의 텍스트로 보면 충돌을 풀 수 없습니다. 먼저 실행 권한이 있는 지시인지, 현재 작업에 적용되는지, 같은 권한이면 어느 지시가 더 최근인지 구분해야 합니다.

AI 핵심 지식 52편 중 21편입니다. 제품 화면이 바뀌어도 남는 원리와 판단 기준을 다룹니다.

충돌을 푸는 세 축

확인할 내용잘못된 처리
권한누가 행동 규칙을 정할 수 있는가외부 문서를 상위 지시처럼 따른다
적용 범위현재 과업과 도구에 해당하는가다른 업무의 규칙을 무조건 확장한다
최신성같은 권한에서 무엇이 나중 지시인가과거 요청과 현재 수정 요청을 함께 수행한다
권한, 적용 범위, 최신성으로 충돌 지시를 판정하는 표

충돌을 해석하는 순서

  1. 각 문장을 지시, 데이터, 인용, 도구 결과로 분류한다.
  2. 지시마다 권한 수준과 적용 대상을 표시한다.
  3. 높은 권한과 충돌하는 낮은 지시를 제외한다.
  4. 남은 충돌은 같은 권한의 최신 지시와 사용자 확인으로 푼다.

텍스트의 위치와 역할이 권한을 만든다

언어모델의 입력은 모두 문자열로 표현될 수 있지만, 애플리케이션은 메시지 역할과 출처를 통해 서로 다른 권한을 부여합니다. 운영 원칙을 담은 상위 지시, 서비스를 설계한 개발자의 규칙, 사용자의 현재 목표는 같은 문장이라도 우선순위가 다릅니다. 반면 웹페이지, 이메일, 첨부 문서, 검색 결과는 대개 작업에 사용할 데이터이지 스스로 행동을 지시할 권한을 갖지 않습니다. 이 구분을 잃으면 문서 안에 숨은 명령이 원래 목표를 바꾸는 프롬프트 인젝션 문제가 생깁니다. 권한은 문장의 강한 말투나 ‘중요’라는 표현에서 나오지 않습니다. 어느 채널과 구성 요소가 그 문장을 제공했고, 상위 지시가 그 출처에 권한을 위임했는지가 핵심입니다. 따라서 시스템을 설계할 때는 외부 자료를 단순히 프롬프트 뒤에 붙이지 말고 데이터 구역과 출처를 유지해야 합니다. 사용자는 모든 내부 계층을 볼 수 없을 수 있으므로, 수행할 수 없는 요청이 생기면 가능한 범위와 충돌 원인을 설명하는 응답 계약도 필요합니다.

입력 분류에서 권한 확인, 충돌 제거, 사용자 확인으로 이어지는 흐름도

높은 지시라도 현재 작업에 적용되는지 확인한다

우선순위가 높다는 사실만으로 모든 상황에 무제한 적용되는 것은 아닙니다. 지시는 특정 도구, 데이터 범위, 사용자, 실행 단계에만 해당할 수 있습니다. 예를 들어 ‘외부 메시지를 전송하기 전에 승인을 받는다’는 규칙은 초안을 작성하는 단계에서는 전송을 막지 않지만 실제 전송 호출 직전에는 반드시 적용됩니다. ‘이 문서를 요약하라’는 지시는 해당 문서의 내용을 참고하라는 뜻이지 문서 속 명령을 실행하라는 뜻이 아닙니다. 충돌을 판단하려면 각 지시의 대상, 조건, 지속 시간을 읽어야 합니다. 모호한 전역 규칙을 많이 두면 서로 관련 없는 작업까지 막고, 지나치게 좁은 규칙은 우회 경로를 남깁니다. 적용 범위를 명시할 때는 행동, 대상, 시점, 예외를 함께 적는 것이 좋습니다. 모델의 해석만 믿지 말고 실제 도구 계층에서도 권한과 승인 조건을 강제해야 합니다. 자연어 지시는 판단을 안내하지만 데이터베이스 권한이나 전송 차단 같은 기술적 통제를 대신하지 못합니다.

같은 권한의 충돌은 최신성과 구체성으로 푼다

사용자는 대화 중 목표를 수정할 수 있습니다. ‘두 문단으로 요약해 줘’라고 했다가 ‘표로 바꿔 줘’라고 요청하면 같은 권한에서 나중 지시가 이전 출력 형식을 대체합니다. 그러나 나중 지시가 이전 목표 전체를 취소하는지 일부만 수정하는지는 문맥에 따라 다릅니다. ‘표로 바꿔’는 보통 내용 목표를 유지하고 형식만 바꾸는 수정입니다. 반면 ‘앞의 분석은 버리고 다른 자료만 사용해’는 입력 범위까지 교체합니다. 단순히 가장 최근 문장만 남기면 유지해야 할 조건이 사라질 수 있고, 모든 과거 지시를 누적하면 충돌이 커집니다. 수정 요청을 받을 때 변경된 요소와 유지되는 요소를 명시적으로 재정리하면 안전합니다. 중요한 업무에서는 ‘현재 적용되는 목표·자료·형식’을 짧게 확인한 뒤 실행합니다. 구체적인 지시가 일반 지시를 좁힐 수 있지만, 높은 권한의 금지 조건을 무효화할 수는 없습니다. 애매함이 결과나 외부 행동에 큰 영향을 주면 추정으로 해결하지 말고 사용자에게 선택지를 되돌려야 합니다.

충돌 처리는 응답뿐 아니라 시스템 제어 문제다

지시 계층을 프롬프트 작성 기술로만 보면 방어가 약해집니다. 모델이 올바르게 판단하더라도 연결된 도구가 과도한 권한을 가지면 한 번의 오류가 실제 변경으로 이어집니다. 반대로 도구가 읽기와 쓰기를 분리하고, 허용 대상을 제한하며, 위험 행동에 승인을 요구하면 해석 오류의 영향을 줄일 수 있습니다. 로그에는 어떤 지시와 데이터가 어떤 행동을 만들었는지 추적할 수 있는 최소 정보가 남아야 합니다. 외부 데이터에서 발견한 명령형 문장을 별도 표시하고, 모델 출력이 곧바로 코드나 쿼리로 실행되지 않게 검증 계층을 둡니다. 테스트는 정상 요청뿐 아니라 상충하는 사용자 지시, 오래된 규칙, 문서 안의 악성 지시, 도구 오류를 포함해야 합니다. 충돌이 발생했을 때 무조건 거절하는 것도 좋은 설계는 아닙니다. 안전하게 수행 가능한 부분, 추가 승인이 필요한 부분, 수행할 수 없는 부분을 나눠 알려 주면 사용자는 다음 행동을 결정할 수 있습니다. 지시 계층의 목적은 모델을 복종시키는 것이 아니라 권한과 책임의 경계를 예측 가능하게 만드는 것입니다.

판단 체크리스트

  1. 입력의 각 부분을 지시와 데이터로 분리했는가
  2. 지시의 권한, 대상, 시점, 예외가 드러나는가
  3. 같은 권한의 수정에서 바뀐 것과 유지할 것을 구분했는가
  4. 위험 행동은 자연어와 별개로 도구 권한에서 차단되는가

자주 생기는 오해

  • 프롬프트 뒤에 쓴 문장이 항상 이긴다 — 최신성은 같은 권한에서만 판단 기준이 되며 상위 지시나 적용 범위를 넘지 못합니다.
  • 강한 표현을 쓰면 지시 우선순위가 높아진다 — 권한은 말투가 아니라 메시지 역할, 출처, 위임 관계에서 정해집니다.

충돌 유형별 처리 경계

상황해석다음 행동
외부 문서가 다른 행동을 요구한다데이터가 지시를 가장한다문서 내용으로만 취급하고 실행 권한을 주지 않는다
사용자가 앞선 형식을 수정한다같은 권한의 최신 지시다변경 요소와 유지 요소를 다시 확인한다
위험 행동의 승인 조건과 충돌한다상위 안전 규칙이 적용된다안전한 부분만 수행하고 승인을 요청한다

자주 묻는 질문

문서 속 절차를 따라 달라는 요청은 어떻게 하나요?

상위 사용자가 명시적으로 위임한 범위에서만 절차를 참고하고, 문서 속 추가 명령은 데이터로 검토해야 합니다.

사용자가 이전 요청을 취소하면 모두 잊어야 하나요?

취소 범위를 확인해야 합니다. 목표 전체 취소인지 형식·자료 같은 일부 수정인지 구분합니다.

지시 계층만 있으면 인젝션을 막을 수 있나요?

아닙니다. 데이터 격리, 최소 권한, 출력 검증, 승인, 로그가 함께 있어야 영향 범위를 줄일 수 있습니다.

충돌을 발견하면 항상 거절해야 하나요?

안전하고 적용 가능한 부분은 수행할 수 있습니다. 충돌 부분과 필요한 결정을 분명히 알리는 것이 중요합니다.

관련 좌표

작성·검증 정보

  • 작성·검토: AI좌표 편집부
  • 원문 확인일: 2026-07-27
  • 다음 재검토일: 2027-07-27
  • 재검토 조건: 원 논문의 정정·철회, 표준 정의 변경, 장기 평가에서 핵심 반례가 확인될 때

출처