AI 에이전트 스킬, 설치 승인 뒤가 더 위험한 이유: 실행 중 행위 드리프트를 멈추는 6단계

읽는 시간 약 8분
먼저 답하면: 설치를 승인한 AI 에이전트 스킬도 운영 중 새 외부 목적지, 도구, 권한, 데이터 범위, 호출량을 보일 수 있습니다. 처음 승인한 기준선과 실제 이벤트를 비교하고, 차이가 나면 중단·증거 보존·재승인으로 이어지는 절차를 미리 정해 두는 편이 안전합니다.

스킬을 설치할 때 출처와 권한을 꼼꼼히 봤다면, 다음 질문은 “실행 중에 달라지면 누가 알아차릴까?”입니다. 이 글은 특정 제품을 고르기보다, 팀이 스킬의 실제 행동을 관찰하고 멈출 기준을 만드는 방법을 정리합니다.

핵심 요약

  • 설치 전 심사와 실행 중 관찰은 서로 대체되지 않습니다.
  • 허용 도메인·도구·권한·데이터·호출량을 스킬별 기준선으로 남겨 두세요.
  • 새 외부 전송, 쓰기·삭제 권한 확대, 데이터 경계 위반은 즉시 검토해야 합니다.
  • 드리프트를 공격으로 단정하지 말고, 중단과 재승인 사이에 사람 검토 경로를 두세요.

목차

  1. 설치 심사 뒤에도 관찰이 필요한 이유
  2. 행위 드리프트란 무엇인가
  3. 기준선 계약 만들기
  4. 예상 밖 webhook 호출 대응
  5. 6단계 운영 체크리스트
  6. 자주 묻는 질문
AI 에이전트 스킬의 설치 전 심사와 실행 중 행위 드리프트 관찰을 보여주는 이중 게이트 다이어그램
설치 전 수용과 실행 중 관찰은 서로 다른 두 개의 통제 지점입니다.

설치 심사 뒤에도 관찰이 필요한 이유

설치 전 검토는 패키지의 출처, 선언된 훅, 요청 권한을 확인하는 순간의 판단입니다. 하지만 운영 중에는 연결된 서비스 설정, 입력 데이터, 호출 경로가 바뀔 수 있습니다. 따라서 승인 당시의 약속과 실제 실행을 비교할 수 있어야 합니다.

Anthropic은 Claude Apps의 skill·plugin 보안 스캔을 안내하고 있으며, Google Cloud Security Command Center 릴리스 노트는 에이전트 환경의 런타임 위협 탐지 신호를 다룹니다. 두 사례는 제품 기능의 보장을 뜻하지 않습니다. 다만 설치 검토와 실행 중 관찰을 분리해 생각해야 한다는 운영적 힌트를 줍니다.

구분해 보세요. 설치 전 수용 게이트는 무엇을 들일지 결정합니다. 변경 전 계약 테스트는 바꾼 버전이 기대대로 움직이는지 봅니다. 런타임 행위 드리프트는 이미 승인된 스킬이 실제로 무엇을 하는지 계속 비교합니다.

행위 드리프트란 무엇인가

행위 드리프트는 승인 당시의 기준선과 실제 실행 이벤트 사이의 의미 있는 차이입니다. 예를 들어 사내 문서 검색과 저장만 허용된 요약 스킬이 새 외부 webhook을 호출하려 한다면, 그 호출은 자동 통과가 아니라 검토 대상이 됩니다.

통제 시점 확인 질문 관찰·증거 차이 발생 시
설치 전 무엇을 요청하나요? 출처·훅·권한 수용 또는 거절
배포 전 기대한 흐름대로 움직이나요? 대표 작업 결과 수정 후 재검증
운영 중 승인한 범위를 벗어났나요? 목적지·도구·권한 결과 중단·보존·재승인

표는 좌우로 밀어 확인할 수 있습니다.

스킬별 기준선 계약을 한 장으로 만드세요

거대한 감시 시스템부터 시작할 필요는 없습니다. 스킬마다 아래 다섯 항목을 기록하면 비교 기준이 생깁니다.

  • 목적지: 허용된 내부 API와 외부 도메인
  • 도구: 읽기, 저장, 배포처럼 호출 가능한 도구 목록
  • 권한: 읽기·쓰기·삭제·외부 전송의 허용 범위
  • 데이터: 다루는 데이터 분류와 전송 금지 경계
  • 호출량: 평소 요청량과 실패 재시도에 대한 알림 기준
AI 에이전트 스킬의 승인 기준선과 실제 실행 이벤트를 비교하는 흐름도

예상 밖 webhook 호출을 발견했다면

문서 요약 스킬이 기존에는 사내 검색과 저장만 사용했는데 새 webhook을 호출하려 한다고 가정해 보겠습니다. 먼저 해당 작업의 쓰기·외부 전송을 멈춥니다. 이어 스킬 버전, 호출 시각, 목적지, 도구 인자 메타데이터, 권한 결과를 보존합니다. 민감한 본문과 비밀값은 최소화하거나 마스킹해야 합니다.

그 다음 담당자가 변경의 정당성을 확인합니다. 업무상 필요한 새 연결이라면 최소 권한으로 허용 목록과 기준선을 갱신해 재승인합니다. 설명할 수 없거나 데이터 경계를 넘는다면 스킬을 격리하고 원인을 조사합니다. 최소 권한 설계가 이 판단의 바닥이 됩니다.

승인되지 않은 외부 호출이 발견됐을 때 AI 에이전트 스킬을 중단하고 검토하는 대응 절차

실행 중 행위 드리프트를 멈추는 6단계

  1. 기준선을 작성합니다. 허용 목적지·도구·권한·데이터·호출량을 버전과 함께 기록하세요.
  2. 이벤트를 수집합니다. 실제 호출을 같은 단위의 메타데이터로 남기세요.
  3. 차이를 분류합니다. 새 목적지, 새 도구, 권한 확대, 데이터 경계, 비정상 재시도를 구분합니다.
  4. 중단 조건을 정합니다. 쓰기·삭제·외부 전송은 설명되지 않은 차이에서 자동 중단하도록 설계하세요.
  5. 증거를 보존합니다. 스킬 버전과 결정 경로는 남기되, 민감 정보의 보존 정책도 함께 지키세요.
  6. 재승인 또는 복구합니다. 정상 변경은 최소 권한 기준선으로 갱신하고, 불명확한 변경은 격리합니다.

자주 묻는 질문

행위 드리프트는 모두 공격인가요?

아닙니다. 정상 변경과 설정 오류도 있을 수 있습니다. 중요한 점은 새 행위를 근거 없이 허용하지 않고 검토 경로로 연결하는 것입니다.

작은 팀은 무엇부터 기록해야 하나요?

허용 도메인, 도구, 쓰기 권한, 데이터 분류, 대략적인 호출량부터 한 장에 적어 보세요.

모든 호출을 저장해야 하나요?

아닙니다. 목적지·도구·권한 결과·버전처럼 판단에 필요한 최소 메타데이터를 우선하고, 민감값은 마스킹하세요.

마무리

스킬을 승인했다는 사실은 출발점일 뿐입니다. 실제 작업이 승인한 범위를 벗어났을 때 멈추고 설명을 요구할 수 있어야, 자동화가 팀의 통제 범위 안에서 계속 일할 수 있습니다.

참고 자료

이 글이 마음에 드세요?

RSS 피드를 구독하세요!

FLOWIT on YouTube

영상으로도 FLOWIT을 이어서 보세요

AI 자동화, Claude Code, n8n, 데이터 분석 흐름을 블로그와 영상으로 함께 정리하고 있습니다.

YouTube 채널 보기