본문 바로가기
2026년 8월 18일 화요일
이슈페이퍼는 국내외 정치, 최신 IT, 세계경제, 증시, 환율과 원자재 소식을 공식 자료와 해외 원문을 바탕으로 분석하는 개인 정보 매체입니다.
Independent News & Insight
IT

AI 에이전트의 보안 경계는 모델이 아니다: 도구 권한과 승인 로그

편집자
AI 에이전트와 외부 도구 사이에서 최소권한, 사람 승인, 감사로그로 악성 프롬프트를 차단하는 보안 게이트
조회수 8회

생성형 AI 보안 논의가 여전히 모델의 답변 정확도에 머무는 동안, 실제 사고의 무게중심은 모델 밖으로 이동하고 있다. 메일을 보내고, 데이터베이스를 조회하며, 결제를 요청하는 AI 에이전트는 단순한 대화형 서비스가 아니다. 자연어를 실행 권한으로 바꾸는 새로운 자동화 계층이다. 따라서 핵심 질문은 “모델이 악성 지시를 완벽히 알아챌 수 있는가”가 아니라 “모델이 틀리거나 속더라도 피해가 어디에서 멈추는가”여야 한다.

프롬프트 주입은 입력 문제지만, 사고 규모는 권한이 결정한다

에이전트는 사용자의 지시뿐 아니라 웹페이지, 첨부문서, 검색 결과, 다른 에이전트의 출력도 문맥으로 읽는다. 이때 외부 자료에 숨은 명령이 원래 목표를 바꾸는 간접 프롬프트 주입이 발생할 수 있다. 그러나 같은 공격도 읽기 전용 요약기에서는 오답으로 끝날 수 있고, 송금·삭제·외부 전송 권한을 가진 에이전트에서는 실제 손실로 번진다. 공격의 입구는 콘텐츠지만 피해의 상한은 도구의 기능, 자격증명 범위, 자동 실행 수준이 정한다는 뜻이다.

OWASP는 이를 ‘과도한 에이전시’로 설명하면서 과도한 기능, 권한, 자율성을 세 가지 근본 원인으로 제시한다. 특히 읽기만 필요한 메일 요약기에 발송 기능까지 제공하거나, 사용자별 권한 대신 공용 고권한 계정을 연결하는 구성을 경고한다. 이 관점은 보안팀이 프롬프트 필터의 탐지율만 높이는 데서 벗어나 실행면 자체를 줄여야 함을 보여준다.

모델과 도구 사이에 별도의 ‘권한 결정면’이 필요하다

안전한 구조에서는 모델의 도구 호출이 곧 실행 명령이 되어서는 안 된다. 모델은 무엇을 하고 싶은지 구조화된 요청을 만들 뿐이고, 별도의 정책 엔진이 사용자 신원, 현재 업무, 대상 자원, 위험 등급, 시간과 비용 한도를 다시 검사해야 한다. 조회와 변경을 분리하고, 한 번 발급된 토큰도 특정 도구·특정 레코드·짧은 유효시간에만 쓰이도록 제한해야 한다. 비밀키는 모델 문맥에 넣지 않고 실행 중계 계층이 보관해야 한다.

NIST의 생성형 AI 위험관리 프로필은 위험을 개발 단계의 단일 테스트가 아니라 거버넌스·측정·관리 전 과정에서 다루도록 권고한다. 이를 에이전트에 적용하면, 권한 목록과 데이터 흐름을 배포 전에 기록하고, 실제 도구 호출을 지속적으로 측정하며, 예상 밖 호출을 차단·복구하는 운영 체계가 필요하다. 모델 평가 점수 하나로는 권한 오용, 비용 폭주, 연쇄 호출 같은 운영 위험을 포착할 수 없다.

사람의 승인은 버튼이 아니라 독립된 검증 절차여야 한다

고위험 작업에 사람의 확인을 넣는 것만으로는 충분하지 않다. 승인 화면이 에이전트가 만든 설명을 그대로 보여주면 공격자가 설명까지 조작할 수 있다. 승인자는 원본 대상, 실제 변경 전후 값, 수신자, 금액, 권한 범위, 데이터 반출 여부를 신뢰할 수 있는 시스템에서 따로 확인해야 한다. 삭제·송금·대량 발송·권한 변경처럼 되돌리기 어려운 작업에는 2인 승인, 지연 실행, 취소 창구를 결합할 수 있다.

또한 감사로그에는 단순한 대화문이 아니라 누가 어떤 정책으로 어떤 도구와 매개변수를 승인했는지, 실행 결과와 거부 사유가 무엇인지 남겨야 한다. 로그가 사후 편집될 수 없도록 무결성을 보장하고, 개인 정보는 최소화해야 한다. 그래야 사고 조사뿐 아니라 반복되는 오판 패턴을 찾아 정책을 조정할 수 있다.

도입 속도보다 중요한 세 가지 운영 지표

기업은 에이전트 성능을 완료율과 처리시간만으로 평가하기 쉽다. 그러나 보안 관점에서는 첫째, 업무별 허용 도구 수와 실제 사용률, 둘째, 고위험 호출 중 독립 승인을 거친 비율, 셋째, 취소·복구 가능한 실행의 비율을 함께 봐야 한다. 여기에 사용자별 단기 자격증명, 호출 횟수와 비용 상한, 외부 반출 탐지, 이상 호출의 자동 격리를 더하면 단일 방어선 실패가 곧바로 사고가 되는 구조를 피할 수 있다.

전망도 분명하다. 에이전트가 여러 SaaS와 내부 시스템을 연결할수록 보안의 중심은 모델 프롬프트에서 권한 중개와 실행 증명으로 이동할 것이다. 좋은 에이전트는 무엇이든 할 수 있는 시스템이 아니라, 필요한 순간에 필요한 최소 행동만 하고 그 과정을 입증할 수 있는 시스템이다. 모델이 영리해질수록 이 원칙은 약해지는 것이 아니라 더 중요해진다.

출처 및 확인 시각

이 글은 특정 제품의 구매나 투자를 권유하지 않으며, 공개된 보안 지침을 바탕으로 AI 에이전트 운영 통제를 분석한 이슈 페이퍼다.

의견을 남겨주세요

자유로운 의견을 나눠 주세요. 서로를 존중하는 인터넷 네티켓을 지켜 주세요.욕설이나 상대를 비하·비방하는 댓글은 자동으로 삭제됩니다.