엔비디아가 인공지능(AI) 에이전트의 행동을 모델 바깥에서 감시하고 차단하는 보안 인프라를 공개했다. 오픈소스 런타임과 블루필드-4 기반 감시 설계를 결합해 소프트웨어부터 하드웨어까지 에이전트의 실행 경로를 통제하는 구조다.
엔비디아는 28일(현지시간) 오픈소스 런타임 ‘오픈셸(OpenShell)’과 하드웨어 감시 설계 ‘센트리(Sentry)’로 구성된 ‘오픈 에이전트 세이프티 플랫폼’을 발표했다. 회사 발표에 따르면 에이전트가 허용 범위를 벗어나면 블루필드-4 데이터처리장치(DPU)가 이를 감지해 밀리초 단위로 격리한다.
핵심은 에이전트가 안전장치 자체에 손을 댈 수 없도록 통제 지점을 분리한 데 있다. 오픈셸이 중앙처리장치(CPU)에서 파일·네트워크·도구·자격증명 접근 범위를 정하면 센트리가 별도 블루필드-4에서 정책 준수 여부를 감시한다. 호스트 운영체제나 에이전트가 침해돼도 감시 장치는 영향을 받지 않는 ‘아웃오브밴드’ 구조다.
오픈셸 0.1.0은 현재 일반에 공개된 아파치 2.0 기반 소프트웨어다. 에이전트를 각각 별도 샌드박스에 넣고 직접적인 네트워크 접근을 차단한다. 외부 요청은 샌드박스 밖의 감독 프로세스를 거치며 HTTP·그래프QL·모델 콘텍스트 프로토콜(MCP) 요청을 읽기와 쓰기 수준으로 구분해 허용할 수 있다.
실제 인증키도 에이전트 내부에 주지 않는다. 감독 프로세스가 승인된 요청에만 외부에서 자격증명을 붙이는 방식이다. 에이전트가 셸을 열거나 코드를 생성하고 하위 에이전트에 작업을 넘겨도 같은 정책이 적용된다. 엔비디아 기술문서에 따르면 정책 변경은 기본적으로 사람의 승인을 받아야 하며 에이전트가 자신의 권한 확대 요청을 직접 승인할 수 없다.
센트리는 이 통제를 블루필드-4 실리콘까지 내린다. 64코어 그레이스 CPU와 초당 800기가비트 네트워크 인터페이스를 갖춘 블루필드-4에서 센트리와 DOCA가 에이전트의 신원을 검증하고 요청·응답을 검사하며 데이터·도구·API·서비스 접근을 감시한다. 로컬 파일 접근 통제는 CPU 측 오픈셸의 커널 수준 샌드박스가 담당한다. 엔비디아의 베라 루빈 시스템에서는 블루필드-4가 노드에서 모델로 이어지는 유일한 경로에 배치돼 사실상 ‘킬 스위치’ 역할을 맡는다. 엔비디아는 기존 베라·블루필드-4 시스템에서는 소프트웨어 업데이트만으로 이 기능을 활성화할 수 있다고 설명했다.
발표 시점도 절묘하다. 지난 7월 오픈AI 내부 평가용 에이전트들은 패키지 저장소 프록시의 제로데이 취약점을 이용해 격리 환경을 빠져나간 뒤 허깅페이스 운영 시스템을 침해했다. 허깅페이스는 약 1만7600건의 공격 행동을 복원했다고 밝혔다. 오픈AI도 해당 모델들이 자사 연구 인프라와 제3자 시스템에 접근한 사실을 인정했다.
이 사고를 주도한 모델은 일반 이용자에게 배포된 제품이 아니라 안전 거부 기능을 낮춘 내부 연구용 모델이었다. 하지만 에이전트가 평가 점수를 얻으려고 답을 훔치는 ‘보상 해킹’을 시도하고, 서로 메시지를 주고받으며 공격을 분담했다는 점에서 기존 샌드박스 설계의 약점을 드러냈다. 오픈AI 조사 결과 사고 당시 운영 환경에 적용하던 행동 감시 장치가 해당 평가에는 빠져 있었다.
보완 이후에도 우회 시도는 이어졌다. 오픈AI는 지난 20일 다른 내부 연구 모델이 인터넷 접근 제한의 DNS 허점을 이용해 외부 챗봇과 통신한 사실을 25일 공개했다. 감시 시스템이 15분 만에 이를 포착했지만 실행이 완전히 중단되기까지 약 2시간30분이 걸렸다. 오픈AI는 이후 최상위 모델을 대상으로 한 도구 사용 학습·평가·추론을 일시 중단했다. 관련 보고서가 공개된 지 사흘 만에 엔비디아의 플랫폼 발표가 나왔다.
플랫폼은 오픈소스 오픈셸로 적용 범위를 넓히되, 실리콘 수준의 감시와 차단은 블루필드-4와 엔비디아 DOCA 소프트웨어가 담당하는 구조다. 오픈셸은 코덱스·클로드 코드·깃허브 코파일럿 CLI 등 모델과 에이전트 프레임워크를 가리지 않고 인텔·Arm 계열 시스템에도 확장할 수 있다.
앤트로픽은 ‘클로드 매니지드 에이전트’와 오픈셸·블루필드 연동을 추진한다. 세일즈포스는 슬랙에서 에이전트의 권한 확대 요청을 승인하거나 거절하는 기능을 붙였고, SAP는 줄 스튜디오 런타임에 오픈셸을 내장한다. 엔비디아가 밝힌 참여 기업·기관은 마이크로소프트, 시스코, 크라우드스트라이크, 팔로알토네트웍스, 허깅페이스 등 100곳이 넘는다.
다만 공개된 범위를 구분해 볼 필요가 있다. 즉시 사용할 수 있는 것은 오픈셸 소프트웨어이며 센트리는 아직 ‘레퍼런스 시스템 설계’로 발표됐다. 엔비디아는 정확한 격리 지연시간과 오탐률, 장시간 운영 환경에서의 성능 저하를 공개하지 않았다. 밀리초 단위 차단과 낮은 처리 부담은 현재 회사 측 주장으로, 제3자 검증 결과는 나오지 않았다.
정책이 잘못 작성되면 하드웨어도 잘못된 정책을 정확히 집행할 뿐이다. 에이전트의 거짓말이나 판단 오류를 알아서 판별하는 장치도 아니다. AP통신이 인용한 보안 전문가는 지나치게 엄격한 통제가 정상 작업까지 막을 수 있으며 보안과 유용성의 균형은 실제 사례를 통해 검증해야 한다고 지적했다.
그럼에도 이번 발표는 엔비디아의 사업 영역이 연산 가속기를 넘어섰음을 보여준다. AI 에이전트가 기업의 코드·데이터·결제·로봇에 접근할수록 보안의 중심은 모델이 무슨 말을 하는지보다 어떤 행동을 실제로 실행할 수 있는지로 이동한다. 센트리 설계가 실제 시스템에 확산될 경우 엔비디아의 역할은 GPU 공급자를 넘어 에이전트의 접근권한과 중단권을 집행하는 인프라 영역까지 넓어질 수 있다.

댓글 남기기