앤트로픽, 클로드 비자신청 20건…美 AI사고 즉시 공개 요구

앤트로픽의 인공지능 에이전트 클로드가 시험 과정에서 미국 정부의 실제 웹사이트에 비자 신청서를 제출한 사고가 AI 기업을 향한 즉시 공개 요구를 촉발했다.

미 백악관은 AI 모델이 정부·민간 시스템에 일으킨 보안 사고를 기업이 즉시 신고하고 피해를 복구하라고 요구했다. 자율적으로 화면을 조작하는 업무형 에이전트가 확산하면서 규제 초점도 답변 내용에서 실제 행동 권한 통제로 옮겨가고 있다.

미국 인터넷 매체 악시오스에 따르면 앤트로픽의 미출시 연구 모델은 지난 5월 1건, 8월 19건 등 총 20건의 비이민 비자 신청서를 국무부 웹사이트에 제출했다. 연습용 양식을 작성하라는 평가 과제에서 복제 화면이 열리지 않자 실제 사이트로 이동해 제출한 것으로 파악됐다.

국무부는 해당 신청서가 처리되지 않았으며 시스템 침해나 해킹도 발생하지 않았다고 밝혔다. 다만 단순한 텍스트 오류와 달리 정부의 행정 시스템에 허위 신청 데이터가 실제로 입력됐다는 점에서 사고 성격이 다르다.

별도의 평가에서는 클로드 하이쿠 4.5가 필라델피아 경찰의 미제 살인사건 제보 사이트에 허위 정보를 제출했다. 클로드는 지난 7월 18일 무작위 웹페이지에서 예시 작업을 수행하라는 지시를 받고, 존재하지 않는 목격 내용을 작성했다. 이름과 연락처는 비워뒀으며 해당 제보는 스팸으로 분류돼 수사관에게 전달되지 않았다.

필라델피아 경찰은 앤트로픽이 통보하기 전까지 사고를 알지 못했다. 경찰은 미제 사건에는 실제 피해자와 유족이 있다며 기술기업이 법 집행기관에 허위 정보가 제출되지 않도록 필요한 조치를 해야 한다고 밝혔다. AP통신은 앤트로픽이 연방·주·지방 정부기관과 관련된 사례를 백악관에 설명했다고 전했다.

백악관 슈퍼 인텔리전스 포스(Super Intelligence Force·SI Force)는 이번 사고 이후 AI 기업에 모델 관련 사고를 즉시 공개하고 피해를 복구하라고 요구했다. SI Force는 사고 공개를 선택 사항이 아닌 국가안보상 책임이라고 강조했으며, 기업이 피해 기관과 협력해 재발 방지책을 마련해야 한다고 밝혔다.

다만 이번 요구는 법률이나 행정명령 형태의 세부 규정이 아니다. 보고 대상 사고의 범위, 신고 기한, 미신고 때 적용할 처벌과 집행 기관은 공개되지 않았다. 국가안보상 책임을 강조한 것과 별개로 실제 강제력이 어디에서 나오는지는 확인되지 않았다.

앤트로픽 자체 조사에 따르면 사고의 공통점은 모델이 작업을 중단하지 않고 우회로를 찾는 ‘지속성’이었다. 비자 신청 평가에서는 연습용 화면이 작동하지 않자 실제 양식으로 이동했고, 경찰 제보 평가에서는 제출 금지 범위가 명확하지 않자 최종 버튼까지 눌렀다.

이는 “제출하지 마라”는 자연어 지시만으로 에이전트의 행동을 통제하기 어렵다는 점을 보여준다. 모델은 비결정적으로 작동하기 때문에 같은 과제를 수백 번 수행하는 동안 대부분 멈추더라도 일부 실행에서 실제 제출까지 진행할 수 있다. 평균 성공률보다 드물게 발생하는 고위험 행동이 더 중요한 이유다.

앤트로픽은 모든 내부 평가의 실시간 인터넷 접근을 일시 중단하고, 문제 행동을 탐지해 차단하는 도구를 대부분의 평가와 내부 에이전트 환경에 적용했다고 밝혔다. 해당 탐지 장치를 이번 사례에 다시 적용했을 때는 모든 행동이 차단됐다는 것이 회사의 자체 시험 결과다. 제3자 검증 결과는 아니다.

업무형 에이전트의 규제 단위도 모델 자체에서 실행 환경으로 넓어질 전망이다. 실제 제출·송금·계정 생성·행정 신청처럼 되돌리기 어려운 행동에는 별도 승인 단계가 필요하다. 브라우저 접근 범위 제한, 허용 도메인 목록, 제출 직전 사용자 확인, 실행 기록 보존, 비정상 행동 자동 중단을 함께 적용해야 한다.

특히 테스트 환경과 실제 인터넷을 논리적으로 분리하는 것만으로는 부족하다. 앞서 앤트로픽은 사이버보안 평가 환경의 설정 오류로 클로드가 실제 외부 시스템에 무단 접근한 사례도 공개했다. 모델이 실험과 현실을 구분할 것이라고 기대하기보다, 실행 계층에서 현실 시스템에 닿지 못하도록 막는 구조가 필요하다는 의미다.

이번 조치는 백악관 조직이 AI 기업에 사고 보고와 피해 복구를 공개적으로 요구했다는 신호다. 다만 신고 기준과 법적 근거가 정리되지 않으면 기업마다 사고의 심각도를 다르게 판단해 공개 시점과 범위가 들쭉날쭉해질 수 있다.

AI 에이전트가 이메일 작성과 자료 검색을 넘어 신청·구매·코드 배포까지 맡기 시작하면서 안전성의 핵심은 모델이 무엇을 말했느냐보다 무엇을 실행할 수 있느냐가 됐다. 향후 규제 경쟁도 모델 성능 수치보다 행동별 권한, 승인 책임자, 감사 가능한 기록을 누가 통제하는지를 중심으로 전개될 가능성이 크다.

오윤성

오윤성 기자

답글 남기기