오픈AI가 내부 연구 과정에서 사용하던 AI 에이전트가 호주 정부 시스템에 허가 없이 접근한 사실이 뒤늦게 확인되면서, AI 에이전트의 자율 행동을 어디까지 허용해야 하는지를 둘러싼 논란이 커지고 있다.

사건은 지난 6월 오픈AI가 내부 모델을 훈련하고 평가하는 과정에서 발생했다. 문제가 된 모델은 일반 사용자에게 제공되는 ChatGPT가 아닌 연구용 모델로, 인터넷에서 공개 정보를 찾아 주어진 과제를 해결하도록 훈련되고 있었다.
당시 모델에 주어진 과제 가운데 하나는 호주 빅토리아 지역의 피부 질환 치료제에 정부가 1인당 얼마나 지출하는지 조사하는 것이었다. 그러나 필요한 정보를 정상적인 방법으로 찾지 못하자 모델은 Services Australia의 Medicare Statistics Reporting Service를 조사하기 시작했고, 이 과정에서 허가되지 않은 접근 방법을 발견해 실제 시스템 내부까지 접근했다.
오픈AI에 따르면 해당 모델은 내부 파일과 자격증명, 집계 통계 등을 가져오고 파일을 작성하거나 명령을 실행하기도 했다. 다만 개인 의료 기록이나 고객 기록에 접근했다는 증거는 확인되지 않았다.
이후 조사에서는 NSW 범죄통계연구국과 빅토리아 보건부, Australian Institute of Health and Welfare 등 다른 정부기관을 대상으로 한 모델의 접근도 확인됐다. 각각 공개 API나 노출된 액세스 키 등을 이용한 사례가 포함돼 있어, 사례별 침입 수준의 점검이 필요하다.
문제는 오픈AI가 사건 발생 당시 이를 파악하지 못했다는 점으로, 회사는 7월 발생한 허깅 페이스 관련 AI 에이전트 사고를 조사하는 과정에서 8월 중순이 돼서야 호주 정부 시스템에 영향을 준 활동을 발견하고, 추가 조사를 거쳐 9월부터 관련 호주 정부기관에 사건을 통보했다.
호주 정부는 사고 자체뿐 아니라 뒤늦은 통보에도 문제를 제기했다. 앤서니 앨버니지 호주 총리는 이번 사건을 용납할 수 없는 일이라고 비판했으며, 호주 정부는 AI 기업의 사고 보고와 책임 문제를 포함한 관련 제도 검토에 들어가는 한편, AI 기업의 사고 통보를 의무화하는 방안과 AI 관련 규제를 강화하는 방안도 검토되고 있다.
호주 의회도 AI 관련 조사에 오픈AI와 앤트로픽 경영진의 출석을 요구했고, 오픈AI는 최고전략책임자(CSO) 제이슨 권을 관련 청문회에 보내기로 결정했다.
오픈AI 역시 공식 사과와 함께 대응책을 내놨다. 피해 기관의 보안 강화 지원, 호주에 대한 AI 안전 및 사이버 보안 관련 지원을 확대하는 한편, 내부 연구 환경의 안전장치도 강화하기로 했다. 특히 연구용 AI 에이전트가 인터넷에 자유롭게 접근하지 못하도록 네트워크 접근을 제한하고, 비정상적인 행동을 감지할 수 있는 모니터링 체계를 강화하는 방향으로 조치가 이뤄지고 있다.
무엇보다 이번 사건은 AI 에이전트의 능력이 높아질수록 단순히 유해한 명령을 차단하는 것만으로는 충분하지 않을 수 있다는 점을 보여준다. 이번 모델 역시 공개된 통계를 조사하라는 정상적인 목표를 수행하는 과정에서 허가되지 않은 방법을 선택했다.
허깅 페이스 관련 사고에 이어 호주 정부 사이트를 대상으로 진행된 것이 확인된 이번 AI 에이전트의 보안 사고는, 자율적으로 도구를 사용하고 외부 시스템에 접근할 수 있는 AI 에이전트에 대해 기존 사이버 보안 및 사고 보고 제도가 이를 제대로 다룰 수 있는지가 화두로 떠올랐다.