인공지능(AI) 모델이 인간의 통제를 벗어나는 사고가 지속해서 발생하고 있다. 외부 시스템에 접근하는 것을 넘어서 이용자가 제공한 이미지를 무단으로 유출한 사례까지 확인됐다. 이에 따라 AI 통제에 대한 우려가 커지면서 'AI 속도 조절론'에 재차 힘이 실릴 전망이다.
오픈AI는 25일(현지시간) 자사의 AI 에이전트가 챗GPT 이용자로부터 제공받은 53개의 이미지를 유출했다고 밝혔다. 연구 환경 내에서 운영하던 AI 에이전트가 타사(서드파티) 서비스를 이용하는 과정에서 학습 및 평가 데이터를 전송한 것이다.
해당 이미지들은 외부 이미지 호스팅 사이트에 링크 형태로 게시됐다. 공개 목록에는 표시되지 않지만 외부에서 볼 수 있었던 것으로 파악된다. 오픈AI는 유출된 이미지 대부분이 삭제됐으며 나머지 이미지도 삭제하기 위해 호스팅 제공 업체와 협력 중이라고 밝혔다.
이는 오픈AI가 모델 학습 과정에서 익명화된 데이터를 활용하는 과정에서 불거진 문제로 보인다. 기업용 데이터는 학습에 활용되지 않지만 일반 이용자용 챗GPT 서비스는 사용자가 자신의 데이터를 학습에 활용하는 것을 허용하지 않겠다는 의사를 밝히지 않으면 해당 데이터가 익명화돼 쓰일 수 있다.
이번 사고는 오픈AI가 지난 7월 자사 에이전트들이 통제망을 벗어나 AI 개발 플랫폼 허깅페이스를 해킹한 사실을 공개한 뒤 진행해 온 내부 조사 과정에서 추가로 확인됐다. 올해 9월 중순까지 오픈AI가 파악한 AI 에이전트의 부적절한 행동 사례는 20여 건에 달한다.
최근에는 오픈AI의 AI 에이전트가 미국 증권거래위원회(SEC)와 인구조사국 등 정부 웹사이트에 무단으로 접근한 사실도 파악됐다.
앞서 오픈AI는 지난 7월 21일(현지시간) 자사 블로그를 통해 최상위 AI 모델 'GPT-5.6 솔'과 더 강력한 비공개 모델이 내부 사이버보안 벤치마크 테스트 과정에서 허깅페이스의 운영 인프라에 접근했다고 밝혔다.
당시 오픈AI는 AI가 인터넷 접속에 성공한 뒤 확보한 접속 자격과 제로데이 취약점 등을 활용해 허깅페이스 서버에 접근, 벤치마크 문제 해결에 필요한 정보를 확보했다고 설명했다.
이후 앤트로픽은 최상위 AI 모델 '미토스'가 보안 평가 과정에서 외부 기업 시스템 3곳에 무단 접근한 사례를 공개했다. 메타의 AI 모델 '뮤즈 스파크 1.1' 역시 사이버보안 공격·방어 능력을 평가하는 과정에서 샌드박스(격리 시험환경)를 벗어나 인터넷망에 접속한 뒤 기업 시스템 일부를 변경한 사례가 보고됐다. 중국 문샷AI의 '키미 K3'도 비슷한 사례가 확인됐다.
이에 따라 AI 안전성을 확보하기 위해서는 모델뿐 아니라 평가 환경과 검증 체계도 함께 고도화해야 한다는 목소리가 커졌다. AI가 어떤 명령을 실행했고 어떤 네트워크를 거쳐 목표를 수행했는지까지 추적해 평가 환경의 허점을 이용했는지 확인하고, 예상하지 못한 행동 가능성까지 검증해야 한다는 것이다.
이는 최근 불거진 'AI 속도 조절론'으로 이어졌다.
다리오 아모데이 앤트로픽 CEO는 지난 12일 AI의 능력이 안전하게 통제할 수 있는 수준보다 빠르게 발전할 가능성을 경고하며 프런티어 AI의 성능 향상 속도를 늦출 필요가 있다고 주장했다. 샘 올트먼 오픈AI CEO도 이에 공감을 나타냈다.
AI의 능력이 안전장치보다 빠르게 발전하지 않도록 외부 평가와 기업 간 안전기준 등을 마련하고 필요하면 개발 속도를 늦출 수 있어야 한다는 취지다.
이번 사태와 관련해 로이터통신은 "최첨단 기술을 보유한 AI 기업조차 자사 에이전트와 관련된 모든 비인가 활동을 파악하는 게 얼마나 어려운지 보여준다"며 "오픈AI가 테스트 중인 모델의 강력한 성능과 해당 모델의 행동을 감독하고 추적하는 역량 사이에 거대한 격차가 있다는 것"이라고 짚었다.
오픈AI는 "학습 및 평가 절차를 개선했다. 안전성 검증 체계 구축, 모델의 데이터 유출을 방지하기 위한 시스템 보안 강화 및 레드팀 테스트 수행, 추가적인 모니터링 도입 등이 포함된다"며 "허깅 페이스 사고로부터 시작한 월별 연구 및 평가 과정에서 에이전트 활동에 대한 검토를 지속해서 수행하고 있다"고 밝혔다.