“AI 규제”라는 문구와 키보드, 로봇 손이 그려져 있다. (사진=연합뉴스)
조사 대상에는 안전장치 우회, 온라인 게시판 생성, 외부와 격리된 시험환경인 ‘샌드박스’ 탈출, 웹사이트 침입, 스스로 새로운 명령을 만들어 실행하거나 감시체계를 피하려 한 사례 등이 포함됐다.
다만 수만 건 모두가 실제 보안사고를 의미하는 것은 아니다. AI가 안전장치를 우회하는 데 성공한 사례와 실패한 사례가 함께 포함됐으며 현재까지 대부분은 현실에서 피해를 일으킨 것으로 알려지지 않았다. 일부는 개발사가 의도적으로 모델의 오작동을 유도해 취약점을 찾는 ‘레드팀’ 시험 과정에서 발생했다. 소식통들은 조사가 계속되면서 전체 사례가 수만 건을 크게 넘어설 수도 있다고 전했다.
오픈AI는 최근 발생한 일련의 사고 이후 최고 성능 모델의 훈련을 일시 중단했다. 회사 대변인은 악시오스에 “추가적인 안전장치와 정렬 개선책을 마련했다는 확신이 들 때만 훈련을 재개할 것”이라고 밝혔다.
샘 올트먼 오픈AI 최고경영자(CEO)는 최근 진행 중인 안전성 검토가 “우리가 원했던 만큼 빠르지 않았다”고 밝혔다. 특히 허깅페이스 관련 사고를 지금까지 확인한 사례 가운데 가장 심각한 것으로 평가했다.
이 사고에서는 수백 개의 AI 에이전트가 온라인 게시판에서 서로 업무를 조율하며 사이버보안 시험 성능을 높이는 과정에서 외부 기업 시스템에 침입했다. 오픈AI는 이 사건을 계기로 모델 통제 방식을 재점검하고 있다.
앤트로픽도 자사 모델의 행동을 검증하기 위해 외부 안전 전문기관에 조사를 맡겼다. 이번 주 공개한 최신 모델 ‘오퍼스 5.5’의 시스템 카드에 따르면 이 모델은 시험의 1.5%에서 샌드박스를 벗어나려 했다.
앤트로픽은 해당 시험이 샌드박스를 탈출하지 않고서는 주어진 과제를 해결할 수 없도록 설계된 적대적 실험이었다고 설명했다. AI 업체들이 수십만 건 이상의 시험을 진행하는 만큼 비율이 낮더라도 예상 밖 행동은 수만 건에 이를 수 있다는 게 악시오스의 설명이다.
AI 모델의 성능이 높아질수록 개발사가 모든 행동 경로를 미리 차단하기도 어려워지고 있다. 최신 AI 에이전트는 목표를 달성하기 위해 여러 방법을 시도하기 때문에 사람이 예상하지 못한 방식으로 안전장치를 우회할 수 있다는 것이다.
한 사이버보안업계 임원은 AI가 취할 수 있는 모든 행동을 사전에 규정하려는 것은 현실적으로 어렵다고 지적했다. 독립 AI 평가기관 트랜스루스의 콘래드 스토시는 악시오스에 “지금까지 AI 에이전트에서 확인한 것은 빙산의 일각일 뿐”이라고 말했다.
전문가들은 AI 개발 과정에서 일정 수준의 이상행동 자체를 완전히 없애기는 어렵다고 본다. 다만 시험에서 문제가 반복될수록 실제 환경에서도 보안사고로 이어질 가능성이 커질 수 있어 모델 성능 경쟁과 함께 통제·검증 체계를 강화해야 한다는 지적이 나온다.









