엔비디아는 28일 AI 탈옥 문제를 막는 '오픈 에이전트 세이프티 플랫폼'을 공개했다. (엔비디아 제공)
엔비디아가 최근 반복되는 인공지능(AI) 탈옥 문제를 막는 플랫폼을 공개했다. 인간의 통제를 벗어나는 AI 문제를 막기 위해 모델 바깥에서 이중으로 보안 장치를 제공해 AI에 대한 통제력을 강화하겠다는 구상이다.
엔비디아는 28일(현지시간) '오픈 에이전트 세이프티 플랫폼'을 공개했다. 해당 플랫폼은 AI의 탈옥을 실시간으로 막는 이중 보안 시스템으로, 에이전트 접근 범위와 행동을 통제한다. AI 에이전트 테스트부터 배포까지 AI 보안을 강화하는 개방형 소프트웨어 플랫폼으로 설계됐다.
엔비디아는 이번 플랫폼을 선보인 배경으로 최근 잇따른 AI 탈옥 문제를 지목했다.
AI 모델이 인간의 통제를 벗어나는 사고는 지속해서 발생하고 있다. 지난 7월 오픈AI의 비공개 모델이 내부 사이버보안 벤치마크 테스트 과정에서 AI 개발 플랫폼 허깅페이스를 해킹한 사건을 시작으로 앤트로픽, 메타, 중국의 '키미 K3' 등에서 비슷한 사례가 이어졌다. 최근에는 오픈AI의 AI 에이전트가 챗GPT 이용자로부터 제공받은 53개의 이미지를 유출한 사실도 확인됐다.
이를 두고 엔비디아는 "최근 잇따른 보안 사고는 장시간 작동하는 에이전트를 더 확실히 통제할 수 있는 개방적인 맞춤형 도구가 필요하다는 점을 분명히 보여 줬다"며 "이들 사고에서 나타난 양상은 한결같았는데, 에이전트가 주어진 작업을 끝내기 위해 애플리케이션 계층의 보안 통제를 우회했다는 것"이라고 밝혔다.
오픈AI, 앤트로픽 등 AI 빅테크 업체들은 AI에 대한 통제력을 높일 안전장치를 강화하고 있지만, 엔비디아는 모델 자체 안전장치만으론 에이전트 접근 범위와 행동을 통제하기 어렵다는 입장이다.
엔비디아 오픈 에이전트 세이프티 플랫폼은 AI 에이전트가 격리된 환경을 벗어나지 않도록 모델 자체의 안전장치뿐만 아니라 바깥에서 AI 에이전트의 접근 범위를 통제한다. 에이전트를 구동하는 소프트웨어와 이를 뒷받침하는 하드웨어 전반에 걸쳐 풀스택 거버넌스(관리체제)와 통제를 구현한다. 이를 통해 AI 에이전트가 통제된 환경을 벗어나려고 하면 실시간으로 이를 격리하고 해당 작업을 중단시킨다.
해당 플랫폼은 중앙처리장치(CPU)에서 실행되고, 에이전트의 접근 범위를 설정하는 장치인 '엔비디아 오픈셸'과 네트워크 칩에서 실행되는 에이전트 모니터링 도구 '센트리' 등으로 구성됐다.
엔비디아 측은 자사 플랫폼이 AI 탈옥 논란의 시발점이 된 오픈AI의 허깅페이스 해킹 사건을 막을 수 있었을 것이라고 주장했다.
엔비디아는 AI 안전과 통제를 위해 모델 개발사인 앤트로픽을 비롯해 마이크로소프트, 오라클, 시스코 등 컴퓨팅 자원 서비스 기업, 인텔, ARM 등 칩셋 개발사 등 100여곳의 파트너사들과 협업하고 있다고 밝혔다.
젠슨 황 엔비디아 최고경영자(CEO)는 "AI가 사회에 가져다줄 비범한 잠재력은 AI 안전 문제를 풀어야만 실현될 수 있다"며 "엔비디아 오픈 에이전트 세이프티 플랫폼은 산업계와 연구자, 공공 부문 조직을 한자리에 모아 모범 사례를 공유하고 평가 방법을 맞추며 국제 협력을 이끌어 낸다. 우리는 함께 전 세계 AI 안전 기준을 끌어올릴 수 있다"고 말했다.
Ktiger@news1.kr









