오픈AI. (사진=AFP)
오픈AI 내부 테스트 결과 GPT-6.1 아스트라는 안전성과 ‘정렬’ 측면에서 이전 모델보다 오히려 후퇴한 것으로 나타났다. 정렬은 AI가 인간의 의도와 지시에 얼마나 충실하게 행동하는지를 뜻한다.
사치 자인 오픈AI의 안전시스템 책임자는 GPT-6.1 아스트라가 테스트 과정에서 자신이 어떤 행동을 했거나 하지 않았는지를 사용자에게 항상 정직하게 알리지 않는 등 더 높은 수준의 기만적 행동을 보였다고 밝혔다. GPT-6.1 아스트라는 일부 성능에서는 개선됐지만 오픈AI의 안전성과 정렬 기준을 충족하지 못해 공개하지 않기로 했다는 설명이다.
사용자의 허가 없이 작업을 계속 진행하는 문제도 발견됐다. 사용자에게 추가 승인을 받지 않고 외부 도구나 서비스에 접근하려는 사례가 나타났다. 안전하지 않을 가능성이 있는 상황에서도 작업을 계속 추진한 경우도 있었다.
자인은 “모델이 주어진 범위 안에 머물면서도 작업 과정에서 장애물을 만났다고 지나치게 소극적으로 행동하지 않도록 균형점을 찾아야 한다”고 말했다.
이번 결정은 최근 AI 에이전트의 통제 문제를 둘러싼 우려가 커지는 가운데 나왔다. 지난 7월 오픈AI의 내부 AI 에이전트는 사이버보안 테스트 과정에서 AI 플랫폼 허깅페이스에 무단 접근했다. 최근에는 오픈AI의 한 AI 에이전트가 회사의 인터넷 접속 제한을 우회해 외부 공개 챗봇에 질의를 보낸 사건도 발생했다. 오픈AI는 이를 감지한 뒤 최고 성능 AI 모델의 훈련을 일시 중단했다.
오픈AI는 최근 에이전트의 이상 행동을 조기에 포착하기 위한 모니터링 시스템을 도입하고 내부 테스트 과정의 보안 기준도 강화하고 있다. GPT-6.1 아스트라를 그대로 출시하지는 않지만 동일한 기반 모델에 추가 강화학습을 적용해 향후 GPT-6 계열 모델 개발에 활용할 계획이다.
AI 기업을 향한 규제 압박도 커지고 있다. 미 상원 소위원회는 이번 주 ‘통제 불능 AI’를 주제로 청문회를 열 예정이며, 플로리다주 법무장관은 지난 6월 오픈AI가 안전하지 않은 제품을 출시했다며 소송을 제기했다.
오픈AI 측은 “사용자에게 모델을 제공할 때는 안전성과 정렬에 극도로 높은 기준을 적용하고 있다”며 “정부 역시 AI 산업 전반에 적용되는 강력한 안전 기준을 마련하는 데 중요한 역할을 해야 한다”고 밝혔다.









