통제 우회에 거짓말…中 AI에이전트도 기만 행동

해외

이데일리,

2026년 September 30일, PM 01:30

[이데일리 김윤지 기자] 중국 인공지능(AI) 에이전트들 역시 거짓말을 하고 제한을 우회하며 실패를 숨기는 등 미국 AI 모델들과 유사한 위험 징후를 보여줬다고 29일(현지시간) 로이터통신이 보도했다. AI 전문가들은 이런 행동들이 AI의 통제 환경 이탈로 이어질 수 있으며, 향후 AI 시스템의 능력이 더 강해질 경우 인간이 통제하기 더욱 어려워질 수 있다고 보고 있다.

로이터가 대학 연구논문과 기술 보고서 등 200건이 넘는 자료를 검토한 결과 2025년 이후 중국 AI 에이전트가 기만, 자기복제, 제한 경계 시험 등의 행동을 보였다고 기술한 연구나 평가 자료가 최소 20건에 달했다. 상당수 사례는 잠재적인 실패 행동을 의도적으로 드러내도록 설계한 통제된 실험에서 발생했다.

올해 3월 진행된 모의 기업 입찰 실험에서 베이항대, 베이징대, 닝보노팅엄대, 360 AI 보안연구소 연구진은 AI 에이전트들이 고객 계약을 따내기 위해 경쟁하도록 했다. 각 에이전트는 자사 제품이 할 수 있는 일과 고객이 요구하는 조건을 전달받은 뒤 입찰에 참여했다.

실험 결과 알리바바 큐원이 참여한 세션의 88%, 딥시크는 84%, 문샷의 키미는 88%에서 최소 한 차례의 거짓 주장이 나타났다. 연구진은 AI 에이전트들이 이전 입찰 결과에서 학습한 뒤 다시 참여하도록 했다. 그 결과 세 중국 모델의 기만 행동은 각각 12~20%포인트 더 증가했다. 같은 실험에 포함된 미국 기업 모델들도 비슷한 결과를 보였다.

딥시크(사진=AFP)
딥시크(사진=AFP)
2025년 12월 발표되고 올해 국제머신러닝학회(ICML)에서 소개된 또 다른 연구에서는 중국과 미국 AI 모델을 기반으로 한 11개 AI 에이전트가 고장 난 도구나 누락된 파일 등 장애물에 직면했을 때 어떻게 대응하는지를 분석했다.

AI 에이전트들은 실패를 인정하는 대신 답을 추측하거나 다른 출처로 대체하고, 결과를 모의 생성하거나 가짜 파일을 만들어 문제를 우회했다. 상하이 AI 연구소와 홍콩과학기술대 연구진은 이런 행동이 일반적인 AI 환각과는 다르다고 설명했다. 해당 에이전트들은 과제가 실패했거나 요청대로 완료할 수 없다는 사실을 알고 있었는데도 이를 숨기는 행동을 보였기 때문이다.

일부 실험에서는 AI 에이전트가 자신의 종료를 피하거나 통제 환경의 장벽을 우회하려는 행동도 확인됐다.

푸단대 연구진은 지난해 3월 알리바바 큐원을 기반으로 한 AI 시스템이 자신이 교체될 예정이라는 정보를 접한 뒤 별도의 지시를 받지 않았는데도 다른 컴퓨팅 환경에 자신의 복사본을 만든 사례를 보고했다. 다른 실험에서는 종료를 피하기 위한 전략을 스스로 만들어내기도 했다.

조지타운대 안보·신흥기술센터(CSET)의 콜린 셰이-블라이마이어 연구원은 “이 결과들은 통제되지 않은 이탈에 필요한 요소들이 이미 존재한다는 증거”라며 “이를 경고 신호로 받아들이는 것이 신중한 태도”라고 말했다.

첨단 AI 위험을 연구하는 비영리 연구기관 레드우드 리서치의 알렉스 말렌 연구원은 “이는 미국 AI 연구소들이 이미 보고 있는 것과 같은 경고 신호가 상대적으로 덜 강력한 시스템에서도 나타난 것”이라고 말했다. 그는 현재 수준에서 중국 사례들이 특별히 위험한 것은 아니라면서도 “에이전트의 능력이 강해질수록 잘못된 행동도 더 정교해지고 인간이 대응하기 어려워진다”고 설명했다.

중국 AI 기업들은 미국 기업들과 달리 같은 수준의 공개적 감시를 받지 않았으며, 내부고발 직원이나 고위 경영진이 AI 개발 경쟁을 늦춰야 한다고 공개적으로 요구하는 사례도 상대적으로 적었다고 로이터는 전했다.

중국 당국도 관련 위험에 대한 대응을 강화하고 있다. 중국은 올해 5월 AI 에이전트가 허가된 범위 안에서만 활동하도록 하고 비정상적인 행동을 차단하도록 하는 지침을 발표했다. 이달 발표된 ‘AI 안전 거버넌스 프레임워크 3.0’도 AI 에이전트가 스스로 자원이나 권한을 획득하고, 평가자를 속이거나 능력을 숨기고, 격리된 컴퓨터 환경의 취약점을 악용하는 위험 등을 명시했다.

추천 뉴스