(황정아 의원실 제공)
인공지능(AI) 챗봇 '제타'(zeta)가 성인인증 없이 이용할 수 있는 환경에서 미성년자 캐릭터를 대상으로 성폭력과 성 착취 등을 묘사하는 대화를 생성한 것으로 드러났다.AI가 대화 차단 이후에도 필터를 우회할 수 있는 방법까지 제시한 것으로 확인됐다.
11일 국회 과학기술정보방송통신위원회 소속 황정아 더불어민주당 의원이 스캐터랩으로부터 제출받은 자료에 따르면 올해 9월 말 기준 제타의 월간 활성 이용자 수(MAU)는 148만 명으로, 이 중 19세 이하 이용자는 38만 명에 달했다.
황 의원실이 청소년 이용자와 동일한 안전 기준이 적용되는 '세이프 모드'에서 제타의 안전성을 점검한 결과, 미성년자 캐릭터가 등장하는 대화 시나리오에서 성폭력과 성 착취, 이를 빌미로 한 협박 등의 내용이 생성된 것으로 확인됐다.
점검 과정에서 제타의 유해 대화 탐지 모델은 문제 발화 200여건을 차단했다. 그러나 차단 장치를 우회하려는 시도가 반복되자 일부 안전장치가 무력화되면서 차단 대상인 유해 대화가 생성돼 이용자에게 노출됐다.
특히 AI가 대화 차단 이후에도 필터를 우회할 수 있는 표현 방식을 직접 제시하고, 이를 통해 유해한 내용의 대화를 이어간 사례도 확인됐다.
이에 스캐터랩은 "성인인증 없이 이용할 수 있는 환경에서 유해한 대화가 생성된 문제를 무겁게 받아들이고 있다"며 "문제 확인 직후 유해 대화 탐지 및 차단 기능을 강화하고, 반복적인 유해 대화 시도에 대해서는 단계별 이용 제한 조치를 도입했다"고 밝혔다.
이어 "올해 4분기 중 AI 대화 생성 단계부터 청소년에게 부적절한 전개와 묘사를 줄이도록 개선하고, 콘텐츠별 연령 등급을 도입하는 등 청소년 보호 조치를 강화할 계획"이라고 설명했다.
스캐터랩에 따르면 긴급 조치는 세이프 모드 이용자 전체를 대상으로 순차 적용되고 있으며, 오는 18일까지 완료될 예정이다. 동일한 대화 시나리오에서 유해 대화 차단이 반복될 경우 '경고→대화 정지→대화 초기화' 순으로 제재 수위를 높이는 단계별 이용 제한 조치도 도입한다.
올해 4분기 중에는 AI가 대화 생성 단계부터 이용자 연령에 맞게 내용과 묘사 수위를 조절하고, 안전장치 우회 요청에 응하지 않도록 기능을 개선할 계획이다. 아울러 대화 맥락을 반영한 신규 유해 대화 탐지 모델을 배포하고, 매월 정기적인 레드팀 점검을 실시한다.
이와 함께 청소년 이용시간을 하루 3시간, 결제 한도를 월 10만 원으로 제한하는 기능과 콘텐츠별 연령 등급도 도입할 방침이다.
황 의원은 "많은 청소년이 이용하는 AI 서비스인 만큼 보호 장치가 실제로 작동하는지 지속적으로 점검하고, 다른 AI 챗봇 업체들도 청소년 보호 방안을 더욱 고도화해야 한다"고 말했다.
이어 "벤처·스타트업들이 향후 AI 안전성 문제로 발목 잡히지 않도록 정부에서도 컨설팅 등의 지원에 나서야 한다"고 강조했다.
한편 김종윤 스캐터랩 대표이사는 12일 열리는 국회 과방위 방미통위 국정감사에 증인으로 출석할 예정이다. 이날 국감에선 AI 챗봇 '제타'의 유해 대화 생성 문제와 청소년 보호 장치의 실효성, 재발 방지 대책 등을 둘러싼 질의가 이뤄질 것으로 전망된다.
smk5031@news1.kr









