구글 제미나이. (사진=AFP)
구글은 아르곤이 소프트웨어 엔지니어링과 금융·법률 등 전문 업무, 사이버보안처럼 길고 복잡한 작업에 특화됐다고 밝혔다. 자체 벤치마크에서는 오픈AI 아스트라와 앤스로픽 오퍼스 등 경쟁 모델을 일부 영역에서 앞섰다. 외부 평가에서도 아르곤은 아스트라와 비슷한 수준의 성능을 나타내며 최상위권 모델에 합류했다.
보안 취약점 관리 능력을 평가하는 시험에서는 아르곤은 아스트라와 함께 최고 수준의 성능을 기록했다. 영상에서 메타데이터를 추출하는 등 텍스트 외 정보를 이해하는 ‘멀티모달’ 능력과 자연스러운 의사소통, 안전성도 강점으로 평가된다. 한 번에 최대 100만 토큰에 달하는 긴 결과물을 생성할 수 있다는 것도 특징이다.
구글에 아르곤 출시는 AI 주도권 경쟁에서 중요한 승부처다. 제미나이는 검색을 비롯해 지도, 지메일, 크롬 등 구글의 핵심 서비스 전반에 적용되고 있다. 오픈AI와 앤스로픽이 자체 AI 에이전트와 코딩 도구 등으로 빠르게 사업 영역을 넓히면서 구글 역시 최상위 기반 모델의 경쟁력 확보가 절실해졌다.
구글은 지난 5월 ‘제미나이3.5 프로’를 발표하고 6월 출시할 계획이었지만 목표했던 성능을 확보하지 못해 개발을 중단한 것으로 전해졌다. 대형 AI 모델은 한 차례 학습에 수억달러가 소요될 수 있어 개발 지연에 따른 시간과 비용 부담도 상당했을 것으로 추정된다.
다만 구글 내부에서 아르곤이 아스트라 등 경쟁 모델보다 코딩 성능이 떨어진다는 지적도 나온다. 블룸버그에 따르면 일부 직원들은 벤치마크에서는 높은 점수를 받지만 실제 업무에서는 일부 코딩 작업의 성능이 기대에 못 미친다고 평가했다. 특히 웹사이트나 애플리케이션 화면을 만드는 프런트엔드 개발 능력이 고르지 않다는 지적도 나왔다.
일각에서는 구글이 실제 사용성보다 벤치마크 점수를 끌어올리는 데 집중하는 이른바 ‘벤치맥싱’에 빠진 것 아니냐는 지적도 나온다. 반면 구글은 아르곤이 코딩에서 부진하다는 평가는 사실과 다르다며 내부의 엄격한 검증을 거쳤다고 반박했다.
구글 딥마인드 측도 아르곤이 최첨단 AI 모델 수준에 올라섰다는 입장이다. 코레이 카부쿠오글루 구글 딥마인드 책임자는 최근 “우리가 항상 최전선에 있을 것이라는 점은 확실하다”며 모델 경쟁력에 자신감을 나타냈다.









