일레븐 v4는 새로운 아키텍처를 기반으로 텍스트의 어조와 말의 속도, 인물 성격과 맥락 등을 분석해 다양한 감정을 음성으로 표현하는 것이 특징이다. 90개 이상의 언어를 지원하며 다자간 대화 생성과 화자별 음성 일관성도 이전 세대보다 강화했다.
사용자는 자연어를 통해 발화 방식을 지정할 수 있다. ‘[웃음]’, ‘[화난 듯 말함]’, ‘[빗소리]’ 등 태그를 활용해 감정이나 억양, 음향 효과도 설정할 수 있다. 장면 전체의 맥락과 앞선 발화를 반영해 다음 대사를 생성하는 기능도 적용됐다.
일레븐랩스는 특히 일본어와 중국어, 브라질 포르투갈어 등에서 성능이 크게 향상됐다고 설명했다. 하나의 음성이 가진 고유한 음높이와 음색을 유지하면서 다른 언어나 억양으로 변환하는 것도 가능하다.
실시간 AI 에이전트를 겨냥한 ‘일레븐 v4 터보’도 함께 공개했다. 일레븐 v4의 감정 표현 능력을 유지하면서 첫 응답 생성 과정의 중간 추론 지연 시간을 평균 100밀리초(ms) 수준으로 낮췄다. 고객 상담이나 의료 안내, 게임 등 빠른 상호작용이 필요한 음성 AI 서비스에 활용할 수 있다.
마티 스타니셰프스키 일레븐랩스 공동창립자 겸 CEO는 “일레븐 v4는 AI에 결여돼 있던 풍부하고 표현력 있는 커뮤니케이션 능력을 제공한다”며 “폭넓은 감정 표현과 문맥 인지 능력을 바탕으로 예술 창작과 에이전트 경험을 한 차원 높일 것”이라고 밝혔다.









