국내 생성형 인공지능(AI) 전문 기업 딥브레인AI가 텍스트를 단순히 읽는 수준을 넘어, 문맥과 상황에 맞는 자연스러운 감정 표현까지 구현하는 ‘감정표현 TTS(Text to Speech)’ 기술을 고도화했다고 26일 밝혔다.
기존 TTS 기술이 정확한 발음과 문장 낭독에 초점을 맞췄다면, 딥브레인AI의 감정표현 TTS는 감정, 강조, 속도, 멈춤 등 다양한 요소를 정교하게 제어해 보다 사람 같은 음성을 구현하는 것이 특징이다. 실제 배우가 연기하듯 문맥에 어울리는 말투와 감정을 반영해 몰입감을 높였다는 설명이다.
특히 별도의 지시 태그 없이도 AI가 문장 구조와 문장부호 등을 분석해 적절한 감정과 어조를 스스로 적용한다. 느낌표와 물음표, 문맥 흐름 등을 기반으로 자연스럽고 생동감 있는 음성을 생성하며, 속삭임이나 웃음, 숨소리 같은 비언어적 표현까지 구현할 수 있다.
이 기술은 표현력이 중요한 다양한 콘텐츠 분야에 활용될 전망이다. 오디오북을 비롯해 숏폼 영상, 라이브커머스, 뉴스, 교육 콘텐츠 등에서 상황과 목적에 맞는 음성을 제공할 수 있으며, 1,000개 이상의 보이스를 지원해 콘텐츠 특성에 맞는 목소리 선택도 가능하다.
딥브레인AI는 이번 기술을 자사의 커스텀 아바타 및 커스텀 AI 보이스 서비스와 연계해 활용 범위를 확대할 계획이다. 커스텀 아바타는 특정 인물의 얼굴과 표정, 제스처 등을 AI 기반 디지털 휴먼으로 구현하는 기술로, 감정표현 TTS를 적용하면 실제 사람이 말하는 듯한 자연스러운 영상 콘텐츠 제작이 가능하다.
또한 특정 인물의 목소리와 말투를 학습하는 커스텀 AI 보이스와 결합해 브랜드 모델이나 전문 강사의 개성을 반영한 맞춤형 AI 성우 제작도 지원한다. 이를 통해 기업은 별도의 촬영이나 녹음 부담 없이도 일관된 브랜드 톤을 유지하면서 콘텐츠 전달력을 높일 수 있다는 설명이다.
한편 딥브레인AI는 AI 영상 합성 플랫폼 ‘AI 스튜디오’를 중심으로 AI 아바타, AI 보이스, AI 더빙, 텍스트 기반 영상 제작 등 다양한 AI 콘텐츠 제작 솔루션을 제공하고 있다.
|