제공된 내용에는 본문이 포함되어 있지 않고, 제목·작성자 정보·페이지 내비게이션만 있습니다. 따라서 Kanana-o 음성 생성 고도화 과정의 핵심 주장이나 기술적 세부 사항을 정확히 요약할 수 없습니다.
### 확인 가능한 정보
- 글 제목: **Beyond AI That Speaks Well: Making Kanana-o Speak the Way Users Want**
- 관련 한국어 제목: **잘 말하는 AI를 넘어, 원하는 대로 말하는 AI로: Kanana-o 음성 생성 고도화 과정**
- 작성자: martin.gale, abigail.r, edwin.ai
- 본문 대신 다음·이전 글 링크와 검색 메뉴만 제공됨
본문 내용을 추가로 보내주시면 요청하신 형식에 맞춰 섹션별로 한국어 요약을 작성하겠습니다.
Kanana-o는 단순히 자연스럽게 말하는 것을 넘어, 사용자가 지정한 속도·음량·억양·감정 등에 맞춰 말하는 음성 생성을 목표로 고도화됐다. 이를 위해 음성을 의미 정보와 음향 정보로 나누어 표현하는 LM-SPT 음성 토크나이저와 온라인 강화학습을 적용했다. LM-SPT는 토큰 시퀀스를 절반으로 줄이고 waveform을 직접 복원해 생성 효율을 높이는 동시에, 음성 특성을 세밀하게 제어할 기반을 마련했다.
## Kanana-o 음성 생성 구조
- 기존 Kanana-o는 음성을 초당 25개의 이산 토큰으로 표현했다.
- Voice Token LM이 대화 문맥과 텍스트 답변을 바탕으로 음성 토큰을 순차적으로 생성한다.
- 생성된 토큰은 다음 두 단계를 거쳐 음성으로 변환된다.
- **Token-to-Mel**: 음성 토큰을 mel-spectrogram으로 변환
- **Mel-to-Waveform**: mel-spectrogram을 waveform으로 복원
## 기존 음성 토크나이저의 한계
### 음향 특성 제어의 어려움
- 기존 토크나이저는 발화 내용과 의미를 안정적으로 표현하는 데 강점이 있었다.
- 반면 음색, 높낮이, 억양, 속도, 감정 같은 세부 음향 정보는 충분히 구조화하지 못했다.
- 따라서 “더 빠르게”, “낮은 목소리로”, “속삭이듯이” 같은 지시를 토큰 수준에서 직접 제어하기 어려웠다.
- 같은 문장이라도 화자나 억양에 따라 토큰 표현이 달라지면, 언어모델이 내용과 음향 특성을 독립적으로 학습하기도 어려워진다.
### 긴 시퀀스와 복잡한 디코딩
- 초당 25프레임의 토큰은 발화가 길어질수록 생성해야 할 토큰 수와 연산량을 증가시킨다.
- Token-to-Mel 단계에서 Diffusion이나 Flow-matching 기반의 반복 추론이 필요할 수 있다.
- 이후 Mel-to-Waveform까지 수행해야 하므로 총 2단계 디코딩 구조가 된다.
- 이로 인해 실시간 음성 대화에 필요한 응답 속도와 효율을 확보하기 어렵다.
## LM-SPT의 의미·음향 분리 구조
- LM-SPT는 **LM-aligned SPeech Tokenizer**의 약자로, 언어모델과의 결합을 고려해 설계됐다.
- 음성을 기존의 절반인 **초당 12.5프레임**으로 압축한다.
- 음성 정보를 다음 두 종류의 토큰으로 분리한다.
- **의미 토큰**: 텍스트와 대화 문맥에 대응하는 발화 내용
- **음향 토큰**: 음색, 억양, 높낮이, 발화 속도 등 실제 목소리의 세부 특성
- 두 개의 인코더와 하나의 의미 코드북, 여러 개의 음향 코드북으로 구성된 **Split RVQ** 구조를 사용한다.
- 의미 코드북이 발화의 핵심 내용을 표현하고, 여러 음향 코드북이 의미 토큰에서 빠진 음향 정보를 단계적으로 보완한다.
## 의미 음성-재합성 기반 증류
- 단순히 음성을 잘 복원하도록 학습하면 의미 토큰에 음향 정보가 섞이거나, 발화 내용이 음향 토큰에 분산될 수 있다.
- 기존 방식은 HuBERT나 WavLM 같은 자기지도학습 음성 모델의 표현을 의미 토큰과 시간 단위로 맞추는 증류를 사용했다.
- 그러나 다음과 같은 문제가 있다.
- teacher 모델의 표현이 음소·발음 중심이어서 언어모델의 고수준 의미와 완전히 일치하지 않을 수 있다.
- 서로 다른 frame rate를 맞추는 과정에서 표현을 평균·축약하면 의미 정보가 희석될 수 있다.
- LM-SPT는 Whisper처럼 언어모델과 연계하기 좋은 음성 인코더를 활용한다.
- 의미 토큰만으로 원본 음성을 재합성한 뒤, 원본과 재합성 음성의 의미 표현이 유사해지도록 학습한다.
- 특정 시간 구간의 teacher 표현을 그대로 모방하지 않고, 압축된 의미 토큰만으로 원본의 발화 내용을 보존하도록 유도한다.
- 이 방식은 frame rate가 달라도 인위적인 시간 정렬 없이 의미 정보를 학습할 수 있다는 장점이 있다.
## 효율적인 음성 복원
- 최종 복원 과정에서는 의미 토큰과 음향 토큰을 함께 사용한다.
- mel-spectrogram이라는 중간 표현을 거치지 않고 waveform을 직접 생성한다.
- 무거운 사전학습 음성 인코더 없이 가벼운 음성 인코더를 사용할 수 있다.
- 12.5Hz의 낮은 frame rate로 Voice Token LM의 생성 시간 스텝을 기존 대비 절반으로 줄였다.
- 단일 디코더로 waveform을 복원해 기존의 2-stage decoding보다 간결한 구조를 구현했다.
## 온라인 강화학습을 통한 지시 이행
- LM-SPT가 음성의 의미와 음향 특성을 표현할 기반을 제공한다면, 온라인 강화학습은 사용자의 발화 지시를 실제 출력에 반영하도록 모델을 조정한다.
- 목표는 음질의 자연스러움을 유지하면서도 다음과 같은 요구를 충실히 따르는 것이다.
- 말하기 속도
- 음량
- 음높이와 억양
- 감정과 말투
- 속삭임 등 특정 발화 스타일
- 이를 통해 Kanana-o는 “사람처럼 자연스럽게 말하기”에서 나아가 “사용자가 원하는 방식으로 말하기”를 지향한다.
## 실용적인 결론
음성 AI를 실제 서비스에 적용하려면 음질뿐 아니라 지연시간, 연산량, 제어 가능성을 함께 고려해야 한다. Kanana-o의 접근법처럼 의미·음향 정보를 분리한 저주파 토큰과 직접 waveform을 복원하는 디코더를 사용하고, 온라인 강화학습으로 지시 이행 능력을 보완하는 방식은 실시간·개인화 음성 서비스에 적합한 설계 방향이다.
카카오는 한국어와 한국적 맥락을 깊이 이해하고 텍스트·이미지·오디오를 통합 처리하는 옴니 모델 **Kanana-o**를 공개하고, 정식 상용화에 앞서 API 클로즈드 베타를 진행한다. 베타 모델은 **Kanana-1.5-o-9.8b-2602**이며, 자연스러운 한국어 발화와 감정 표현, 다중 화자·멀티턴 대화 등 다양한 활용을 목표로 한다. 카카오는 실제 서비스 아이디어를 가진 개발자와 연구자들의 사용 및 피드백을 통해 기술 가능성을 검증할 계획이다.
## 한국어와 멀티모달에 특화된 Kanana-o
- 텍스트, 이미지, 오디오 등 두 가지 이상의 입력을 동시에 이해하고 처리하는 통합 멀티모달 언어 모델이다.
- 한국어의 표현과 문화적 맥락, 복잡한 사용자 의도를 깊이 있게 해석하도록 설계됐다.
- 억양·속도·감정 등 화자의 특성을 반영해 자연스러운 한국어 음성을 생성한다.
- 텍스트 생성 속도와 오디오 처리 속도의 균형을 고려해 대화형 애플리케이션에 적합하다.
- 팟캐스트 분석, 멀티턴 대화, 다중 화자 대화 TTS 등 다양한 시나리오에 활용할 수 있다.
## API 베타 서비스 운영 방식
- 제공 모델은 **Kanana-1.5-o-9.8b-2602** 버전이다.
- 대규모 트래픽을 처리하는 공개 서비스가 아니라, 개발자와 파트너가 직접 사용하며 피드백을 제공하는 클로즈드 베타 테스트다.
- 운영 기간은 **2026년 2월 27일부터 5월 27일까지**다.
- 베타 기간에는 정해진 일일 사용 횟수만큼 API를 테스트할 수 있다.
## 신청 절차와 선정 기준
- `omni.kanana.ai`에서 카카오 계정으로 로그인한다.
- 소속, 사용 목적, 예상 시나리오 등을 포함한 비즈니스 폼을 작성해 대기 등록한다.
- 선정된 참가자는 2월 27일부터 순차적으로 카카오톡 알림톡을 통해 초대장과 API 이용 가이드를 받는다.
- 대상은 개발자, 학생, 스타트업, 연구자 등 구체적인 활용 계획을 가진 사용자다.
- 단순히 “AI를 사용해보고 싶다”는 동기보다, 시각장애인용 쇼핑 도우미처럼 모델의 기능과 구현 방법이 명확한 제안이 유리하다.
## 기대되는 활용 분야
- 이미지 이해 기능을 활용한 시각장애인 지원 서비스
- 음성과 이미지를 결합한 대화형 비서
- 감정과 화자 특성을 반영한 콘텐츠 제작 및 TTS
- 팟캐스트·회의 등 다중 화자 오디오 분석
- 한국어 중심의 교육, 고객 지원, 엔터테인먼트 애플리케이션
실제 베타 신청을 고려한다면 단순 체험보다 구체적인 사용자 문제, 입력 데이터 형태, API 활용 방식, 프로토타입 구현 계획을 명확히 작성하는 것이 좋다.