큐레이션 요약
Kanana-o 신규 모델 및 API 베타 서비스를 공개합니다.
카카오는 한국어와 한국적 맥락을 깊이 이해하고 텍스트·이미지·오디오를 통합 처리하는 옴니 모델 Kanana-o를 공개하고, 정식 상용화에 앞서 API 클로즈드 베타를 진행한다. 베타 모델은 Kanana-1.5-o-9.8b-2602이며, 자연스러운 한국어 발화와 감정 표현, 다중 화자·멀티턴 대화 등 다양한 활용을 목표로 한다. 카카오는 실제 서비스 아이디어를 가진 개발자와 연구자들의 사용 및 피드백을 통해 기술 가능성을 검증할 계획이다.
한국어와 멀티모달에 특화된 Kanana-o
- 텍스트, 이미지, 오디오 등 두 가지 이상의 입력을 동시에 이해하고 처리하는 통합 멀티모달 언어 모델이다.
- 한국어의 표현과 문화적 맥락, 복잡한 사용자 의도를 깊이 있게 해석하도록 설계됐다.
- 억양·속도·감정 등 화자의 특성을 반영해 자연스러운 한국어 음성을 생성한다.
- 텍스트 생성 속도와 오디오 처리 속도의 균형을 고려해 대화형 애플리케이션에 적합하다.
- 팟캐스트 분석, 멀티턴 대화, 다중 화자 대화 TTS 등 다양한 시나리오에 활용할 수 있다.
API 베타 서비스 운영 방식
- 제공 모델은 Kanana-1.5-o-9.8b-2602 버전이다.
- 대규모 트래픽을 처리하는 공개 서비스가 아니라, 개발자와 파트너가 직접 사용하며 피드백을 제공하는 클로즈드 베타 테스트다.
- 운영 기간은 2026년 2월 27일부터 5월 27일까지다.
- 베타 기간에는 정해진 일일 사용 횟수만큼 API를 테스트할 수 있다.
신청 절차와 선정 기준
omni.kanana.ai에서 카카오 계정으로 로그인한다.- 소속, 사용 목적, 예상 시나리오 등을 포함한 비즈니스 폼을 작성해 대기 등록한다.
- 선정된 참가자는 2월 27일부터 순차적으로 카카오톡 알림톡을 통해 초대장과 API 이용 가이드를 받는다.
- 대상은 개발자, 학생, 스타트업, 연구자 등 구체적인 활용 계획을 가진 사용자다.
- 단순히 “AI를 사용해보고 싶다”는 동기보다, 시각장애인용 쇼핑 도우미처럼 모델의 기능과 구현 방법이 명확한 제안이 유리하다.
기대되는 활용 분야
- 이미지 이해 기능을 활용한 시각장애인 지원 서비스
- 음성과 이미지를 결합한 대화형 비서
- 감정과 화자 특성을 반영한 콘텐츠 제작 및 TTS
- 팟캐스트·회의 등 다중 화자 오디오 분석
- 한국어 중심의 교육, 고객 지원, 엔터테인먼트 애플리케이션
실제 베타 신청을 고려한다면 단순 체험보다 구체적인 사용자 문제, 입력 데이터 형태, API 활용 방식, 프로토타입 구현 계획을 명확히 작성하는 것이 좋다.
관련 글
큐레이션 요약을 이어서 읽어보세요.