multimodal

4 개의 포스트

kakao4분 읽기큐레이션 요약

잘 말하는 AI를 넘어, 원하는 대로 말하는 AI로: Kanana-o 음성 생성 고도화 과정

Kanana-o는 단순히 자연스럽게 말하는 것을 넘어, 사용자가 지정한 속도·음량·억양·감정 등에 맞춰 말하는 음성 생성을 목표로 고도화됐다. 이를 위해 음성을 의미 정보와 음향 정보로 나누어 표현하는 LM-SPT 음성 토크나이저와 온라인 강화학습을 적용했다. LM-SPT는 토큰 시퀀스를 절반으로 줄이고 waveform을 직접 복원해 생성 효율을 높이는 동시에, 음성 특성을 세밀하게 제어할 기반을 마련했다. ## Kanana-o 음성 생성 구조 - 기존 Kanana-o는 음성을 초당 25개의 이산 토큰으로 표현했다. - Voice Token LM이 대화 문맥과 텍스트 답변을 바탕으로 음성 토큰을 순차적으로 생성한다. - 생성된 토큰은 다음 두 단계를 거쳐 음성으로 변환된다. - **Token-to-Mel**: 음성 토큰을 mel-spectrogram으로 변환 - **Mel-to-Waveform**: mel-spectrogram을 waveform으로 복원 ## 기존 음성 토크나이저의 한계 ### 음향 특성 제어의 어려움 - 기존 토크나이저는 발화 내용과 의미를 안정적으로 표현하는 데 강점이 있었다. - 반면 음색, 높낮이, 억양, 속도, 감정 같은 세부 음향 정보는 충분히 구조화하지 못했다. - 따라서 “더 빠르게”, “낮은 목소리로”, “속삭이듯이” 같은 지시를 토큰 수준에서 직접 제어하기 어려웠다. - 같은 문장이라도 화자나 억양에 따라 토큰 표현이 달라지면, 언어모델이 내용과 음향 특성을 독립적으로 학습하기도 어려워진다. ### 긴 시퀀스와 복잡한 디코딩 - 초당 25프레임의 토큰은 발화가 길어질수록 생성해야 할 토큰 수와 연산량을 증가시킨다. - Token-to-Mel 단계에서 Diffusion이나 Flow-matching 기반의 반복 추론이 필요할 수 있다. - 이후 Mel-to-Waveform까지 수행해야 하므로 총 2단계 디코딩 구조가 된다. - 이로 인해 실시간 음성 대화에 필요한 응답 속도와 효율을 확보하기 어렵다. ## LM-SPT의 의미·음향 분리 구조 - LM-SPT는 **LM-aligned SPeech Tokenizer**의 약자로, 언어모델과의 결합을 고려해 설계됐다. - 음성을 기존의 절반인 **초당 12.5프레임**으로 압축한다. - 음성 정보를 다음 두 종류의 토큰으로 분리한다. - **의미 토큰**: 텍스트와 대화 문맥에 대응하는 발화 내용 - **음향 토큰**: 음색, 억양, 높낮이, 발화 속도 등 실제 목소리의 세부 특성 - 두 개의 인코더와 하나의 의미 코드북, 여러 개의 음향 코드북으로 구성된 **Split RVQ** 구조를 사용한다. - 의미 코드북이 발화의 핵심 내용을 표현하고, 여러 음향 코드북이 의미 토큰에서 빠진 음향 정보를 단계적으로 보완한다. ## 의미 음성-재합성 기반 증류 - 단순히 음성을 잘 복원하도록 학습하면 의미 토큰에 음향 정보가 섞이거나, 발화 내용이 음향 토큰에 분산될 수 있다. - 기존 방식은 HuBERT나 WavLM 같은 자기지도학습 음성 모델의 표현을 의미 토큰과 시간 단위로 맞추는 증류를 사용했다. - 그러나 다음과 같은 문제가 있다. - teacher 모델의 표현이 음소·발음 중심이어서 언어모델의 고수준 의미와 완전히 일치하지 않을 수 있다. - 서로 다른 frame rate를 맞추는 과정에서 표현을 평균·축약하면 의미 정보가 희석될 수 있다. - LM-SPT는 Whisper처럼 언어모델과 연계하기 좋은 음성 인코더를 활용한다. - 의미 토큰만으로 원본 음성을 재합성한 뒤, 원본과 재합성 음성의 의미 표현이 유사해지도록 학습한다. - 특정 시간 구간의 teacher 표현을 그대로 모방하지 않고, 압축된 의미 토큰만으로 원본의 발화 내용을 보존하도록 유도한다. - 이 방식은 frame rate가 달라도 인위적인 시간 정렬 없이 의미 정보를 학습할 수 있다는 장점이 있다. ## 효율적인 음성 복원 - 최종 복원 과정에서는 의미 토큰과 음향 토큰을 함께 사용한다. - mel-spectrogram이라는 중간 표현을 거치지 않고 waveform을 직접 생성한다. - 무거운 사전학습 음성 인코더 없이 가벼운 음성 인코더를 사용할 수 있다. - 12.5Hz의 낮은 frame rate로 Voice Token LM의 생성 시간 스텝을 기존 대비 절반으로 줄였다. - 단일 디코더로 waveform을 복원해 기존의 2-stage decoding보다 간결한 구조를 구현했다. ## 온라인 강화학습을 통한 지시 이행 - LM-SPT가 음성의 의미와 음향 특성을 표현할 기반을 제공한다면, 온라인 강화학습은 사용자의 발화 지시를 실제 출력에 반영하도록 모델을 조정한다. - 목표는 음질의 자연스러움을 유지하면서도 다음과 같은 요구를 충실히 따르는 것이다. - 말하기 속도 - 음량 - 음높이와 억양 - 감정과 말투 - 속삭임 등 특정 발화 스타일 - 이를 통해 Kanana-o는 “사람처럼 자연스럽게 말하기”에서 나아가 “사용자가 원하는 방식으로 말하기”를 지향한다. ## 실용적인 결론 음성 AI를 실제 서비스에 적용하려면 음질뿐 아니라 지연시간, 연산량, 제어 가능성을 함께 고려해야 한다. Kanana-o의 접근법처럼 의미·음향 정보를 분리한 저주파 토큰과 직접 waveform을 복원하는 디코더를 사용하고, 온라인 강화학습으로 지시 이행 능력을 보완하는 방식은 실시간·개인화 음성 서비스에 적합한 설계 방향이다.

원문 읽기(새 탭에서 열림)
kakao5분 읽기큐레이션 요약

한국 문화 이해부터 화면 조작까지: Kanana-V 기능 확장의 모든 것

Kanana-V는 단일 이미지 질의응답을 넘어 한국 문화 이해, 문서·다중 이미지 분석, GUI 인식과 조작까지 수행하는 실용적 VLM을 목표로 개발됐다. 특히 대규모 한국어 Interleaved 데이터를 정교하게 정제하고 언어·문화적 특성에 맞게 학습시킨 결과, 데이터 양을 줄이더라도 한국어 및 VQA 성능을 높일 수 있었다. 글은 이러한 성능 향상의 배경이 된 데이터 처리 원칙과 실험 경험을 설명한다. ## VLM 기능 확장 방향 - 실제 서비스의 VLM에는 다음과 같은 능력이 요구된다. - 수십 페이지 PDF의 구조와 내용을 이해하는 문서 분석 - 여러 이미지를 비교·분석하는 다중 이미지 이해 - GUI 화면을 인식하고 클릭·입력 등 행동을 수행하는 Computer Use Agent(CUA) - 한국 문화와 언어적 맥락을 이해하는 지역 특화 능력 - Kanana-V는 문서 이해, GUI Grounding, 다중 이미지, 한국어 벤치마크에서 비슷한 규모의 Qwen3-VL 4B와 비교 가능한 성능을 보였으며, 특히 한국어 특화 태스크에서 경쟁력을 확인했다. ## Interleaved 한국어 데이터셋 - Interleaved 데이터셋은 이미지와 텍스트가 번갈아 배치된 형태다. - 블로그처럼 이미지와 설명이 함께 있는 자료를 활용하면 다음 효과를 기대할 수 있다. - 이미지와 텍스트의 연관 관계 학습 - 다양한 지식과 한국적 맥락 습득 - 예시를 바탕으로 문제를 해결하는 in-context learning 강화 - 원본 데이터는 수백 테라바이트 규모였으며 광고성 콘텐츠, 깨진 이미지, 중복 게시물 등 저품질 자료가 많이 포함돼 있었다. - 이를 처리하기 위해 Datatrove를 도입해 데이터를 샤딩하고 여러 필터를 병렬 적용했다. ## 8단계 데이터 정제 파이프라인 ### 1. 이미지 기반 문서 필터 - 깨진 이미지, 저해상도 이미지, 광고성 이미지 등을 제거했다. - OBELICS 기준을 참고해 다음 자료를 제외했다. - 종횡비가 3.0 이상인 이미지 - 한 변이 28픽셀 미만인 극소 이미지 - 유효한 이미지가 하나도 남지 않은 문서 - 이미지가 모두 제거된 문서는 Interleaved 데이터의 의미가 약해지므로 함께 제외했다. ### 2. 한국어 언어 식별 - FastText 기반 언어 식별 모델을 사용했다. - 한국어일 확률이 90% 이상인 문서만 통과시켰다. - 기계 번역이나 다국어 혼합 저품질 문서는 제거하면서도, 한국어 기술 문서에 포함된 영어 인용이나 코드 스니펫은 보존할 수 있도록 기준을 정했다. ### 3. 반복 패턴 제거 - Gopher의 반복 필터를 한국어에 맞게 조정했다. - 동일한 문장·단락의 반복 여부를 검사했다. - 2-gram부터 10-gram까지 분석해 비정상적으로 반복되는 구문을 탐지했다. - 스팸, 자동 생성 광고, 템플릿형 게시물을 제거하는 데 활용했다. ### 4. 기본 품질 필터 - 평균 단어 길이, 비알파벳 문자 비율, 불용어 출현 빈도 등을 검사했다. - 영어 기준을 그대로 적용하면 한국어 문서가 과도하게 제거되므로 평균 단어 길이 기준을 최소 1자로 완화했다. - ‘은, 는, 이, 가’와 같은 한국어 조사·어미 중심의 불용어 목록을 별도로 구성했다. - 자연스러운 문장은 조사와 어미가 일정 비율 포함되지만, 키워드 나열형 스팸에는 거의 없다는 점을 이용했다. ### 5. 문장 구조 검증 - C4 데이터셋의 품질 기준을 참고했다. - 최소 4문장 이상인 문서를 요구해 한 줄짜리 메모나 지나치게 짧은 콘텐츠를 제거했다. - 한국어는 문장 끝에 마침표를 생략하는 경우가 많아 종결 부호 기준은 적용하지 않았다. ### 6. 종합 품질 평가 - FineWeb의 라인 단위 품질 필터를 적용했다. - 다음과 같은 문서 구조를 검사했다. - 짧은 줄의 비율 - 글머리 기호로 시작하는 줄의 비율 - 줄임표로 끝나는 줄의 비율 - 상품 목록이나 메뉴판처럼 설명성이 낮은 콘텐츠를 걸러냈다. ### 7. MinHash 기반 중복 제거 - 펌글, 복사·붙여넣기, 일부 템플릿만 변경한 게시물을 제거했다. - 모든 문서 쌍을 비교하면 O(n²) 비용이 발생하므로 MinHash와 Locality-Sensitive Hashing(LSH)을 사용했다. - 문서를 고정 길이 시그니처로 압축하고 유사 문서를 같은 버킷에 배치한 뒤, 같은 버킷 안에서만 비교해 처리 비용을 줄였다. ### 8. 개인정보 처리와 콘텐츠 정리 - 전화번호와 이메일 주소 등 개인정보를 한국어 특화 PII 탐지 로직으로 찾아 마스킹 토큰으로 대체했다. - 이미지 제거 후 남은 빈 텍스트 노드를 삭제했다. - 분리된 텍스트 블록을 병합해 데이터 구조를 정리했다. ## 데이터 품질과 모델 성능의 관계 - 전체 데이터의 약 77%를 제거하고 약 23%만 최종 학습에 사용했다. - 정제 전후 동일한 모델과 학습 설정으로 Ablation 실험을 수행했다. - 정제 후 모델은 다음 영역에서 전반적으로 성능이 향상됐다. - MMVet: 33.76 → 36.79 - LLaVA-Wild: 75.10 → 78.00 - 국내 개체 인식: 50.05 → 53.66 - 한국어 음식 메뉴판 이해: 44.56 → 47.02 - 한국어 화장품 라벨 이해: 67.02 → 68.09 - 한국어 차트 이해는 58.33에서 57.43으로 소폭 하락해, 정제가 모든 태스크에 일관되게 긍정적인 것은 아님을 보여줬다. ## 데이터 파이프라인 구축에서 얻은 교훈 - 계산 비용이 낮은 필터를 앞에 배치해 명백한 저품질 데이터를 먼저 제거해야 한다. - 각 단계에서 탈락한 문서와 중간 결과를 저장하면 필터 오류를 검증하고 임계값을 쉽게 조정할 수 있다. - 중복 제거 완료 데이터도 별도로 보관하면 PII 처리 방식이나 출력 형식을 변경할 때 전체 파이프라인을 재실행하지 않아도 된다. - 영어용 품질 기준을 한국어에 그대로 적용하면 정상적인 한국어 문서까지 제거될 수 있으므로 언어별 튜닝이 필요하다. - Interleaved 데이터에서는 이미지가 삭제될 때 앞뒤 텍스트 구조도 함께 정리해야 한다. 이미지와 텍스트의 연결 관계가 깨지면 학습 데이터의 의미가 손상될 수 있다. 대규모 멀티모달 학습에서는 데이터 양보다 품질과 언어·문화적 적합성이 더 중요하다. 한국어 VLM을 구축할 때는 범용 필터를 그대로 사용하기보다 한국어 문장 구조와 콘텐츠 특성에 맞춘 기준을 마련하고, 단계별 결과를 저장하며 성능 검증을 병행하는 것이 효과적이다.

원문 읽기(새 탭에서 열림)
netflix원문

MediaFM: 넷 (새 탭에서 열림)

넷플릭스는 방대한 콘텐츠 카탈로그를 정밀하게 이해하기 위해 비디오, 오디오, 텍스트를 결합한 자체 멀티모달 파운데이션 모델인 MediaFM을 개발했습니다. 이 모델은 쇼트(Shot) 단위의 정보를 긴 문맥 속에서 학습하여 내러티브 구조와 감정적 흐름을 파악하며, 광고 타겟팅, 클립 인기 예측, 장르 분류 등 다양한 서비스의 기반 기술로 활용됩니다. 결과적으로 MediaFM은 단순한 프레임 분석을 넘어 영상의 전체적인 맥락을 기계가 읽을 수 있게 변환함으로써 넷플릭스의 콘텐츠 운영 효율과 사용자 경험을 크게 향상시키고 있습니다. **트리모달 데이터의 결합과 전처리** * 모델의 기본 분석 단위는 쇼트 경계 감지 알고리즘으로 분할된 '쇼트(Shot)'이며, 각 쇼트에서 비디오, 오디오, 텍스트 세 가지 핵심 모달리티를 추출합니다. * 비디오는 내부 모델인 SeqCLIP, 오디오는 Meta의 wav2vec2, 자막 및 오디오 설명은 OpenAI의 text-embedding-3-large를 사용하여 개별 임베딩을 생성합니다. * 추출된 세 임베딩을 하나로 결합하여 2304차원의 통합 벡터를 만들고, 이를 최대 512개의 시퀀스로 구성하여 트랜스포머 인코더에 입력합니다. * 작품의 시놉시스와 태그 같은 타이틀 수준의 메타데이터를 [GLOBAL] 토큰으로 변환하여 삽입함으로써, 개별 쇼트가 전체 작품의 맥락을 반영할 수 있도록 설계했습니다. **트랜스포머 기반 아키텍처와 학습 방식** * MediaFM은 BERT와 유사한 구조의 트랜스포머 인코더를 사용하여 쇼트 간의 시간적 관계와 문맥적 정보를 학습합니다. * '마스크 쇼트 모델링(Masked Shot Modeling, MSM)' 기법을 학습 목표로 사용하며, 입력 시퀀스의 20%를 마스킹하고 주변 정보를 통해 원래의 결합 임베딩을 코사인 유사도 기반으로 예측하도록 훈련합니다. * 최적화 과정에서 하이퍼파라미터 튜닝을 위해 Muon 옵티마이저를 도입하여 기존 AdamW 방식보다 성능을 유의미하게 개선했습니다. * 이 과정을 통해 생성된 임베딩은 단순한 정보를 넘어 영상의 전후 흐름이 반영된 '문맥화된 표현(Contextualized representation)'이 됩니다. **주요 활용 사례 및 성능 평가** * 광고 적합성(Ad Relevancy): 추출된 임베딩을 통해 특정 광고 배치에 적합한 클립을 분류하고 후보군을 식별하여 광고 서빙 시스템의 효율을 높입니다. * 클립 인기 및 톤 분석: 클립의 클릭률(CTR)을 바탕으로 상대적 인기를 예측하거나, 영상의 분위기(공포, 유머 등 100여 개 카테고리)를 정밀하게 분석합니다. * 장르 분류 및 리트리벌: 11개의 주요 장르 분류와 더불어, 특정 작품을 홍보하기에 적합한 '가치 있는 클립'인지 여부를 판별하는 이진 분류 작업에 활용됩니다. * 성능 평가 결과, 특정 클립을 단독으로 분석하는 것보다 전체 에피소드라는 더 큰 문맥 안에서 임베딩을 추출할 때 모든 작업에서 월등한 성능을 보였습니다. MediaFM은 넷플릭스가 보유한 대규모 엔터테인먼트 특화 데이터를 학습하여 콘텐츠의 깊은 의미를 파악하는 강력한 도구입니다. 특히 신작 출시 시 데이터가 부족한 '콜드 스타트' 문제를 해결하고, 예고편이나 아트워크 같은 홍보 자산을 최적화하는 데 기여함으로써 미디어 산업에서 멀티모달 AI가 나아가야 할 실질적인 방향을 제시하고 있습니다.

kakao원문

더욱 똑똑하게 답하며, 더욱 풍부한 감정표현을 향한 Kanana-o의 진화 과정 (새 탭에서 열림)

카카오의 멀티모달 언어모델 Kanana-o는 텍스트, 이미지, 음성을 동시에 이해하고 처리하여 사람처럼 자연스러운 상호작용을 지향하는 통합 모델입니다. 연구팀은 모델이 입력 모달리티에 관계없이 일관된 지능을 발휘하도록 고품질의 복합 지시 이행 데이터를 구축하고, 음성 토큰화 기술을 통해 풍부한 감정 표현력을 확보했습니다. 그 결과 Kanana-o는 한국어 맥락을 깊이 있게 이해하며 복잡한 명령을 수행하는 동시에, 사람과 유사한 섬세한 음성 반응을 제공하는 독보적인 성능을 입증했습니다. **멀티모달 지시 이행 능력의 고도화** * 단순한 질의응답을 넘어 요약, 문체 변환, 형식 제한 등 복합적인 제약 조건이 포함된 오디오 기반 지시 이행 데이터셋을 직접 설계했습니다. * 텍스트 입력 시에는 뛰어난 성능을 보이지만 오디오 입력 시 성능이 저하되는 기존 모델들의 한계를 극복하기 위해, 모달리티에 무관하게 안정적인 지능을 유지하는 일반화(Domain-generalization) 작업에 집중했습니다. * 한국어 음성 지시 이행 벤치마크인 Speech-KoMT-Bench에서 글로벌 경쟁 모델 대비 압도적인 성능을 기록하며 한국어 환경에서의 우수성을 증명했습니다. **이미지-오디오-텍스트 통합 데이터 구축** * 이미지를 보면서 음성으로 질문하는 등 서로 다른 모달리티가 결합된 시나리오에서도 정교하게 동작하도록 이미지-오디오-텍스트 통합 데이터셋을 구축했습니다. * 시각 정보와 청각 정보를 동시에 정렬(Alignment)함으로써, 모델이 복합적인 입력 환경에서도 사용자의 의도와 맥락을 정확히 파악할 수 있도록 학습시켰습니다. **오디오 토큰화를 통한 자연스러운 감정 표현** * 기존의 단조로운 음성 합성 방식을 넘어, 음성 데이터를 이산적인 토큰(Discrete Audio Tokens)으로 변환하여 언어모델이 텍스트와 함께 예측하도록 설계했습니다. * 이를 통해 단순한 텍스트 전달이 아닌, 발화자의 감정선, 호흡, 웃음소리, 억양 등 미묘한 운율(Prosody) 정보를 풍부하게 담아낼 수 있게 되었습니다. * 사용자의 감정을 실시간으로 인식하고 이에 어울리는 목소리 톤으로 응답함으로써, 기계적인 비서가 아닌 실제 사람과 대화하는 듯한 정서적 유대감을 제공합니다. Kanana-o는 단순히 기술적 지표를 높이는 것에 그치지 않고, 실제 서비스 환경에서 사용자가 체감할 수 있는 '이해력'과 '표현력'의 조화를 이루어냈습니다. 한국어에 특화된 강력한 지능과 섬세한 감성 표현 기술의 결합은 향후 더욱 몰입감 있고 실질적인 도움을 주는 AI 경험을 제공할 것으로 기대됩니다.