kanana

4 개의 포스트

kakao4분 읽기큐레이션 요약

더 작고 강해진 Kanana SLM 개발

Kanana-2는 온디바이스 환경에 맞춰 크기와 추론 비용을 줄이면서도 대형 모델에 가까운 성능을 확보한 카카오의 SLM 시리즈다. 3B 모델을 TPU에서 처음부터 사전 학습한 뒤 Instruct 모델을 Teacher로 활용한 Distillation과 Long Context 학습을 적용했으며, 이를 기반으로 1.3B와 0.9B 모델을 단계적으로 압축했다. 또한 한국어 토크나이저 개선과 Sliding Window Attention(SWA)을 도입해 언어 처리량과 메모리 효율을 높였다. ## Kanana-2 SLM 개발 배경 - 대상 모델은 **Kanana-2-3B, 1.3B, 0.9B** 세 가지다. - 3B와 1.3B는 Base 및 Instruct 모델로 공개됐다. - 스마트폰 등 온디바이스 환경은 메모리와 연산 자원이 제한적이므로, 작고 빠르면서도 다양한 업무를 처리할 수 있는 SLM이 필요하다. - Kanana-2 개발에는 Kanana-2-30B-A3B 개발 경험과 기존 Kanana Nano의 Pruning·Distillation 노하우가 활용됐다. - 새로운 핵심 기법으로 Teacher 기반의 **off-policy·on-policy 학습**, 개선된 Pruning·Distillation, Kanana-2 Tokenizer, SWA가 적용됐다. ## 3B 모델의 TPU 기반 사전 학습 - Kanana-2-3B-Base는 TPU v5e 클러스터와 MaxText 기반 자체 학습 프레임워크로 처음부터 사전 학습됐다. - TPU에서 사전 학습한 뒤 GPU 클러스터에서 Distillation을 이어서 수행할 수 있도록 TPU와 GPU 간 학습 호환성을 확보했다. - 사전 학습은 2단계로 진행됐다. - **Stage 1:** 7.5T 토큰 - **Stage 2:** 2T 토큰 - 전체 사전 학습 구간에 **Muon Optimizer**를 적용했다. ## Proxy Token Scale을 활용한 Learning Rate 탐색 - 수조 개 토큰 규모의 본 학습에서 Learning Rate를 직접 탐색하는 것은 비용이 지나치게 크다. - Stage 1의 데이터 분포를 유지한 채 **100B 토큰 규모의 Proxy 학습**으로 후보 Learning Rate를 먼저 비교했다. - 이후 최적 Learning Rate를 본 학습 규모에 맞게 Token Horizon Scaling 법칙으로 조정했다. - 사용한 식은 다음과 같다. `LR*(Dtarget) ≈ LR*(Dproxy) × (Dtarget / Dproxy)^(-β)` - `Dproxy=100B`, `Dtarget=7.5T`, `β=0.32`를 사용했다. - 토큰 규모가 커질수록 최적 Learning Rate가 작아지는 경향을 반영해, 적은 탐색 비용으로 안정적인 학습 설정을 얻었다. ## Instruct Teacher를 활용한 Distillation - GPU 기반 Megatron-LM 프레임워크에서 **Kanana-2-30B-A3B-Instruct-2601**을 Teacher로 사용했다. - Base, Instruct, Thinking 모델을 각각 Teacher로 설정해 성능을 비교했다. - 실험 결과, 학습 전반에서 **Instruct 모델을 Teacher로 사용했을 때 가장 높은 성능**을 보였다. - 특히 Post-trained 모델을 Teacher로 사용하면 수학과 코드 영역에서 효과가 크다는 기존 연구 결과와도 일치한다. ## 32K Long Context 학습 - 4K 컨텍스트에서 YaRN을 적용해 최대 **32K 컨텍스트**까지 확장했다. - Learning Rate decay 단계에서 Mid-training 데이터를 추가해 최종 Base 모델을 완성했다. - Kanana-2-3B-Base는 이전 Kanana 3B 모델보다 한국어·영어 지식, 수학, 코드 등에서 향상된 성능을 보였다. - 유사한 크기의 오픈소스 SOTA Base 모델과 비교해도 대부분의 평가 영역에서 우수한 결과를 기록했다. ## 1.3B·0.9B 모델의 단계적 압축 - 3B Base 모델을 기반으로 **1.3B Base와 0.9B Base**를 순차적으로 개발했다. - 주요 압축 방식은 모델 구조를 줄이는 **Structured Pruning**과 Teacher의 지식을 전달하는 **Knowledge Distillation**이다. - Pruning 대상에는 Layer, Hidden Dimension, MLP 중간 차원, Attention Head 등이 포함될 수 있다. - 기존 Kanana Nano보다 Hidden Dimension pruning 방법을 고도화했다. ## PCA 기반 Hidden Dimension Pruning - 기존 방식은 Calibration 데이터의 Activation으로 각 Hidden dimension의 중요도 점수를 계산하고, 점수가 높은 차원만 남겼다. - 이 방식은 차원을 개별적으로 평가하기 때문에 여러 차원이 함께 형성하는 Hidden representation을 충분히 반영하지 못한다. - Kanana-2에서는 Ministral 3의 **PCA 기반 pruning**을 적용했다. - 처리 과정은 다음과 같다. 1. Calibration 데이터로 Attention RMSNorm, MLP RMSNorm, Final RMSNorm 입력의 Activation 통계를 수집한다. 2. PCA를 수행해 Global Rotation Matrix를 계산한다. 3. Token Embedding, Attention, MLP Projection Weight의 입출력에 동일한 회전을 적용한다. 4. 회전된 표현을 기준으로 Hidden dimension을 축소한다. - 이를 통해 개별 차원의 중요도뿐 아니라 여러 차원에 분산된 표현 구조까지 고려하는 것을 목표로 한다. ## SWA와 토크나이저를 통한 추론 효율 개선 - **Sliding Window Attention(SWA)**를 적용해 각 토큰이 제한된 범위의 이전 토큰만 참조하도록 했다. - 전체 시퀀스에 대한 Attention을 줄여 Decoding 병목을 완화한다. - KV Cache 크기를 축소해 온디바이스 추론에서 메모리 사용량을 줄인다. - SWA 구조에 맞춘 Long Context 학습도 별도로 수행했다. - **Kanana-2 Tokenizer**는 주요 언어인 한국어 처리 효율을 기존 대비 30% 이상 개선했다. - 토큰 수가 줄어들면 같은 문장을 처리할 때 필요한 연산량과 메모리 사용량도 함께 감소한다. ## 실용적인 결론 Kanana-2의 접근법은 단순히 모델 파라미터를 줄이는 것이 아니라, 3B 모델의 충분한 사전 학습과 강력한 Teacher Distillation, PCA 기반 구조적 pruning, SWA, 한국어 특화 토크나이저를 함께 최적화한 사례다. 온디바이스 서비스에서는 모델 크기만 비교하기보다 **한국어 토큰 효율, KV Cache 메모리, 실제 Decoding 속도, 압축 후 성능 유지율**을 함께 평가하는 것이 중요하다.

원문 읽기(새 탭에서 열림)
kakao2분 읽기큐레이션 요약

카카오 AI 앰배서더 ‘KANANA 429 앰배서더’를 신규 모집합니다.

카카오는 AI 앰배서더 프로그램 ‘KANANA 429’를 올해 100명 규모로 확대 모집한다. AI 전문가·크리에이터·대학생으로 분야를 세분화하고, 활동 기간을 5개월로 늘려 카카오 AI 서비스에 대한 체험과 의견 수렴을 강화한다. 선발자는 약 100만 원 상당의 AI 서비스 이용 기회와 다양한 혜택을 받으며, 지원자 전원에게 카카오 이모티콘 플러스 1개월 이용권이 제공된다. ## KANANA 429의 의미와 목적 - 카카오의 통합 AI 브랜드 ‘카나나’와 HTTP 상태 코드 `429 Too Many Requests`를 결합한 이름이다. - AI에 대한 관심과 아이디어가 넘치는 사람들을 상징한다. - 카카오 AI 기술과 서비스를 알리고, 실제 사용자와 다양한 분야의 의견을 수렴하기 위해 운영된다. ## 지난해 앰배서더 활동 - 지난해에는 20명을 선발해 약 3개월간 운영했다. - 주요 활동은 다음과 같다. - 카카오톡 오픈채팅을 통한 상시 소통 - 월 1회 오프라인 밋업과 자율 소모임 - 카카오 신규 AI 서비스 사전 체험 - 카카오 크루와의 네트워킹 - AI 서비스·모델·기술 리뷰 콘텐츠 제작 - 약 100개의 콘텐츠가 제작됐으며, 활동 종료 후 우수 앰배서더 5명을 선정해 시상했다. - 참여자에게는 앰배서더 전용 스페셜 굿즈도 제공됐다. ## 올해 신설된 3개 활동 분야 - **AI 전문가** - 카카오의 AI 서비스와 모델 등 최신 기술을 체험한다. - 기술 내용을 분석하고 심층 리뷰를 작성한다. - **크리에이터** - 카카오 AI를 활용하는 방법과 사례를 콘텐츠로 제작한다. - 일반 사용자에게 AI 서비스 활용법을 알리는 역할을 맡는다. - **대학생** - 캠퍼스 안팎에서 카카오 AI를 홍보한다. - 대학생과 일반 사용자의 의견을 수집하고 전달한다. ## 모집 규모와 활동 혜택 - 총 100명을 선발한다. - 활동 기간은 지난해 3개월에서 올해 5개월로 연장됐다. - 선발자에게는 다음 혜택이 제공된다. - 약 100만 원 상당의 AI 서비스 사용 기회 - 분야별 특화 활동 지원 - 카카오 AI 관계자와의 소통 및 네트워킹 - 기타 부가 혜택 - 모든 지원자에게 카카오 이모티콘 플러스 1개월 무료 이용권을 지급한다. ## 지원 방법과 일정 - 지원 마감: **2026년 2월 19일 정오** - 지원 방법: - 카카오 AI 기술과 관련된 콘텐츠를 게시한다. - 해당 콘텐츠의 URL을 모집 페이지에 제출한다. - 합격자 발표: **2026년 3월 4일** - 카카오 공식 카카오톡 채널 메시지로 개별 안내한다. - 첫 발대식: **2026년 3월 13일** - 카카오 AI 캠퍼스에서 진행될 예정이다. AI 기술 리뷰, 활용 콘텐츠 제작, 캠퍼스 홍보에 관심이 있다면 자신의 전문성과 활동 분야에 맞는 부문을 선택해 지원하는 것이 적합하다. 지원 전 AI 관련 콘텐츠를 미리 준비하고, 단순 홍보보다 실제 사용 경험과 구체적인 의견을 담는 것이 유리할 것으로 보인다.

원문 읽기(새 탭에서 열림)
kakao원문

“생각하고 답변하는” 카카오의 하이브리드 멀티모달 언어모델, Kanana-v-4b-hybrid 개발기 (새 탭에서 열림)

카카오가 개발한 'Kanana-v-4b-hybrid'는 단순한 이미지 인식을 넘어 논리적 추론과 자기 점검 기능을 갖춘 하이브리드 멀티모달 언어모델입니다. 이 모델은 단일 시스템 내에서 일상적인 대화와 복잡한 시각적 추론을 동시에 수행하며, 특히 한국어 특유의 섬세한 제약 조건을 정확히 이해하고 처리하는 데 최적화되어 있습니다. 이를 통해 한국어 기반의 검정고시 및 수능 문항 평가인 KoNET에서 92.8점이라는 높은 성적을 거두며 한국형 AI의 새로운 가능성을 입증했습니다. ### 하이브리드 대응을 위한 단일 모델 구조 * 직관적 응답이 필요한 일반 대화와 논리적 단계가 필요한 추론 모델을 분리하지 않고 하나의 모델로 통합했습니다. * 별도의 라우팅(Routing) 시스템 없이도 한 대화 세션 내에서 시시각각 변하는 질의 성격에 유연하게 대응할 수 있습니다. * 모델 통합을 통해 응답 톤, 포맷, 안전 정책의 일관성을 유지하며, 시스템 운영 복잡도와 유지보수 비용을 획기적으로 낮췄습니다. ### 검증 가능한 결론을 도출하는 시각적 추론 * 이미지를 단순히 설명하는 수준을 넘어, 이미지 내 정보를 종합하고 조건을 적용하여 결론을 도출하는 '시각적 추론'에 집중했습니다. * 모델 스스로 정보 종합, 추론 전개, 결과 검증, 최종 답변의 단계를 거치도록 설계되어 답변의 근거가 명확합니다. * 영수증 검산, 표 기반 조건 필터링, 이미지 기반 수학 문제 풀이 등 단순 OCR로는 해결하기 어려운 복잡한 과제에서 높은 정확도를 보여줍니다. ### 신뢰도를 높이는 자기 점검(Reflection) 메커니즘 * 자신의 추론 과정을 스스로 재검토하여 모순이나 실수 가능성을 찾아내는 자기 점검 기능을 탑재했습니다. * 복잡한 멀티모달 질의에서 발생하기 쉬운 조건 누락이나 사소한 계산 실수를 스스로 발견하고 수정하는 패턴을 보입니다. * 이러한 '자기 수정' 과정은 모델의 단순한 정확성을 넘어, 사용자가 AI의 답변을 믿고 사용할 수 있게 만드는 핵심적인 신뢰 요인이 됩니다. ### 한국어 직관을 보존하는 로컬 추론 프로세스 * '~만 제외하고', '단, ~인 경우에만'과 같은 한국어 특유의 복잡한 예외 및 조건부 표현을 번역 없이 한국어 그대로 사고합니다. * 영문 추론 과정에서 발생할 수 있는 의미 왜곡이나 정보 누락을 방지하여 한국어 질의의 의도를 끝까지 유지합니다. * 이미지 속 한국어 텍스트 정보를 다른 언어로 변환하지 않고 직접 처리함으로써 정보의 손실 없는 논리 전개가 가능합니다. Kanana-v-4b-hybrid는 높은 기술적 완성도를 바탕으로 실제 서비스 환경에서 비용 효율성과 정확성을 동시에 잡으려는 환경에 적합합니다. 특히 한국어 환경에서의 정밀한 업무 보조나 교육용 AI 솔루션처럼 정답의 신뢰도가 중요한 분야에서 이 모델의 하이브리드 추론 능력은 강력한 경쟁력이 될 것입니다.

kakao원문

더욱 똑똑하게 답하며, 더욱 풍부한 감정표현을 향한 Kanana-o의 진화 과정 (새 탭에서 열림)

카카오의 멀티모달 언어모델 Kanana-o는 텍스트, 이미지, 음성을 동시에 이해하고 처리하여 사람처럼 자연스러운 상호작용을 지향하는 통합 모델입니다. 연구팀은 모델이 입력 모달리티에 관계없이 일관된 지능을 발휘하도록 고품질의 복합 지시 이행 데이터를 구축하고, 음성 토큰화 기술을 통해 풍부한 감정 표현력을 확보했습니다. 그 결과 Kanana-o는 한국어 맥락을 깊이 있게 이해하며 복잡한 명령을 수행하는 동시에, 사람과 유사한 섬세한 음성 반응을 제공하는 독보적인 성능을 입증했습니다. **멀티모달 지시 이행 능력의 고도화** * 단순한 질의응답을 넘어 요약, 문체 변환, 형식 제한 등 복합적인 제약 조건이 포함된 오디오 기반 지시 이행 데이터셋을 직접 설계했습니다. * 텍스트 입력 시에는 뛰어난 성능을 보이지만 오디오 입력 시 성능이 저하되는 기존 모델들의 한계를 극복하기 위해, 모달리티에 무관하게 안정적인 지능을 유지하는 일반화(Domain-generalization) 작업에 집중했습니다. * 한국어 음성 지시 이행 벤치마크인 Speech-KoMT-Bench에서 글로벌 경쟁 모델 대비 압도적인 성능을 기록하며 한국어 환경에서의 우수성을 증명했습니다. **이미지-오디오-텍스트 통합 데이터 구축** * 이미지를 보면서 음성으로 질문하는 등 서로 다른 모달리티가 결합된 시나리오에서도 정교하게 동작하도록 이미지-오디오-텍스트 통합 데이터셋을 구축했습니다. * 시각 정보와 청각 정보를 동시에 정렬(Alignment)함으로써, 모델이 복합적인 입력 환경에서도 사용자의 의도와 맥락을 정확히 파악할 수 있도록 학습시켰습니다. **오디오 토큰화를 통한 자연스러운 감정 표현** * 기존의 단조로운 음성 합성 방식을 넘어, 음성 데이터를 이산적인 토큰(Discrete Audio Tokens)으로 변환하여 언어모델이 텍스트와 함께 예측하도록 설계했습니다. * 이를 통해 단순한 텍스트 전달이 아닌, 발화자의 감정선, 호흡, 웃음소리, 억양 등 미묘한 운율(Prosody) 정보를 풍부하게 담아낼 수 있게 되었습니다. * 사용자의 감정을 실시간으로 인식하고 이에 어울리는 목소리 톤으로 응답함으로써, 기계적인 비서가 아닌 실제 사람과 대화하는 듯한 정서적 유대감을 제공합니다. Kanana-o는 단순히 기술적 지표를 높이는 것에 그치지 않고, 실제 서비스 환경에서 사용자가 체감할 수 있는 '이해력'과 '표현력'의 조화를 이루어냈습니다. 한국어에 특화된 강력한 지능과 섬세한 감성 표현 기술의 결합은 향후 더욱 몰입감 있고 실질적인 도움을 주는 AI 경험을 제공할 것으로 기대됩니다.