vision-language-model

1 개의 포스트

kakao5분 읽기큐레이션 요약

한국 문화 이해부터 화면 조작까지: Kanana-V 기능 확장의 모든 것

Kanana-V는 단일 이미지 질의응답을 넘어 한국 문화 이해, 문서·다중 이미지 분석, GUI 인식과 조작까지 수행하는 실용적 VLM을 목표로 개발됐다. 특히 대규모 한국어 Interleaved 데이터를 정교하게 정제하고 언어·문화적 특성에 맞게 학습시킨 결과, 데이터 양을 줄이더라도 한국어 및 VQA 성능을 높일 수 있었다. 글은 이러한 성능 향상의 배경이 된 데이터 처리 원칙과 실험 경험을 설명한다. ## VLM 기능 확장 방향 - 실제 서비스의 VLM에는 다음과 같은 능력이 요구된다. - 수십 페이지 PDF의 구조와 내용을 이해하는 문서 분석 - 여러 이미지를 비교·분석하는 다중 이미지 이해 - GUI 화면을 인식하고 클릭·입력 등 행동을 수행하는 Computer Use Agent(CUA) - 한국 문화와 언어적 맥락을 이해하는 지역 특화 능력 - Kanana-V는 문서 이해, GUI Grounding, 다중 이미지, 한국어 벤치마크에서 비슷한 규모의 Qwen3-VL 4B와 비교 가능한 성능을 보였으며, 특히 한국어 특화 태스크에서 경쟁력을 확인했다. ## Interleaved 한국어 데이터셋 - Interleaved 데이터셋은 이미지와 텍스트가 번갈아 배치된 형태다. - 블로그처럼 이미지와 설명이 함께 있는 자료를 활용하면 다음 효과를 기대할 수 있다. - 이미지와 텍스트의 연관 관계 학습 - 다양한 지식과 한국적 맥락 습득 - 예시를 바탕으로 문제를 해결하는 in-context learning 강화 - 원본 데이터는 수백 테라바이트 규모였으며 광고성 콘텐츠, 깨진 이미지, 중복 게시물 등 저품질 자료가 많이 포함돼 있었다. - 이를 처리하기 위해 Datatrove를 도입해 데이터를 샤딩하고 여러 필터를 병렬 적용했다. ## 8단계 데이터 정제 파이프라인 ### 1. 이미지 기반 문서 필터 - 깨진 이미지, 저해상도 이미지, 광고성 이미지 등을 제거했다. - OBELICS 기준을 참고해 다음 자료를 제외했다. - 종횡비가 3.0 이상인 이미지 - 한 변이 28픽셀 미만인 극소 이미지 - 유효한 이미지가 하나도 남지 않은 문서 - 이미지가 모두 제거된 문서는 Interleaved 데이터의 의미가 약해지므로 함께 제외했다. ### 2. 한국어 언어 식별 - FastText 기반 언어 식별 모델을 사용했다. - 한국어일 확률이 90% 이상인 문서만 통과시켰다. - 기계 번역이나 다국어 혼합 저품질 문서는 제거하면서도, 한국어 기술 문서에 포함된 영어 인용이나 코드 스니펫은 보존할 수 있도록 기준을 정했다. ### 3. 반복 패턴 제거 - Gopher의 반복 필터를 한국어에 맞게 조정했다. - 동일한 문장·단락의 반복 여부를 검사했다. - 2-gram부터 10-gram까지 분석해 비정상적으로 반복되는 구문을 탐지했다. - 스팸, 자동 생성 광고, 템플릿형 게시물을 제거하는 데 활용했다. ### 4. 기본 품질 필터 - 평균 단어 길이, 비알파벳 문자 비율, 불용어 출현 빈도 등을 검사했다. - 영어 기준을 그대로 적용하면 한국어 문서가 과도하게 제거되므로 평균 단어 길이 기준을 최소 1자로 완화했다. - ‘은, 는, 이, 가’와 같은 한국어 조사·어미 중심의 불용어 목록을 별도로 구성했다. - 자연스러운 문장은 조사와 어미가 일정 비율 포함되지만, 키워드 나열형 스팸에는 거의 없다는 점을 이용했다. ### 5. 문장 구조 검증 - C4 데이터셋의 품질 기준을 참고했다. - 최소 4문장 이상인 문서를 요구해 한 줄짜리 메모나 지나치게 짧은 콘텐츠를 제거했다. - 한국어는 문장 끝에 마침표를 생략하는 경우가 많아 종결 부호 기준은 적용하지 않았다. ### 6. 종합 품질 평가 - FineWeb의 라인 단위 품질 필터를 적용했다. - 다음과 같은 문서 구조를 검사했다. - 짧은 줄의 비율 - 글머리 기호로 시작하는 줄의 비율 - 줄임표로 끝나는 줄의 비율 - 상품 목록이나 메뉴판처럼 설명성이 낮은 콘텐츠를 걸러냈다. ### 7. MinHash 기반 중복 제거 - 펌글, 복사·붙여넣기, 일부 템플릿만 변경한 게시물을 제거했다. - 모든 문서 쌍을 비교하면 O(n²) 비용이 발생하므로 MinHash와 Locality-Sensitive Hashing(LSH)을 사용했다. - 문서를 고정 길이 시그니처로 압축하고 유사 문서를 같은 버킷에 배치한 뒤, 같은 버킷 안에서만 비교해 처리 비용을 줄였다. ### 8. 개인정보 처리와 콘텐츠 정리 - 전화번호와 이메일 주소 등 개인정보를 한국어 특화 PII 탐지 로직으로 찾아 마스킹 토큰으로 대체했다. - 이미지 제거 후 남은 빈 텍스트 노드를 삭제했다. - 분리된 텍스트 블록을 병합해 데이터 구조를 정리했다. ## 데이터 품질과 모델 성능의 관계 - 전체 데이터의 약 77%를 제거하고 약 23%만 최종 학습에 사용했다. - 정제 전후 동일한 모델과 학습 설정으로 Ablation 실험을 수행했다. - 정제 후 모델은 다음 영역에서 전반적으로 성능이 향상됐다. - MMVet: 33.76 → 36.79 - LLaVA-Wild: 75.10 → 78.00 - 국내 개체 인식: 50.05 → 53.66 - 한국어 음식 메뉴판 이해: 44.56 → 47.02 - 한국어 화장품 라벨 이해: 67.02 → 68.09 - 한국어 차트 이해는 58.33에서 57.43으로 소폭 하락해, 정제가 모든 태스크에 일관되게 긍정적인 것은 아님을 보여줬다. ## 데이터 파이프라인 구축에서 얻은 교훈 - 계산 비용이 낮은 필터를 앞에 배치해 명백한 저품질 데이터를 먼저 제거해야 한다. - 각 단계에서 탈락한 문서와 중간 결과를 저장하면 필터 오류를 검증하고 임계값을 쉽게 조정할 수 있다. - 중복 제거 완료 데이터도 별도로 보관하면 PII 처리 방식이나 출력 형식을 변경할 때 전체 파이프라인을 재실행하지 않아도 된다. - 영어용 품질 기준을 한국어에 그대로 적용하면 정상적인 한국어 문서까지 제거될 수 있으므로 언어별 튜닝이 필요하다. - Interleaved 데이터에서는 이미지가 삭제될 때 앞뒤 텍스트 구조도 함께 정리해야 한다. 이미지와 텍스트의 연결 관계가 깨지면 학습 데이터의 의미가 손상될 수 있다. 대규모 멀티모달 학습에서는 데이터 양보다 품질과 언어·문화적 적합성이 더 중요하다. 한국어 VLM을 구축할 때는 범용 필터를 그대로 사용하기보다 한국어 문장 구조와 콘텐츠 특성에 맞춘 기준을 마련하고, 단계별 결과를 저장하며 성능 검증을 병행하는 것이 효과적이다.

원문 읽기(새 탭에서 열림)