open-dataset

1 개의 포스트

github

새로운 오픈 데이터셋으로 다국어 AI를 구축하는 연구자와 개발자를 가속화하다 (새 탭에서 열림)

GitHub는 비영어권 개발자 협업을 연구하고 다국어 AI를 개발할 수 있도록 **GitHub Multilingual Repositories Dataset**을 공개했다. 이 데이터셋은 저장소의 README, 가장 많은 댓글이 달린 이슈와 풀 리퀘스트를 분석해 언어 분류와 신뢰도, 저장소 메타데이터를 제공한다. GitHub는 이를 통해 언어별 개발자 커뮤니티의 대표성을 측정하고, 다양한 언어를 지원하는 AI 코딩 도구와 평가 세트를 만들 수 있다고 설명한다. ## 개발자 협업에서 다국어 데이터가 중요한 이유 - 개발자는 README에서 프로젝트 사용법을 설명하고, 이슈에서 문제를 논의하며, 풀 리퀘스트에서 코드를 리뷰한다. - 이러한 협업은 영어 중심으로 이루어지는 경우가 많지만, 실제로는 다양한 언어가 사용된다. - AI 코딩 도구가 개발 과정에 더 깊이 관여할수록, 특정 언어권의 개발자 콘텐츠만 학습·평가하는 방식에는 한계가 있다. - 특히 유럽 언어를 비롯한 일부 언어는 AI 학습 및 평가용 온라인 텍스트에서 상대적으로 부족하다. ## GitHub Multilingual Repositories Dataset의 구성 - 4,000만 개가 넘는 저장소를 대상으로 8,000만 개 이상의 분류 행을 제공한다. - 각 공개 저장소에 대해 다음 텍스트의 언어를 분류한다. - README - 댓글 수가 가장 많은 이슈 - 댓글 수가 가장 많은 풀 리퀘스트 - 각 텍스트에서 처음 150자만 분석하며, 20자 미만인 텍스트는 제외한다. - 다음 세 가지 언어 식별기의 결과를 모두 별도로 제공한다. - fastText - Google CLD3 - lingua-py - 각 분류 결과에는 신뢰도 점수가 포함되며, 신뢰도 0.5 초과인 결과만 수록된다. - 저장소 생성 시각, 디스크 사용량, 별 수, 포크 수, 주요 프로그래밍 언어, SPDX 라이선스, 이슈·풀 리퀘스트 수, 데이터 스냅샷 날짜도 제공한다. - 저장소 본문을 통째로 공개하는 데이터 덤프가 아니라, 다국어 콘텐츠가 있을 가능성이 높은 저장소를 찾기 위한 메타데이터 데이터셋이다. ## 여러 언어 분류기를 함께 제공하는 이유 - 언어 분류기마다 지원 언어, 적용 범위, 신뢰도 보정 방식이 다르다. - 특히 사용자가 적은 언어에서는 분류기별 결과 차이가 커질 수 있다. - GitHub는 세 분류기의 결과를 하나의 최종 언어 라벨로 합치지 않았다. - 사용자는 목적에 따라 정밀도와 재현율을 조절할 수 있다. - 높은 정밀도가 필요하면 세 분류기가 모두 같은 언어를 높은 신뢰도로 판정한 결과만 사용 - 폭넓은 탐색이 필요하면 하나의 분류기 결과만 사용 - 예를 들어 특정 언어의 신뢰도 높은 저장소 집합을 만들거나, 로망스어 계열 저장소를 넓게 탐색할 수 있다. ## 데이터셋으로 할 수 있는 일 - 특정 언어로 작성된 개발 문서나 협업 콘텐츠가 있는 저장소를 검색한다. - 언어별로 이슈, 풀 리퀘스트, README가 어떻게 사용되는지 연구한다. - 다국어 AI 코딩 도구, 문서 생성기, 코드 리뷰 보조 도구의 평가 세트를 만든다. - 언어별 개발자 지원이 부족한 영역을 데이터로 확인하고, 새로운 AI 기능의 언어 지원 확대를 제안한다. - 오픈 소스에서 유럽 언어 및 기타 저자원 언어가 얼마나 대표되는지 측정한다. ## 언어 식별의 한계와 사용상 주의점 - 소프트웨어 저장소의 텍스트는 짧고, 배지·템플릿·설치 명령·코드·사용자 이름이 섞여 있을 수 있다. - 150자의 샘플만으로 저장소 전체의 언어를 정확히 대표하기 어렵다. - 하나의 저장소 안에 여러 언어가 혼용될 수도 있다. - 분류기별 지원 범위와 신뢰도 보정이 다르므로 결과를 언어 식별의 정답 데이터로 간주해서는 안 된다. - 대신 사용자가 분류기별 결과와 신뢰도를 직접 확인하고 연구 목적에 맞는 기준을 설정하도록 설계됐다. - 저장소 수준의 메타데이터이므로 저장소 소유자나 기여자의 민감한 개인 특성을 추론하는 데 사용해서는 안 된다. ## CC0 공개와 향후 방향 - 데이터셋은 GitHub에서 **CC0-1.0** 라이선스로 공개되어 자유롭게 활용할 수 있다. - 연구자, 오픈 소스 유지 관리자, 모델 개발자가 이를 비판·확장하고 평가 세트와 도구를 구축하도록 장려한다. - GitHub는 다국어 개발자 커뮤니티를 더 잘 연구하고 지원하는 기반으로 이 데이터셋을 활용하기를 기대한다. - 궁극적으로 개발자가 실제로 사용하는 언어와 협업 방식을 반영하는 AI 도구를 만드는 것이 목표다. 실제로 활용할 때는 단일 분류 결과를 그대로 믿기보다 여러 분류기의 일치 여부와 신뢰도 기준을 함께 확인하는 것이 좋다. 특히 AI 평가 세트를 만들 때는 샘플을 직접 검수해 언어 혼용, 짧은 텍스트, 코드 포함으로 인한 오분류를 보완해야 한다.