hugging-face

6 개의 포스트

aws5분 읽기큐레이션 요약

AWS 주간 정리: 1주년을 맞은 AWS Builder Center, Security Hub의 네트워크 스캐닝, AWS용 Loom 등 (2026년 7월 13일) | Amazon Web Services

AWS Builder Center가 출범 1주년을 맞아 샌드박스, 워크숍, 커뮤니티 기능을 갖춘 AWS 학습·개발 생태계로 확장됐다. 동시에 AWS Security Hub의 네트워크 스캐닝 및 Azure 지원, SageMaker와 Hugging Face 통합, GPU 관리 비용 인하, Aurora DSQL CDC 정식 출시 등 주요 서비스 업데이트가 발표됐다. AWS는 보안·AI 에이전트·멀티클라우드 관리 기능을 통합해 개발 편의성과 운영 자동화를 강화하는 방향을 보이고 있다. ## AWS Builder Center의 1년 성장 - 2025년 7월 9일 출시 이후 커뮤니티 허브에서 종합 개발자 생태계로 확장됐다. - 주요 기능: - AWS 리전별 서비스 현황 - 커뮤니티가 직접 만드는 Spaces - 카테고리·난이도별 워크숍 - 배지와 연속 활동 기록 - 아티클 시리즈, 조회 수, 저장 항목 - 학생 상태 및 서비스 출시 알림 - GitHub·Amazon 계정 로그인 - 무료 샌드박스 환경 - 5,548명의 작성자가 6,448개 아티클을 게시했으며, 누적 조회 수는 1,040만 회를 넘었다. - 2026년 3월 배지 시스템 출시 후 약 99,226개의 배지가 발급됐다. - 사용자 요청 565건 중 10건이 실제 출시됐고, 20건은 단기 로드맵에 포함됐다. - 인기 글: - MCP와 Strands Agents SDK 기반 AWS Study Buddy: 5만 회 이상 - Kiro를 활용한 EOL Linux 서버 AWS 이전: 4만 5천 회 이상 - 신경 질환 조기 검사를 위한 멀티모달 AI: 3만 8천 회 이상 ## 8시간짜리 무료 AWS 샌드박스 - 워크숍 실습을 위해 사전 구성된 무료 AWS 계정을 제공한다. - 개인 AWS 계정, 신용카드, 수동 리소스 정리가 필요 없다. - 환경은 최대 8시간 동안 활성화되며 이후 계정과 리소스가 자동으로 제거된다. - 한 번에 하나의 샌드박스만 사용할 수 있고, 주 1회 신청할 수 있다. - AWS 서비스를 안전하게 실습하거나 교육용 워크숍을 진행하는 데 적합하다. ## Security Hub의 네트워크 및 멀티클라우드 보안 - **Network Scanning**은 실제 인터넷에서 리소스에 접근 가능한지를 직접 확인한다. - AWS와 Azure 환경에서 다음 리소스를 탐색한다. - 공용 IP 주소 - 가상 머신 - 로드 밸런서 - 접근 가능한 포트와 해당 포트에서 실행 중인 서비스를 식별한다. - 접근 가능한 포트마다 발견 근거와 함께 Security Hub finding을 생성한다. - 기존 네트워크 도달 가능성 분석이 “도달 가능하게 만들 수 있는 구성”을 찾는다면, Network Scanning은 실제 인터넷 도달 여부를 검증한다. - Security Hub Exposures가 관련 설정 및 보안 결과를 결합해 전체적인 위험도를 계산한다. - 신규 고객에게는 기본 활성화되며, 기존 고객은 계정·리전별 또는 조직 정책으로 활성화할 수 있다. - Security Hub Essentials에 추가 비용 없이 포함된다. - Azure 리소스도 자동 검색해 다음 항목을 통합 관리한다. - VM, 컨테이너 이미지, Function Apps, ID - 설정 오류, 인터넷 노출, 소프트웨어 취약점 - AWS와 Azure의 보안 결과를 동일한 형식과 자동화 흐름으로 한 화면에서 관리할 수 있다. ## SageMaker Studio와 Hugging Face 통합 - Hugging Face에서 모델을 선택한 뒤 한 번의 클릭으로 SageMaker Studio에서 커스터마이즈하거나 배포할 수 있다. - 지원 모델에는 다음 작업 흐름이 제공된다. - SageMaker에서 모델 커스터마이즈 - SageMaker 또는 Bedrock 엔드포인트 배포 - 모델 평가 - 사용자 정의 보상 함수를 활용한 강화학습 파인튜닝 - 신규 고객은 사전 구성된 권한과 환경을 갖춘 Studio를 빠르게 생성할 수 있다. - 검증된 고객은 별도 쿼터 증액 요청 없이 G5, G6, G4dn GPU 인스턴스에 기본 접근할 수 있다. - Studio 내부에서 GPU 쿼터 사용량도 확인할 수 있다. ## GPU 관리 비용 인하 - 2026년 7월 1일부터 EKS Auto Mode와 ECS Managed Instances의 가속 인스턴스 관리 비용이 자동으로 인하된다. - 인하 폭: - G 계열: 35% - P 계열 및 AWS Trainium: 60% - 기존 클러스터에도 자동 적용되며 별도 작업이 필요 없다. - EKS Auto Mode: - GPU 인스턴스의 병렬 이미지 풀링 - 로컬 NVMe 기반 가속 워크로드 지원 - 가속기 상태를 인식한 노드 복구 - ECS Managed Instances: - CloudWatch Container Insights 기반 GPU 메트릭 - GPU 하드웨어 장애 자동 모니터링 ## Aurora DSQL의 변경 데이터 캡처 - Aurora DSQL CDC가 정식 출시됐다. - INSERT, UPDATE, DELETE 결과를 변경 이벤트로 만들어 Amazon Kinesis Data Streams에 전송한다. - 활용 사례: - 마이크로서비스 간 데이터 동기화 - Lambda 함수 트리거 - Firehose를 통한 S3, Redshift, OpenSearch Service 전달 - 데이터베이스 워크로드 성능에 영향을 주지 않도록 설계됐다. - CDC 인프라를 별도로 구축하거나 운영할 필요가 없다. ## AWS용 Loom과 안전한 AI 에이전트 운영 - Loom은 AWS Strands Agents와 Amazon Bedrock AgentCore Runtime 기반 에이전트를 구축·배포하는 오픈소스 엔터프라이즈 플랫폼이다. - 제공 기능: - 통합 관리 UI와 백엔드 API - ID 공급자 연동 - 범위 기반 권한 제어 - 멀티 페르소나 탐색 - 에이전트, 메모리, MCP 서버, 에이전트 간 연동의 전체 수명주기 관리 - 멀티테넌트 환경을 위해 RBAC와 ABAC를 지원한다. - 리소스 태깅을 자동화해 비용을 사용자·팀별로 추적할 수 있다. - 표준화된 배포 블루프린트, AWS Agent Registry 연동, 민감한 작업 전 사람의 검토 절차도 제공한다. - AWS Labs GitHub에서 프로젝트를 확인할 수 있다. ## Claude 애플리케이션 접근 제어 - Claude Code와 Claude Desktop에 대한 접근, 비용, 정책을 중앙에서 관리하는 자체 호스팅 게이트웨이가 소개됐다. - OIDC 호환 ID 공급자와 연동하며, 모든 요청에 관리형 설정을 적용한다. - Amazon Bedrock 또는 AWS 기반 Claude Platform으로 추론 요청을 라우팅할 수 있다. - 사용자·그룹별 지출 한도를 설정할 수 있다. - 프라이빗 네트워크의 무상태 컨테이너로 실행되며, PostgreSQL은 단기 로그인 상태만 저장한다. - 개발자 장비에 장기 보안 키를 저장하지 않는 방식으로 보안을 강화한다. ## AWS MCP Server의 OAuth 지원 - AWS Console이나 CLI와 동일한 자격 증명을 사용해 브라우저 기반 OAuth로 AWS MCP Server에 연결할 수 있다. - IAM Federation, AWS IAM Identity Center, 루트 사용자 및 IAM 사용자를 지원한다. - AWS Sign-In이 단기 액세스·리프레시 토큰을 발급하고 토큰 갱신을 자동 처리한다. - 개발자는 재시작 후에도 반복 로그인 없이 에이전트를 인증 상태로 유지할 수 있다. AWS를 학습하거나 실험하려는 경우 Builder Center의 샌드박스와 워크숍을 활용하면 비용과 정리 부담을 줄일 수 있다. 운영 환경에서는 Security Hub의 실제 인터넷 도달성 검사와 Azure 통합을 우선 검토하고, AI 에이전트 도입 시에는 Loom·OAuth·중앙 정책 관리 기능을 통해 권한, 비용, 감사 체계를 함께 설계하는 것이 바람직하다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

TabFM 소개: 표 형식 데이터를 위한 제로샷 파운데이션 모델

TabFM은 표 형식 데이터를 위한 제로샷 파운데이션 모델로, 별도의 모델 학습·하이퍼파라미터 튜닝·복잡한 피처 엔지니어링 없이 분류와 회귀를 수행한다. 전체 학습 데이터와 예측 대상 행을 하나의 문맥으로 입력해 인컨텍스트 러닝(ICL) 방식으로 관계를 파악하며, 단 한 번의 순전파로 예측을 생성한다. Google은 TabArena 평가에서 TabFM이 기존의 튜닝된 트리 기반 모델들과 경쟁력 있는 성능을 보였다고 설명하며, BigQuery의 `AI.PREDICT` SQL 명령으로 제공할 계획이다. ## 기존 표 형식 머신러닝의 한계 - 고객 이탈 예측, 금융 사기 탐지 등 표 데이터 기반 분류·회귀 문제는 기업의 핵심 업무에 널리 사용된다. - AdaBoost, XGBoost, 랜덤 포레스트 같은 지도학습 트리 모델이 오랫동안 강력한 성능을 보여왔다. - 하지만 새로운 데이터셋마다 다음 작업을 반복해야 한다. - 모델 학습 - 하이퍼파라미터 최적화 - 도메인별 피처 엔지니어링 - 검증 및 재학습 - 따라서 단순히 `.fit()`을 호출하는 것만으로는 실무에서 신뢰할 만한 성능을 얻기 어렵다는 문제가 있다. ## 표 데이터를 위한 인컨텍스트 러닝 - TabFM은 기존처럼 데이터셋별로 모델 가중치를 업데이트하지 않는다. - 과거의 학습 행과 예측할 테스트 행을 하나의 통합된 입력 문맥으로 제공한다. - 모델은 추론 시점에 행과 열 사이의 관계를 분석해 새로운 작업을 수행한다. - 이는 대규모 언어 모델이 예시와 지시문만으로 새로운 작업을 수행하는 제로샷·인컨텍스트 러닝과 유사하다. - 결과적으로 데이터셋별 반복 학습, 튜닝, 수작업 피처 설계가 필요하지 않다. ## 행·열 구조를 반영한 하이브리드 아키텍처 표는 자연어처럼 일렬로 정렬된 토큰 시퀀스가 아니라, 행과 열로 구성된 2차원 구조이며 행이나 열의 순서를 바꿔도 의미가 본질적으로 달라지지 않는다. TabFM은 이를 처리하기 위해 TabPFN과 TabICL의 아이디어를 결합한 구조를 사용한다. - **행·열 교차 어텐션** - 여러 층의 어텐션 모듈이 열 방향과 행 방향을 번갈아 처리한다. - 각 피처의 상호작용과 각 샘플 간의 관계를 함께 학습한다. - 기존 피처 엔지니어링이 담당하던 복잡한 변수 간 의존성 추출을 모델 내부에서 수행한다. - **행 압축** - 각 행에서 얻은 풍부한 문맥 정보를 하나의 밀집 벡터로 압축한다. - 이후 단계가 원본 2차원 테이블 전체가 아니라 압축된 행 표현을 사용하도록 만든다. - **압축 표현 기반 ICL** - 전용 Transformer가 압축된 행 벡터들의 시퀀스에 어텐션을 적용한다. - 원시 테이블 전체에 직접 어텐션하는 방식보다 계산량이 크게 줄어든다. - 데이터셋 규모가 커져도 비교적 효율적으로 예측할 수 있도록 설계됐다. ## 합성 데이터로 대규모 사전 학습 - 산업용 표 데이터는 기업의 독점 스키마와 민감한 정보를 포함하는 경우가 많아 공개된 대규모 학습 데이터가 부족하다. - TabFM은 이 문제를 해결하기 위해 수억 개의 합성 데이터셋으로만 학습됐다. - 합성 데이터는 구조적 인과 모델(SCM)을 이용해 동적으로 생성된다. - 다양한 무작위 함수와 데이터 분포, 복잡한 피처 관계를 포함하도록 설계됐다. - 실제 데이터를 직접 대량 확보하지 않고도 다양한 표 구조를 학습해, 보지 못한 실제 데이터셋에 일반화하는 것을 목표로 한다. ## TabArena 벤치마크와 두 가지 모델 설정 - TabArena에서 분류 38개, 회귀 13개 데이터셋을 대상으로 평가했다. - 데이터셋 크기는 약 700개에서 150,000개 샘플까지 다양하다. - 모델 간 일대일 승률을 바탕으로 Elo 점수를 계산해 성능을 비교한다. - **TabFM** - 기본 제공 모델이다. - 튜닝이나 교차 검증 없이 한 번의 순전파로 예측한다. - 제로샷 사용 편의성을 중시한 설정이다. - **TabFM-Ensemble** - 성능 향상을 위해 교차 피처와 SVD(특이값 분해) 피처를 추가한다. - 비음수 최소제곱법으로 32개 모델 앙상블의 최적 가중치를 계산한다. - 분류 문제에서는 Platt scaling을 이용해 예측 확률을 보정한다. - 기본 TabFM보다 추가 계산과 처리 과정이 필요하지만 더 높은 성능을 목표로 한다. ## 제공 방식과 기대 효과 - TabFM은 Hugging Face와 GitHub를 통해 공개된다. - Google BigQuery에도 통합될 예정이며, 사용자는 `AI.PREDICT` SQL 명령으로 분류·회귀를 실행할 수 있다. - 별도의 머신러닝 전문 지식이나 전통적인 모델 개발 파이프라인 없이 표 데이터 예측을 수행하는 것이 목표다. 실무에서는 빠른 기준선 모델이나 반복적인 데이터셋별 모델 개발을 줄이는 용도로 TabFM을 먼저 적용할 수 있다. 다만 중요한 의사결정에 사용할 때는 데이터 누수, 예측 확률의 보정, 기존 모델과의 실제 데이터셋별 비교 및 비용·지연 시간까지 함께 검증하는 것이 좋다.

원문 읽기(새 탭에서 열림)
kakao원문

더 똑똑하고 효율적인 Kanana-2 오픈소스 공개 (새 탭에서 열림)

카카오는 사용자의 명령 맥락을 파악하고 능동적으로 동작하는 에이전틱 AI(Agentic AI) 구현에 최적화된 차세대 언어모델 'Kanana-2'를 오픈소스로 공개했습니다. 글로벌 프런티어 모델인 Qwen3-30B-A3B와 대등한 성능을 갖춘 이번 모델은 도구 호출(Tool Calling)과 지시 이행 능력을 대폭 강화하여 실무적인 활용도를 극대화했습니다. 특히 한국어 처리 효율성을 30% 이상 개선하고 추론 특화 모델을 라인업에 추가함으로써, 고도화된 논리적 사고가 필요한 서비스 개발에 강력한 토대를 제공합니다. **다양한 연구 및 서비스 요구사항을 충족하는 세 가지 모델 라인업** * **Kanana-2-30b-a3b-base**: 사전 학습 단계의 웨이트를 포함한 기본 모델로, 연구자들이 자체 데이터를 활용해 자유롭게 파인 튜닝하여 새로운 모델을 개발할 수 있는 기초가 됩니다. * **Kanana-2-30b-a3b-instruct**: 사용자의 지시를 정확히 이해하고 수행하는 능력을 극대화한 버전으로, 일반적인 대화 및 작업 수행에 최적화되어 있습니다. * **Kanana-2-30b-a3b-thinking**: 카카오가 처음으로 선보이는 추론 특화 모델로, 수학이나 코딩 등 복잡한 논리적 사고가 필요한 과제에서 뛰어난 성능을 발휘하며 높은 지시 이행 능력을 동시에 유지합니다. **에이전틱 AI 구현을 위한 도구 호출 및 지시 이행 성능 강화** * **Multi-turn Tool Calling**: 외부 도구를 자유자재로 다루는 능력을 이전 모델(Kanana-1.5) 대비 3배 이상 개선하여, 모델 컨텍스트 프로토콜(MCP) 활용성을 극대화했습니다. * **정교한 지시 이행**: 사용자의 복잡하고 단계적인 요구사항을 정확히 파악하여 결과물을 생성하며, 추론 모델에서도 이러한 성능이 저하되지 않도록 설계되었습니다. * **다국어 지원 확대**: 기존 한국어와 영어에 더해 일본어, 중국어, 태국어, 베트남어까지 총 6개 국어를 지원하여 글로벌 서비스 대응 능력을 높였습니다. **대규모 트래픽 처리를 위한 아키텍처 및 효율성 개선** * **MLA(Multi-head Latent Attention)**: 메모리 점유를 압축하여 긴 문맥(Long Context)을 효율적으로 처리할 수 있도록 설계되었습니다. * **MoE(Mixture of Experts)**: 추론 시 필요한 파라미터만 활성화하는 전문가 혼합 구조를 통해 거대 모델의 성능은 유지하면서 연산 비용과 응답 속도를 획기적으로 개선했습니다. * **한국어 최적화 토크나이저**: 새롭게 학습된 토크나이저를 통해 기존 모델 대비 한국어 토큰 효율을 30% 이상 향상시켜, 더 적은 자원으로 빠른 응답(High Throughput)이 가능합니다. **실용적인 결론 및 제안** Kanana-2는 고성능과 효율성을 동시에 잡은 모델로, 특히 한국어 기반의 복잡한 에이전트 서비스를 구축하려는 개발자에게 최적의 선택지입니다. 허깅페이스(Hugging Face)를 통해 Base 모델부터 추론 특화 모델까지 모두 공개되어 있으므로, 목적에 맞는 모델을 선택해 즉시 파인 튜닝하거나 서비스에 적용해 보실 것을 추천합니다.

google원문

파형에서 지혜로: (새 탭에서 열림)

Google Research는 음성 지능 모델의 성능을 정밀하게 측정하고 발전시키기 위한 통합 오픈소스 플랫폼인 MSEB(Massive Sound Embedding Benchmark)를 공개했습니다. 이 벤치마크는 검색, 분류, 재구성 등 8가지 핵심 능력을 표준화하여 파편화된 기존 사운드 AI 연구를 통합하고, 범용 사운드 임베딩이 도달해야 할 기술적 목표치를 제시합니다. 초기 실험 결과 현재의 기술력은 범용성 측면에서 개선의 여지가 크며, MSEB는 이를 극복하여 인간 수준의 청각 지능을 구현하기 위한 핵심 지표로 활용될 전망입니다. ### 다각적 평가를 위한 고품질 데이터 세트 구축 * **SVQ(Simple Voice Questions) 데이터**: 17개 언어와 26개 지역의 특성을 반영한 177,352개의 짧은 음성 질의 데이터로, 화자 속성과 시간 정렬 데이터 등 풍부한 메타데이터를 포함합니다. * **실제 소음 환경 반영**: 조용한 상태, 배경 대화, 교통 소음, 미디어 소음 등 네 가지 실제 음향 환경을 시뮬레이션하여 모델의 견고성을 테스트합니다. * **도메인 확장성**: Speech-MASSIVE(의도 분류), FSD50K(환경음 인식), BirdSet(생물 음향학) 등 공공 데이터를 통합하여 인간의 언어를 넘어 자연계의 소리까지 아우르는 범용성을 확보했습니다. ### 청각 지능의 8가지 핵심 능력 정의 * **정보 접근(검색, 추론, 재순위화)**: 음성 질의를 통해 지식 베이스에서 관련 문서를 찾거나(검색), 문서 내 정답을 도출(추론)하고, 모호한 음성 인식 후보군을 원본 의도에 맞게 재정렬(재순위화)하는 능력을 평가합니다. * **기초 인지(분류, 전사, 세분화)**: 소리의 범주와 화자 속성을 분류하고, 음성을 텍스트로 변환(전사)하며, 특정 용어가 나타나는 정확한 시점을 타임스탬프로 파악(세분화)하는 기본 성능을 측정합니다. * **조직 및 생성(클러스터링, 재구성)**: 사전 정의된 레이블 없이 유사한 속성의 음성을 그룹화(클러스터링)하고, 중간 표현체인 임베딩으로부터 원본 오디오 파형을 얼마나 정밀하게 복원(재구성)할 수 있는지 확인합니다. ### 범용 임베딩 성능 분석과 연구 방향 * **성능 여유(Headroom) 확인**: 현재의 사운드 임베딩 기술이 모든 도메인에서 완벽하지 않다는 점을 시사하며, 최신 모델들도 여전히 성능 향상의 여지가 큼을 객관적인 수치로 입증했습니다. * **표준화된 평가 구조**: 단일 모달 모델부터 복합적인 멀티모달 모델까지 동일한 기준에서 성능을 비교할 수 있는 유연하고 확장 가능한 프레임워크를 제공합니다. * **미래 확장성**: 향후 음악 데이터 세트 추가 및 이미지와 결합된 멀티모달 작업으로 영역을 확장하여 실제 환경에서 활용 가능한 지능형 에이전트 개발을 지원할 예정입니다. MSEB는 사운드 기반 AI 연구가 직면한 파편화 문제를 해결하고 차세대 청각 지능을 위한 명확한 이정표를 제시합니다. 연구자들은 이 오픈소스 벤치마크를 활용해 모델의 범용성을 검증하고, 특히 복잡한 소음 환경에서의 데이터 해석 능력을 높이는 데 집중함으로써 더 자연스럽고 지능적인 음성 인터페이스를 구축할 수 있습니다.

line원문

AI 제품 개발 중 마주칠 수 있는 보안 위협 사례와 대책 방안 (새 탭에서 열림)

AI 제품 개발은 생산성을 비약적으로 높여주지만, 환각 현상이나 프롬프트 주입과 같은 새로운 형태의 보안 위협을 동반합니다. 이러한 리스크는 단순히 오답을 제공하는 수준을 넘어 악성코드 설치, 원격 코드 실행(RCE), 민감 정보 유출로 이어질 수 있어 기존과는 다른 다각도의 방어 전략이 필요합니다. LY Corporation은 실제 사례 분석을 통해 AI 모델과 외부 도구 간의 접점을 보호하고 보안 검토를 자동화하는 등의 대응 방안을 구축하고 있습니다. ## 슬랍스쿼팅(Slopsquatting)과 패키지 오인 * AI가 존재하지 않는 소프트웨어 패키지 이름을 마치 실제인 것처럼 제안하는 '환각(Hallucination)' 현상을 악용한 공격입니다. * 예를 들어, AI가 `huggingface_hub[cli]` 대신 `huggingface-cli`라는 잘못된 패키지 설치를 권장할 때, 공격자가 미리 해당 이름으로 악성 패키지를 등록해 두면 사용자가 이를 설치하게 됩니다. * 이를 방지하기 위해 AI가 생성한 코드나 설치 지침을 실행하기 전 반드시 공식 문서와 대조하여 검증하는 절차가 필수적입니다. ## 프롬프트 주입을 통한 원격 코드 실행(RCE) * Vanna AI 사례(CVE-2024-5565)와 같이 자연어를 SQL이나 파이썬 코드로 변환하여 직접 실행하는 서비스에서 주로 발생합니다. * 사용자가 입력창에 악의적인 명령을 주입하여 애플리케이션 권한 내에서 임의의 시스템 명령어를 실행하도록 유도할 수 있습니다. * LLM을 전적으로 신뢰하여 코드를 실행하게 두지 말고, 사용자 입력을 엄격히 검증(Sanitize)하며 데이터 생성 용도로만 제한적으로 활용해야 합니다. ## 오피스 AI에서의 간접 프롬프트 주입 * 이메일이나 문서 본문에 숨겨진 악성 지시사항을 AI가 읽고 실행하게 만드는 '간접 주입' 방식의 위협입니다. * 가령, 피싱 사이트로 유도를 하거나 비밀번호 변경을 종용하는 문구가 포함된 이메일을 AI가 요약하는 과정에서 사용자를 속이는 스크립트를 수행하게 될 수 있습니다. * 입력 데이터뿐만 아니라 AI가 내놓는 출력물에 대해서도 가드레일(Guardrails)을 적용하여 이상 징후를 탐지하는 이중 방어 체계가 필요합니다. ## 코딩 에이전트의 권한 남용 및 데이터 노출 * GitHub MCP(Model Context Protocol)와 같이 자동화된 코딩 에이전트가 공개 저장소와 비공개 저장소에 동시에 접근할 때 발생합니다. * 공개 저장소의 이슈나 PR에 포함된 악성 명령어가 에이전트를 통해 실행되면, 에이전트의 권한을 이용해 비공개 저장소에 있는 급여 정보나 개인정보를 외부로 유출할 수 있습니다. * 에이전트가 접근 가능한 데이터 범위를 최소화하고, 작업 단위별로 권한을 분리하는 보안 디자인이 중요합니다. ## 임베딩 인버전(Embedding Inversion)을 통한 정보 복원 * 텍스트 데이터를 수치화한 벡터 임베딩 값으로부터 원본 텍스트를 역으로 추론해내는 공격 기법입니다. * 임베딩 데이터 자체가 유출될 경우, 비식별화되었다고 판단했던 민감한 정보가 다시 복원되어 프라이버시 침해로 이어질 수 있습니다. * 벡터 데이터베이스에 대한 접근 제어를 강화하고 임베딩 데이터의 보안 수준을 원본 데이터와 동일하게 관리해야 합니다. AI 프로덕트의 안전성을 확보하기 위해서는 기획 단계에서의 보안 디자인 리뷰는 물론, 위협 모델링 자동화 도구인 'ConA'나 소스 코드 취약점 분석 자동화 도구인 'LAVA'와 같은 기술적 솔루션을 적극적으로 도입하여 보안 프로세스를 내재화하는 것이 권장됩니다.

google원문

AfriMed-QA (새 탭에서 열림)

Google Research와 아프리카 현지 파트너들은 아프리카 보건 의료 맥락에 특화된 최초의 대규모 의료 벤치마크 데이터셋인 'AfriMed-QA'를 개발했습니다. 이 데이터셋은 기존 서구권 중심의 의료 벤치마크가 반영하지 못했던 아프리카 특유의 질병 분포, 언어적 특성, 문화적 배경을 포함하여 LLM의 실질적인 성능을 평가하도록 설계되었습니다. 연구 결과 대규모 모델일수록 높은 정확도를 보였으며, 이 데이터셋은 Google의 최신 의료 특화 모델인 MedGemma 학습에도 활용되었습니다. ### AfriMed-QA 데이터셋의 구성과 특징 * **데이터 규모 및 구성**: 약 15,000개의 임상 질문과 답변으로 이루어져 있으며, 4,000개 이상의 전문가용 객관식(MCQ), 1,200개 이상의 단답형(SAQ), 10,000개의 소비자 질의(CQ)를 포함합니다. * **광범위한 출처**: 아프리카 12개국, 60개 이상의 의과대학에서 온 621명의 기여자가 참여하여 데이터를 구축했습니다. * **전문 분야 포괄**: 산부인과, 신경외과, 내과, 응급의학, 전염병 등 총 32개의 세부 의료 전공 분야를 망라합니다. * **수집 플랫폼**: Intron Health가 개발한 웹 기반 크라우드소싱 플랫폼을 활용하여 아프리카 현지의 다양한 억양과 다국어 환경을 반영할 수 있는 인터페이스를 구축했습니다. ### 지역적 맥락 반영의 필요성 및 가치 * **분포 변화 대응**: 기존 USMLE MedQA와 같은 데이터셋은 서구 중심의 데이터에 치우쳐 있어, 아프리카 지역의 질병 패턴이나 증상의 맥락적 차이를 평가하는 데 한계가 있었습니다. * **언어적 다양성**: 영어를 사용하더라도 지역마다 다른 언어적 변종(linguistics)과 현지 지식을 정확히 이해해야 실질적인 의료 지원이 가능합니다. * **사회적 영향력**: 본 연구는 저자원 환경에서 LLM이 임상 진단 정확도를 높이고 다국어 의사결정 지원 도구로 기능할 수 있음을 입증하여 ACL 2025에서 '최우수 사회적 영향 논문상'을 수상했습니다. ### LLM 성능 평가 및 시사점 * **평가 대상**: 소형부터 대형 모델에 이르는 총 30개의 일반 및 바이오메디컬 LLM(오픈 소스 및 폐쇄형 포함)을 대상으로 평가를 진행했습니다. * **평가 방법론**: 객관식은 정답 선택 정확도를 측정하고, 단답형은 참조 답변과의 문장 수준 중첩도 및 의미적 유사성을 분석했습니다. * **모델 크기와 성능의 상관관계**: 대규모 모델이 소형 모델보다 AfriMed-QA에서 더 높은 성능을 보였는데, 이는 온디바이스(On-device)나 엣지 배포가 필요한 저자원 환경에서 소형 전문 모델의 개선이 필요함을 시사합니다. ### 데이터 공개 및 향후 활용 * **오픈 소스화**: 아프리카 보건 의료 AI 발전을 위해 벤치마크 데이터셋은 Hugging Face에, 평가 코드는 GitHub에 전면 공개되었습니다. * **실제 모델 적용**: 이 데이터셋은 Google의 최신 의료 특화 오픈 모델인 'MedGemma'의 학습 및 검증에 직접적으로 활용되었습니다. * **확장성**: 본 프로젝트에서 사용된 데이터 수집 및 평가 방법론은 디지털화된 벤치마크가 부족한 다른 지역(locale)에도 확장 적용될 수 있는 가이드라인을 제시합니다.