trusted-execution-environments

2 개의 포스트

google3분 읽기큐레이션 요약

제로 트러스트 집계를 통한 비공개 분석

개인정보 보호형 분석은 개별 기기 데이터를 노출하지 않고 인구 집단의 경향만 파악하기 위한 핵심 수단이다. 이 글은 새로운 격자 기반 암호 프로토콜과 TEE(신뢰 실행 환경)를 결합해, 단 한 번의 메시지 전송만으로 안전한 집계를 수행하는 제로 트러스트 분석 구조를 소개한다. 암호 기술은 원시 데이터의 복호화·재구성을 막고, TEE의 원격 검증은 공개된 코드가 의도대로 실행되는지 확인해 보안을 다층화한다. ## 온디바이스 AI 분석의 필요성 - 모델을 사용자 기기에서 실행해도 실제 성능과 실패 양상을 파악하려면 집단 수준의 분석이 필요하다. - 주요 분석 질문은 다음과 같다. - 특정 지역의 새로운 표현 때문에 번역 모델이 성능 저하를 겪는가? - 특정 조명이나 지역적 환경에서 이미지 분류기의 편향이 나타나는가? - Smart Reply처럼 기술적으로는 맞지만 사용자가 불편해하는 기능의 실제 오류율은 얼마인가? - 연합 분석은 여러 기기의 데이터를 집계하지만, 집계되기 전까지 개별 데이터가 보호되는 별도의 프라이빗 집계 경로가 필요하다. ## 하드웨어 보호와 암호학적 보호 - TEE는 프로세서와 메모리 일부를 격리된 보안 영역으로 만들며, 운영체제나 악성 하이퍼바이저가 손상돼도 내부 데이터를 보호하도록 설계된다. - 원격 검증(attestation)은 enclave에서 실행 중인 펌웨어와 소프트웨어 상태를 하드웨어 기반 암호 지문으로 증명한다. - Google은 Pixel Recorder에서 TEE 기반 차등 개인정보 보호 집계를 사용해 왔다. - 그러나 TEE는 사이드 채널 공격에 취약할 수 있으며, 새로운 취약점이 계속 발견될 가능성이 있다. - 암호 프로토콜은 수학적으로 개별 데이터 복원이 불가능하고 익명화된 집계 결과만 노출된다는 증명 가능한 보장을 제공한다. - 기존 다중 라운드 보안 집계는 기기가 장시간 온라인 상태를 유지해야 해 대규모 활용에 제약이 있었다. ## 제로 트러스트 기반 다층 방어 - 새 시스템은 암호학적 보호와 TEE를 함께 사용해 어느 한 구성요소에 대한 신뢰 의존도를 줄인다. - 암호 계층은 서버 메모리에서 개별 원시 데이터가 복호화되거나 재구성되지 않도록 한다. - 데이터가 오프디바이스에서 평문으로 처리되는 시점은 이미 집계·익명화된 최종 결과를 다룰 때뿐이다. - TEE의 attestation은 참여자들이 실제로 공개된 코드가 올바르게 컴파일되고 실행되는지 검증할 수 있게 한다. - 따라서 TEE가 공격받더라도 암호 계층이 개별 데이터 보호를 유지하는 방어 심층성을 제공한다. ## 한 번의 메시지로 수행하는 암호 집계 - 새로운 프로토콜은 사용자가 데이터를 여러 차례 주고받지 않고 한 번의 메시지로 제출할 수 있게 한다. - 클라이언트는 데이터를 암호화하며, 서버는 암호문을 직접 합산하면서 그 결과가 원래 메시지들의 합과 대응되도록 처리한다. - 암호화 키 역시 집계되므로, 서버가 얻을 수 있는 복호화 키는 개별 값이 아니라 집계값만 복호화할 수 있다. - 클라이언트 일부는 소규모 위원회(committee)를 구성해 집계값을 해제하는 데 필요한 힌트를 보유한다. - 위원회 구성원은 자주 참여하지 않으며, 복호화 권한은 여러 참여자에게 분산된다. - 추가 차등 개인정보 보호 노이즈가 집계값에 적용되어 개인 정보 노출 가능성을 더욱 낮춘다. - 이 구조는 기기가 여러 라운드 동안 온라인 상태로 유지될 필요를 제거한다. ## Android SafetyCore 적용 - SafetyCore는 Android 9 이상에서 동작하는 개인정보 보호형 시스템 서비스다. - 온디바이스 안전 기능이 실제 환경에서 어떤 위협을 탐지하고 어디서 개선이 필요한지 파악하려면 집계 분석이 필요하다. - Google은 Android SafetyCore 팀과 협력해 새 프라이빗 분석 시스템을 적용하고 있다. - 목표는 사용자 콘텐츠를 직접 공개하지 않으면서 탐지 성능과 놓치는 위협 유형 등 집단적 경향을 파악하는 것이다. ## 실용적인 결론 민감한 온디바이스 데이터를 분석할 때는 TEE만 단독으로 신뢰하기보다, 암호학적 집계·차등 개인정보 보호·TEE attestation을 함께 적용하는 것이 바람직하다. 특히 기기가 지속적으로 연결되기 어려운 환경에서는 일회성 메시지 기반 프로토콜이 운영 효율성과 개인정보 보호를 동시에 개선할 수 있다.

원문 읽기(새 탭에서 열림)
google원문

AI 활용에 대한 증명 (새 탭에서 열림)

구글 리서치는 생성형 AI 서비스의 사용 패턴을 분석하면서도 사용자 프라이버시를 수학적으로 보장할 수 있는 '증명 가능한 개인정보 보호 인사이트(PPI)' 시스템을 공개했습니다. 이 시스템은 신뢰 실행 환경(TEE), 차분 프라이버시(DP), 그리고 대규모 언어 모델(LLM)을 결합하여 비정형 데이터를 안전하게 분석하는 환경을 구축했습니다. 이를 통해 개발자는 원본 데이터에 접근하지 않고도 AI 도구의 활용 사례와 개선점을 파악할 수 있으며, 모든 처리 과정은 오픈 소스로 공개되어 외부 검증이 가능합니다. **증명 가능한 개인정보 보호 인사이트(PPI)의 구동 원리** * **기기 내 데이터 보호:** 사용자 기기에서 분석할 데이터를 결정한 후 암호화하여 전송하며, 이 데이터는 서버의 TEE 내에서만 복호화될 수 있습니다. * **기밀 연합 분석(CFA) 활용:** Gboard 등에 적용되었던 기술을 발전시켜, 데이터 처리 단계를 기기가 사전에 승인한 로직으로만 제한하고 인간의 개입을 원천 차단합니다. * **데이터 전문가 LLM:** TEE 내부에 배치된 Gemma 3 모델이 "사용자가 어떤 주제를 논의 중인가?"와 같은 특정 질문에 답하는 방식으로 비정형 데이터를 정형화된 요약 정보로 변환합니다. **차분 프라이버시를 통한 익명성 보장** * **통계적 노이즈 추가:** LLM이 추출한 범주형 답변들을 집계할 때 차분 프라이버시 알고리즘을 적용하여 히스토그램을 생성합니다. * **개인 식별 방지:** 특정 개인의 데이터가 전체 통계 결과에 유의미한 영향을 미치지 않도록 설계되어, 분석가가 악의적인 프롬프트를 사용하더라도 개별 사용자를 식별할 수 없습니다. * **프롬프트 유연성:** DP 보증은 집계 알고리즘 단계에서 이루어지므로, 분석가는 프라이버시 침해 걱정 없이 LLM의 프롬프트를 자유롭게 변경하며 다양한 인사이트를 얻을 수 있습니다. **투명성 및 외부 검증 가능성** * **전 과정 오픈 소스화:** 개인정보 보호 집계 알고리즘부터 TEE 스택까지 모든 요소를 'Google Parfait' 프로젝트를 통해 오픈 소스로 공개했습니다. * **재현 가능한 빌드:** 외부 감사자가 공개된 코드와 실제 서버에서 실행 중인 바이너리가 일치하는지 확인할 수 있도록 재현 가능한 빌드 시스템을 지원합니다. * **실제 적용 사례:** Pixel 기기의 녹음기(Recorder) 앱 분석에 이 기술을 적용하여, 오픈 소스 Gemma 모델이 사용자의 녹음 데이터 요약 기능을 어떻게 활용하는지 안전하게 파악하고 있습니다. 생성형 AI의 성능 개선을 위해 실사용 데이터 분석이 필수적인 상황에서, PPI 시스템은 기술적 신뢰를 바탕으로 한 프라이버시 보호의 새로운 기준을 제시합니다. 개발자들은 구글이 공개한 기술 스택을 활용해 데이터 활용의 투명성을 높이고, 사용자의 신뢰를 얻으면서도 정교한 서비스 개선 인사이트를 도출할 수 있을 것입니다.