on-device-machine-learning

1 개의 포스트

meta

종단 간 암호화와 검증 가능성을 보장하는 WhatsApp용 사기 경보 시스템 구축 방법 (새 탭에서 열림)

WhatsApp의 Scam Alert는 종단간 암호화를 유지하면서 사기 가능성이 있는 메시지를 기기에서만 분석하는 선택형 기능이다. 메시지 내용은 서버로 전송되거나 자동 신고되지 않으며, 사용자가 경고를 본 뒤 차단·신고·대화 지속 여부를 직접 결정한다. WhatsApp은 온디바이스 처리, 사용자 통제, 공개 검증 가능성을 통해 개인정보 보호와 사기 탐지의 균형을 이루려 한다. ## 온디바이스 사기 탐지 - 사용자가 기능을 켜면 사기 탐지용 머신러닝 모델이 기기에 다운로드된다. - 모델은 연락처에 등록되지 않은 사람이 보낸 메시지를 대상으로 다음 신호를 분석한다. - 대화의 구조 - 문장 및 언어적 특징 - 기존 사기 대화에서 관찰된 패턴 - 분류는 확률 기반으로 수행되며, 메시지 내용은 분류를 위해 WhatsApp·Meta·제3자 서버로 전송되지 않는다. - 모델이 사기 가능성이 높다고 판단하면 해당 사용자에게만 채팅 경고가 표시된다. 상대방에게는 경고가 보이지 않는다. ## 사용자가 결정하는 대응 방식 - 경고를 본 사용자는 다음 중 하나를 선택할 수 있다. - 대화 차단 - 신고 - 계속 대화 - 오탐이라고 판단하면 채팅을 신뢰 대상으로 표시할 수 있다. - 신뢰 처리된 채팅은 경고가 제거되고, Scam Alert가 해당 채팅을 다시 경고하지 않는다. - 사용자가 원할 경우 정확도 개선을 위해 최근 수신 메시지 5개를 WhatsApp에 공유할 수 있다. - 메시지 내용이나 사기 탐지 사실이 서버에 전달되는 유일한 경로는 사용자가 명시적으로 신고하거나 공유하는 경우다. ## 설계 원칙 - **기기 내 처리**: 머신러닝 모델과 분석 대상 메시지는 모두 사용자 기기에 남는다. - **자동 신고 금지**: WhatsApp은 사용자의 행동 없이 메시지나 탐지 결과를 서버로 보낼 수 없다. - **사용자 통제**: 기능을 언제든 켜거나 끌 수 있고, 경고에 대한 최종 판단도 사용자가 내린다. - 최근 온디바이스 머신러닝 기술 발전으로 모바일 기기에서도 성능·배터리·모델 크기의 부담을 줄이면서 텍스트 분류가 가능해졌다는 점을 활용한다. ## 개인정보 보호형 분석 WhatsApp은 기능이 실제 사기를 잘 탐지하는지, 모델 업데이트 후 성능이 악화되지 않았는지를 확인하기 위해 제한적인 통계만 수집한다. - 수집 대상은 메시지 원문이 아닌 다음 두 종류의 집계 신호다. - **경고 횟수**: 기기 내 모델이 사기 경고를 표시한 횟수 - **사용자 행동 횟수**: 경고 이후 사용자가 신뢰 처리, 차단, 신고 등을 선택한 횟수 - 이 통계는 모델의 경고 발생률과 오탐률을 평가하는 데 사용된다. - 개인별 행동이나 특정 메시지를 식별할 수 있도록 설계하지 않는다. - 차등 개인정보보호(differential privacy)를 적용해 통계에 조정된 노이즈를 추가한다. - 이에 따라 특정 개인의 데이터가 포함되거나 제외되더라도 전체 통계에 미치는 영향이 매우 작아진다. ## 기밀 연합 분석 파이프라인 집계 통계를 보호하기 위해 WhatsApp은 기밀 컴퓨팅 기반의 연합 분석 구조를 사용한다. - **로컬 집계** - 원시 이벤트는 기기를 떠나지 않는다. - 기기는 데이터를 자체적으로 횟수로 합산한 뒤 집계값만 전송한다. - 전송 시점은 무작위화되고, 기기 식별자는 포함되지 않는다. - 시간 정보도 정확한 시각이 아닌 넓은 구간으로 제한된다. - **기밀 처리** - 집계값은 CPU 기반 기밀 가상머신(CVM)과 신뢰 실행 환경(TEE)에서 처리된다. - 클라이언트는 하드웨어 기반 증명을 확인하고, 허용된 소프트웨어 바이너리인지 제3자 로그와 대조한다. - 데이터는 기기와 TEE 사이에서 암호화된다. - WhatsApp이나 Meta를 포함한 중간 전달자도 처리 중인 데이터를 볼 수 없도록 설계됐다. - **안전한 집계** - 개별 기기의 통계가 직접 노출되지 않도록 여러 기기의 데이터를 결합한다. - 최종적으로 WhatsApp과 Meta에 제공되는 것은 익명화·차등 개인정보보호가 적용된 집계 결과다. ## 모델 배포와 독립 검증 - Meta와 WhatsApp은 특정 사용자에게 특정 모델을 선택적으로 배포할 수 없도록 설계했다. - 실험 모델을 포함한 모든 모델 버전은 배포 전에 공개 투명성 원장에 기록된다. - 모델 가중치도 공개해 보안 연구자들이 모델이 사기 탐지 목적에 맞게 제작됐는지 확인할 수 있도록 한다. - 버그 바운티 프로그램을 확대해 외부 연구자들이 구현을 검증하고 취약점을 찾을 수 있게 했다. - 사용자 역시 앱 내 로그를 통해 기능의 동작을 확인할 수 있도록 했다. ## 실용적인 결론 Scam Alert는 서버에서 메시지를 검사하는 방식이 아니라, 선택형 온디바이스 모델과 사용자 주도 신고를 결합한 접근이다. 개인정보 보호가 중요한 사용자는 기능을 직접 활성화해 사기 경고를 보조 수단으로 활용할 수 있지만, 머신러닝 경고는 확률적 판단이므로 최종적으로는 송금 요구, 긴급성 유도, 신원 사칭 같은 전형적인 사기 신호를 사용자가 함께 확인해야 한다.