parallel-computing

2 개의 포스트

google4분 읽기큐레이션 요약

사용하지 않는 휴대폰으로 만드는 저탄소 컴퓨팅 플랫폼

사용이 끝난 스마트폰의 메인보드를 모아 클러스터로 구성하면, 새 서버 제조를 줄이면서 저비용·저탄소 클라우드 컴퓨팅 플랫폼으로 재활용할 수 있다. UC 샌디에이고와 Google은 2,000대의 Pixel 스마트폰으로 데이터센터를 구축해 교육·연구용 컴퓨팅을 제공할 계획이다. 이 방식은 스마트폰의 제한된 메모리와 코어 수에 맞는 작업을 선별하고, 대규모 배포에서 소비자용 하드웨어의 신뢰성을 검증하는 것을 목표로 한다. ## 컴퓨팅의 탄소 배출과 스마트폰 재활용 - 컴퓨팅의 탄소발자국은 크게 두 가지다. - **운영 탄소**: 기기 사용 중 소비되는 전력에서 발생하는 배출량 - **내재 탄소**: 하드웨어 제조와 원자재 추출 과정에서 발생하는 배출량 - 전력 효율 향상과 재생에너지 사용으로 운영 탄소는 줄일 수 있지만, 제조 과정의 내재 탄소는 해결이 더 어렵다. - 사람들은 평균 4년마다 스마트폰을 교체하지만, 교체된 기기에도 프로세서, 가속기, 메모리, 저장장치 등 핵심 컴퓨팅 기능이 남아 있다. - 기존 스마트폰을 재사용하면 새 하드웨어 생산과 추가적인 원자재 채굴을 피할 수 있다. ## 스마트폰과 서버의 성능 차이 - 2023년형 Pixel Fold의 고성능 코어는 SPEC 벤치마크에서 일부 최신 데이터센터 서버의 단일 코어 성능을 웃돈다. - 다만 스마트폰은 서버보다 다음과 같은 제약이 있다. - 코어 수가 적고 CPU 구성이 이기종임 - 메모리가 약 8~12GB로 제한됨 - 서버처럼 대규모 멀티스레드 처리나 대용량 메모리를 제공하지 못함 - 따라서 하나의 스마트폰에 들어갈 수 있거나, 여러 기기로 분할할 수 있는 작업이 적합하다. - 벤치마크상 약 25~50대의 스마트폰이 현대적인 서버 한 대에 해당하는 성능을 낼 수 있다. ## 스마트폰을 데이터센터 하드웨어로 개조 - 소비자용 스마트폰을 그대로 데이터센터에 배치하면 비효율적이고 위험하다. - 디스플레이, 배터리, 카메라, 케이스 등 서버에 필요 없는 부품이 공간을 차지함 - 특히 배터리는 데이터센터 환경에서 장시간 사용하기에 적합하지 않을 수 있음 - 따라서 메인보드만 분리해 클러스터에 사용한다. - 메인보드는 스마트폰 내재 탄소의 약 50%를 차지하는 가장 중요한 부품이므로, 이를 재사용하는 것이 환경적 효과가 크다. - Android 기반의 모바일 사용자 공간은 범용 Linux 배포판으로 교체한다. - 클라우드 작업에 필요한 프로그래밍 환경을 제공함 - 모바일 기기용 보호 기능을 제거하거나 조정할 수 있음 - 예를 들어 메모리 부족 시 애플리케이션을 종료하는 ‘Low Memory Killer’의 영향을 줄일 수 있음 - 컨테이너화된 애플리케이션을 Kubernetes로 관리해 25~50대 단위의 자기관리형 클러스터를 구성한다. ## 교육·연구용 저탄소 클라우드 - 대학에서 사용하는 Jupyter 환경, 과제 채점 시스템, 병렬 계산 수업용 애플리케이션 상당수는 스마트폰 한 대 또는 소규모 클러스터로 처리할 수 있다. - 일반적인 과제 채점 백엔드는 AWS t3.micro 수준인 2 vCPU·1GB 메모리 인스턴스에서도 실행된다. - 20대 스마트폰 클러스터를 이용한 실험에서: - 75명 이상 수강하는 수업의 최대 과제 제출량을 처리함 - 일반적인 AWS 백엔드보다 낮은 채점 지연 시간을 기록함 - 약 50초가 걸리는 CPU 집약적 행렬 곱셈 과제도 처리 가능했음 - 2,000대 규모의 클러스터는 약 50대의 서버에 해당하는 컴퓨팅 자원을 제공하고, 동시에 약 100개 수업을 지원할 수 있을 것으로 예상된다. - 2026년 가을 전체 시스템 운영을 시작할 계획이다. ## 대규모 운영에서 검증할 과제 - 소비자용 스마트폰 메인보드를 장기간 데이터센터 부하로 사용할 때의 신뢰성을 검증해야 한다. - 다수 기기의 장애를 감지하고 작업을 재분배하는 클러스터 관리가 중요하다. - 제한된 메모리와 이기종 코어 구조에 맞도록 애플리케이션을 설계해야 한다. - 이 프로젝트는 실제 교육·연구 서비스를 제공하는 동시에 스마트폰 기반 컴퓨팅의 확장성과 지속 가능성을 시험하는 테스트베드 역할을 한다. 사용이 끝난 스마트폰은 서버 전체를 대체하기보다는 교육, 과제 채점, 소규모 웹 서비스처럼 자원 요구량이 제한적인 작업에 재활용하는 것이 현실적이다. 특히 메인보드 재사용과 컨테이너·Kubernetes 기반 클러스터 관리를 결합하면 비용 절감과 제조 탄소 감축을 동시에 달성할 가능성이 있다.

원문 읽기(새 탭에서 열림)
google원문

차분 프라이버시 파티 (새 탭에서 열림)

구글 리서치는 대규모 데이터셋에서 개인정보를 보호하면서도 유용한 데이터를 추출할 수 있는 혁신적인 차분 프라이버시(Differential Privacy, DP) 파티션 선택 알고리즘인 'MAD(MaxAdaptiveDegree)'를 공개했습니다. 이 알고리즘은 수천억 개의 아이템이 포함된 방대한 데이터를 처리할 수 있는 병렬 구조를 갖추고 있으며, 기존 비적응형 방식보다 훨씬 더 많은 유효 데이터를 안전하게 식별해 냅니다. 이를 통해 연구자들은 개별 사용자의 민감한 정보를 노출하지 않으면서도 AI 모델 학습이나 데이터 분석에 필요한 고품질의 데이터셋을 확보할 수 있게 되었습니다. **차분 프라이버시(DP) 파티션 선택의 역할** * **개념 정의:** 수많은 사용자가 기여한 방대한 데이터 집합에서 특정 임계치 이상의 빈도를 가진 공통 아이템(예: 자주 사용되는 단어나 n-gram)을 안전하게 선택하는 프로세스입니다. * **프라이버시 보호:** 특정 개별 사용자의 데이터 포함 여부를 알 수 없도록 제어된 노이즈를 추가하며, 노이즈가 섞인 상태에서도 충분히 공통적인 아이템만 최종 리스트에 포함합니다. * **활용 분야:** 대규모 텍스트 코퍼스의 어휘 추출, 데이터 스트림 분석, 사용자 데이터 기반 히스토그램 생성, 프라이버시 보존형 모델 미세 조정(Fine-tuning)의 효율성 증대 등에 필수적입니다. **기존 가중치 산정 방식의 한계** * **표준 패러다임:** 일반적으로 '가중치 계산(빈도 측정) → 노이즈 추가(가우시안 노이즈 등) → 필터링(임계값 적용)'의 3단계를 거칩니다. * **가중치 낭비:** 기존의 비적응형 방식은 매우 인기 있는 아이템에 필요 이상의 가중치를 할당하는 경향이 있으며, 이로 인해 임계값 바로 아래에 있는 유용한 아이템들이 노이즈에 의해 삭제되는 문제가 발생합니다. * **확장성 문제:** 기존의 순차적(Sequential) 알고리즘은 현대의 거대 데이터셋을 처리하기에 속도가 너무 느려 실무 적용에 한계가 있었습니다. **적응형 가중치 재배분을 통한 MAD 알고리즘의 혁신** * **적응형 가중치(Adaptive Weighting):** MAD 알고리즘은 아이템 간의 가중치를 독립적으로 두지 않고, 다른 사용자의 기여도를 고려하여 전략적으로 가중치를 재할당합니다. * **효율적 재배분:** 임계값을 훨씬 상회하는 인기 아이템의 '과잉 가중치'를 식별하고, 이를 임계값 근처에 있는 아이템들에 재배분하여 더 많은 유효 아이템이 프라이버시 기준을 통과하도록 돕습니다. * **병렬 대규모 처리:** 수천억 개의 아이템을 동시에 처리할 수 있는 병렬 구조로 설계되어, 기존 순차 알고리즘 대비 최대 1,000배 더 큰 규모의 데이터셋까지 확장 가능합니다. * **성능 유지:** 가중치를 재배분하면서도 차분 프라이버시의 핵심인 '낮은 민감도(Low-sensitivity)'와 계산 효율성을 그대로 유지합니다. **실용적 의의 및 권고** 데이터 규모가 커질수록 프라이버시 보호와 데이터 유용성 사이의 균형을 맞추는 것이 어려워지지만, MAD 알고리즘은 병렬 처리를 통해 이 문제를 해결했습니다. 대규모 사용자 데이터를 다루는 연구자나 엔지니어는 구글이 오픈소스로 공개한 'DP 파티션 선택' 라이브러리를 활용하여, 데이터의 유실을 최소화하면서도 강력한 프라이버시 보증을 제공하는 데이터 파이프라인을 구축할 것을 권장합니다.