computer-vision

15 개의 포스트

netflix5분 읽기큐레이션 요약

더욱 정교하게 제어할 수 있는 AI 영상 편집을 향해: 넷플릭스의 초기 연구 탐색

넷플릭스는 AI가 영상 전체를 무분별하게 재생성하지 않고, 창작자가 지정한 부분만 정밀하게 수정해야 전문적인 영상 편집에 활용될 수 있다고 주장합니다. 이를 위해 편집 영역만 별도 레이어로 생성하는 Vera와, 객체를 제거한 뒤 물리적으로 자연스러운 장면을 복원하는 VOID를 제안했습니다. 두 연구의 목표는 원본 영상의 정체성·연기·배경을 보존하면서도 복잡한 편집 작업을 자동화해 창작자의 통제력을 높이는 것입니다. ## 전문 영상 편집에서 AI가 겪는 문제 - 기존 생성형 비디오 편집 모델은 수정 대상뿐 아니라 영상 전체의 픽셀을 다시 생성하는 경우가 많습니다. - 그 결과 다음과 같은 의도하지 않은 변화가 발생할 수 있습니다. - 인물의 얼굴이나 정체성 변화 - 배우의 연기와 동작 변형 - 배경, 소품, 장면의 세부 정보 훼손 - 객체 제거 모델은 대상 객체를 지우는 데 집중한 나머지, 객체가 장면의 물리적 상호작용에 미친 영향을 복원하지 못할 수 있습니다. - 그림자, 반사, 가려진 배경, 움직임의 연속성이 깨지면 객체를 제거한 결과가 부자연스럽게 보입니다. ## Vera: 편집 영역만 생성하는 레이어드 비디오 확산 모델 - Vera는 원본 영상 전체를 재생성하지 않고 다음 두 가지를 별도로 생성합니다. - **편집 레이어**: 새로 추가하거나 변경할 시각적 요소 - **알파 매트**: 편집 레이어가 적용될 영역을 나타내는 grayscale 마스크 - 생성된 레이어를 원본 영상과 합성하므로, 편집 영역 바깥의 원본 픽셀은 그대로 유지됩니다. - 텍스트 지시를 기반으로 다음과 같은 작업을 지원합니다. - 객체 추가 - 배경 변경 - 복잡한 장면의 시각적 요소 수정 - 이 방식은 원본 인물의 정체성, 연기, 카메라에 포착된 세부 사항을 보존하는 데 유리합니다. ## Vera의 학습 데이터 구축 - 기존 공개 데이터셋에는 깨끗한 입력 영상, 알파 매트, 편집 레이어, 합성 결과를 함께 제공하는 고품질 레이어드 데이터가 부족했습니다. - 넷플릭스는 오픈소스 영상, 자동 처리, 사람의 품질 검수를 결합해 총 **48만 6천 프레임**, 해상도 **832×480** 규모의 데이터셋을 구축했습니다. - 데이터는 세 단계로 구성됩니다. - **합성 영상** - 고품질 전경 알파 매트를 다양한 자동 생성 배경에 합성 - 객체 추가와 배경 변경을 위한 알파 매트 학습에 활용 - **현실적인 단일 객체 영상** - 분할, 매팅, 배경 인페인팅 또는 생성 과정을 적용 - 사람의 품질 검수를 거쳐 다양한 장면과 카메라 움직임을 확보 - **효과가 포함된 다중 객체 영상** - 개별 객체와 함께 그림자·반사 같은 시각 효과도 분리 - 복잡하고 동적인 장면에서의 합성 성능을 개선 ## Vera의 MoT 모델 구조 - Vera가 생성해야 하는 출력은 서로 다른 특성을 가집니다. - 편집 레이어 - 알파 매트 레이어 - 자연스러운 합성 영상 레이어 - 하나의 공유 아키텍처만 사용하면 데이터 효율이 떨어질 수 있어, Vera는 **Mixture-of-Transformers(MoT)** 구조를 사용합니다. - 하나의 DiT 대신 출력별로 세 개의 DiT를 둡니다. - 각 분기는 독립적인 QKV projection과 FFN 가중치를 유지합니다. - 세 분기의 토큰을 결합한 뒤 joint self-attention을 적용해 서로 간의 상호작용을 가능하게 합니다. - 각 분기는 전문성을 유지하면서 다른 레이어의 정보도 활용합니다. - 세 DiT는 동일한 사전 학습 T2V 모델에서 초기화됩니다. - 추가 입력 처리 방식은 다음과 같습니다. - 원본 영상 토큰은 합성 레이어 토큰에 더해집니다. - 선택적 마스크 영상 토큰은 노이즈가 포함된 알파 토큰에 더해집니다. - 모든 레이어는 동일한 RoPE를 공유하며, 알파·합성 토큰에는 레이어를 구분하도록 0으로 초기화된 학습 임베딩을 추가합니다. ## Vera의 평가와 결과 - 평가용 벤치마크는 다음으로 구성되었습니다. - 객체 추가 72개 - 배경 변경 69개 - 느리고 빠른 움직임, 다양한 카메라 움직임, 단일·다중 객체, 단순·복잡한 장면을 포함합니다. - 성능은 세 기준으로 평가했습니다. - **콘텐츠 보존**: 편집 대상 바깥 영역이 변하지 않았는지 픽셀 및 지각적 유사도로 측정 - **지시문 준수**: 텍스트 프롬프트를 얼마나 정확히 실행했는지 평가 - **영상 품질**: 시간적 일관성과 프레임별 공간 품질 측정 - Vera-1.3B와 Vera-14B는 기존 기준 모델보다 콘텐츠 보존 성능에서 크게 우수했습니다. - 동시에 가장 강력한 기존 모델들과 비슷한 수준의 영상 품질과 지시문 준수 성능을 유지했습니다. ## VOID: 물리적으로 자연스러운 객체 제거 - VOID는 영상에서 객체와 객체가 장면에 미친 상호작용을 함께 제거하는 비디오 인페인팅 모델입니다. - 단순히 객체 영역을 지우는 것이 아니라 다음 요소까지 장면에 맞게 복원하는 것을 목표로 합니다. - 객체 뒤에 가려져 있던 배경 - 객체가 만든 그림자와 반사 - 주변 물체와의 물리적 상호작용 - 시간에 따른 움직임과 장면 연속성 - 따라서 결과 영상은 객체가 처음부터 존재하지 않았던 것처럼 보이도록 설계됩니다. ## 창작자 통제력을 중심에 둔 연구 방향 - 넷플릭스는 AI가 창작자의 의도를 대체하기보다 창작 선택을 확장해야 한다는 원칙을 강조합니다. - 영상 편집 도구는 무엇을 바꿀지뿐 아니라 무엇을 절대 바꾸지 않을지도 통제할 수 있어야 합니다. - Vera는 변경 범위를 레이어 단위로 제한하고, VOID는 제거 후 장면의 물리적 일관성까지 고려함으로써 전문 편집 환경에 필요한 예측 가능성과 보존성을 높이려는 접근입니다. - 연구진은 두 모델의 알고리즘과 실험 결과를 논문으로 공개해 후속 연구와 발전을 촉진하려 합니다. 실무적으로는 영상 전체를 재생성하는 방식보다, 편집 영역·보존 영역·합성 결과를 분리하는 구조가 원본 훼손을 줄이고 편집 결과를 더 쉽게 검수할 수 있습니다. 특히 객체 제거 작업에서는 시각적 삭제뿐 아니라 그림자, 반사, 가려진 배경, 시간적 움직임까지 함께 처리해야 자연스러운 결과를 얻을 수 있습니다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

픽셀에서 계획으로: 자연 복원을 위한 지구 AI

고해상도 딥러닝과 위성·LiDAR 데이터를 활용하면 기존 산림 조사에서 놓치던 생울타리, 방풍림, 작은 숲과 같은 미세한 생태 요소를 정밀하게 지도화할 수 있다. Google Research는 영국 전역의 픽셀 기반 지도인 *Farmscapes 2020*을 생태적 의미를 가진 벡터 데이터로 변환해, 탄소 저장량과 생물다양성 관리에 직접 활용할 수 있는 인벤토리를 공개했다. 이는 농경지를 크게 전환하지 않고도 기후변화와 생태계 훼손에 대응하는 방법을 제시한다. ## 농업과 자연 복원의 충돌 - 인구 증가로 식량 생산을 위한 농경지가 필요하지만, 대규모 산림 조성은 농업용지와 경쟁할 수 있다. - 한 지역의 보전 활동이 다른 지역의 개발이나 훼손을 유발하는 ‘누출(leakage)’ 문제도 발생할 수 있다. - 생울타리, 방풍림, 작은 숲과 같은 세밀한 목본 구조물은 농작물 생산을 크게 방해하지 않으면서 다음과 같은 기능을 제공한다. - 탄소 저장 - 수질 정화 - 야생동물 서식지와 이동 통로 제공 - 농경지 생태계의 연결성 강화 - 그러나 이러한 요소는 규모가 작아 기존 국가 단위 산림 조사나 일반 위성 분석에서 산림으로 인식되지 않는 경우가 많다. ## 픽셀 지도에서 활용 가능한 벡터 데이터로 - 기존 *Farmscapes 2020*은 영국 전역의 미세한 목본 지형을 식별한 고해상도 래스터, 즉 픽셀 기반 지도였다. - 래스터 데이터는 탐지에는 유용하지만, 실제 복원 사업이나 탄소 회계에 활용하려면 개별 객체의 경계와 유형을 가진 벡터 데이터가 필요하다. - 새 벡터 데이터셋은 다음 요소를 개별 도형으로 표현한다. - 생울타리 - 돌담 - 작은 숲과 나무 군락 - 선형 목본 통로 - 이를 통해 토지 소유자와 보전 기관은 특정 생태 요소의 위치와 규모를 파악하고, 보호·확장 계획을 세울 수 있다. ## 복잡한 농촌 지형을 표현하는 기술적 과제 - 농촌의 지형 요소는 서로 독립적이지 않다. - 생울타리가 밭 경계를 따라 형성될 수 있다. - 돌담이 생울타리 아래에 겹쳐 있을 수 있다. - 단일 레이어 모델은 지표면의 경계와 그 위에 존재하는 나무·벽을 동시에 표현하기 어렵다. - 대규모 지도를 S2 셀 단위로 나누어 처리하면, 셀 경계에서 하나의 생울타리나 숲이 인위적으로 잘리는 문제가 생긴다. - 영국 전역 13만㎢ 이상에서 수백만 개의 목본 요소를 처리해야 하므로, 일반적인 래스터-벡터 변환 방식은 계산량과 저장 공간 측면에서 비효율적이다. ## 사전 학습된 AI로 적은 학습 데이터 보완 - 영국 농촌의 생울타리처럼 구체적인 지형 유형을 학습시키려면 전문적으로 주석 처리된 데이터가 필요하지만, 확보된 데이터는 약 247㎢에 불과했다. - 연구진은 3억 장 이상의 전 세계 위성 이미지를 학습한 Remote Sensing Foundations의 Vision Transformer(ViT) 백본을 활용했다. - 전 세계 지형의 질감과 공간 패턴을 미리 학습한 모델을 영국의 특정 경관에 맞게 미세 조정해, 적은 주석 데이터로도 높은 정밀도를 확보했다. - 이 방식은 특정 지역의 데이터가 부족한 경우에도 대규모 지리 공간 모델을 적용할 수 있게 한다. ## 이중 레이어와 셀 경계 병합 - 지표면과 지상 구조물을 분리해 표현하기 위해 두 종류의 데이터를 함께 사용했다. - 서브미터급 영상: 밭, 물, 토지 경계 등 지표면 정보 - 1미터 LiDAR: 나무와 돌담처럼 지표면 위에 있는 구조물 정보 - 이중 레이어 라벨링을 통해 같은 위치에서 지면의 용도와 그 위의 목본·인공 구조물을 동시에 파악했다. - S2 셀별로 나뉜 도형은 별도의 확장 가능한 병합 알고리즘으로 연결했다. - 그 결과 셀 경계에서 잘린 객체도 하나의 완전한 지형 요소로 복원할 수 있었다. ## 기하학으로 생태적 기능 분류 - AI가 식생을 탐지하는 것만으로는 작은 숲과 긴 생울타리를 구분하기 어렵다. - 연구진은 도형의 형태를 수치화하는 Polsby–Popper 조밀도(compactness) 점수를 사용했다. - 형태별 분류 기준은 다음과 같다. - **산림:** 지름 30m 이상의 크고 연속적인 수관 - **목본 패치:** 작은 숲, 나무 군락, 개별 나무 - **선형 목본 요소:** 길고 좁은 형태를 가지며 조밀도 점수가 0.5 미만인 생울타리·생태 통로 - 이 방법으로 단순한 ‘녹색 영역’이 아니라 야생동물 이동에 중요한 선형 통로를 별도로 추출할 수 있었다. ## Google Earth Engine을 통한 전국 규모 처리 - 수백만 개의 지형 객체를 한꺼번에 처리하기 위해 Google Earth Engine을 사용했다. - 수천 개의 S2 셀을 병렬 처리해 기존 시스템의 계산 한계를 우회했다. - 이를 통해 영국 전역의 개별 목본 요소를 벡터 도형으로 변환하고, 대규모 자연 복원에 사용할 수 있는 데이터셋을 구축했다. ## 향후 활용 가능성 - 고정밀 탐지 기술은 실바목축(silvopasture), 혼농임업(agrisilviculture) 같은 자연 기반 해법에서 세밀한 목본 요소의 탄소·생태 가치를 산정하는 데 활용될 수 있다. - 보전 사업 주변에서 발생하는 누출, 즉 사업 지역 밖에서 탄소 저장이나 생물다양성 손실이 발생하는 현상도 감시할 수 있다. - 공개 데이터는 농민, 과학자, 정책 입안자가 기존 농경지를 크게 훼손하지 않고 생울타리와 작은 숲을 보호·확장하는 데 도움을 줄 수 있다. 이 사례는 자연 복원이 반드시 대규모 산림 조성만을 의미하지 않으며, 농경지 곳곳의 작은 생태 요소를 정확히 측정하고 관리하는 것에서도 시작될 수 있음을 보여준다. 이를 실제 사업에 적용할 때는 벡터 데이터와 현장 조사, 탄소·생물다양성 지표를 함께 검증하는 것이 바람직하다.

원문 읽기(새 탭에서 열림)
toss5분 읽기큐레이션 요약

얼굴 인식의 역사와 페이스페이의 미래

얼굴인식은 1960년대 수작업 특징점 분석에서 출발해, PCA 기반 Eigenface와 LBP 같은 전통적 컴퓨터 비전 기술을 거쳐 딥러닝 기반 생체인증으로 발전했습니다. 대규모 데이터셋과 FaceNet·ArcFace 등의 학습 기법으로 인식 정확도가 인간 수준을 넘어섰고, 이제는 결제 서비스에도 적용되고 있습니다. 얼굴결제의 핵심 과제는 빠른 인식뿐 아니라 개인정보 보호, 위조 방지, 결제 오류 대응까지 함께 해결하는 것입니다. ## 수작업에서 시작된 얼굴인식 - 1960년대 Woodrow Wilson Bledsoe는 사진만으로 사람을 식별하는 비밀 프로젝트를 수행했습니다. - 연구원들이 눈 사이 거리, 코와 입술 사이 거리, 귀의 위치 등 얼굴 특징점의 좌표를 직접 기록했습니다. - 컴퓨터는 계산만 담당하고, 특징을 찾고 입력하는 작업은 사람이 수행했습니다. - 이 연구는 얼굴을 수치화해 비교한다는 초기 개념을 제시했지만, 당시에는 기밀로 분류되었습니다. ## 기계가 얼굴 특징을 찾기 시작하다 - 1973년 Takeo Kanade는 컴퓨터가 이미지에서 눈·코·입의 위치를 자동으로 검출하는 시스템을 발표했습니다. - 얼굴 요소 간의 기하학적 관계를 여러 파라미터로 추출해 사람의 수작업을 줄였습니다. - 얼굴 이미지에서 컴퓨터가 스스로 의미 있는 정보를 추출할 수 있다는 가능성을 열었습니다. ## Eigenface와 저차원 얼굴 표현 - 1991년 Matthew Turk와 Alex Pentland는 PCA를 활용한 Eigenface 방법을 제안했습니다. - 여러 얼굴 이미지의 평균 얼굴을 만든 뒤, 각 얼굴이 평균에서 얼마나 벗어나는지 분석했습니다. - 얼굴을 여러 Eigenface의 조합과 가중치로 표현해 비교했습니다. - 두 얼굴의 조합 비율이 비슷하면 동일 인물일 가능성이 높다고 판단합니다. - 고차원 이미지 데이터를 비교적 작은 수의 수학적 요소로 압축했다는 점에서 중요한 전환점이었습니다. ## 조명 문제와 전통적 특징 추출 - 같은 사람도 조명, 그림자, 촬영 장소에 따라 매우 다르게 보이는 문제가 있었습니다. - 얼굴 전체를 비교하는 대신 작은 영역의 질감과 패턴을 분석하는 국소 특징 기반 방법이 발전했습니다. - LBP(Local Binary Pattern)는 각 픽셀을 주변 픽셀과 비교해 밝고 어두운 관계를 이진 코드로 표현합니다. - 절대적인 밝기보다 얼굴의 질감에 집중해 조명 변화에 상대적으로 강한 특징을 얻었습니다. - SVM은 특징 공간에서 사람을 구분하는 경계면을 찾았고, AdaBoost는 여러 약한 분류기를 결합해 성능을 높였습니다. - 다만 특징을 어떤 방식으로 추출할지는 여전히 사람이 설계해야 했습니다. ## 딥러닝이 정확도를 끌어올리다 - 2014년 Facebook의 DeepFace는 LFW 데이터셋에서 97.35%의 정확도를 기록해 인간 수준에 근접했습니다. - 심층 신경망이 대규모 얼굴 이미지에서 사람이 직접 설계하지 않은 특징을 학습했습니다. - Google FaceNet은 Triplet Loss를 사용해 LFW에서 99.63%의 정확도를 달성했습니다. - 이후 SphereFace, CosFace, ArcFace 등이 얼굴 특징을 더 잘 분리하는 학습 방식을 제안했습니다. - 연구의 초점은 얼굴인식의 가능성 검증에서 더 높은 정확도와 안정성 확보로 이동했습니다. ## 대규모 데이터셋의 역할 - 딥러닝 모델의 성능은 데이터의 양과 다양성, 품질에 크게 좌우됩니다. - FERET은 1,199명, 14,126장의 이미지로 구성되어 얼굴인식 알고리즘을 객관적으로 비교할 기반을 마련했습니다. - LFW는 인터넷에서 수집한 5,749명, 13,233장의 사진으로 조명·각도·표정이 다양한 실제 환경을 반영했습니다. - VGGFace는 2,600명, 약 270만 장의 이미지로 딥러닝 시대의 데이터 규모 확대를 보여주었습니다. - MS-Celeb-1M은 대규모 데이터 구축의 가능성을 보였지만 개인정보 보호 문제로 공식 배포가 중단되었습니다. - WebFace260M은 2억 6천만 장의 원본 이미지에서 노이즈를 정제해 약 200만 명, 4,200만 장 규모의 데이터셋을 구축했습니다. - 데이터 규모뿐 아니라 잘못된 라벨과 중복·노이즈를 제거하는 정제 과정도 중요합니다. ## 얼굴이 결제 수단이 되다 - 얼굴인식은 스마트폰 잠금 해제, 출입국 심사, 출입 통제 등을 넘어 결제 영역으로 확장되었습니다. - 결제는 단순 인증보다 높은 보안성과 낮은 오인식률이 필요합니다. - 토스 페이스페이는 2025년 9월 한국에서 얼굴 결제 서비스를 시작했습니다. - 결제 수단은 동전·지폐·카드·스마트폰을 거쳐, 아무것도 소지하지 않는 방향으로 발전하고 있습니다. - 얼굴은 항상 지니고 있고, 손을 자유롭게 사용할 수 있으며, 지갑이나 앱을 꺼내는 과정이 없어 빠릅니다. ## 페이스페이의 결제 처리 흐름 - 단말기 카메라가 사용자의 얼굴을 촬영하고 등록된 고객인지 식별합니다. - 등록된 수백만 명 중에서 사용자를 빠르게 검색해야 하며, 미등록 사용자나 유사 얼굴에 대해서는 결제를 거부하거나 추가 인증을 요구할 수 있습니다. - 식별된 사용자에게 등록된 신용카드·체크카드 등 결제 수단을 연결합니다. - 사용자가 결제 수단을 직접 선택하도록 구성할 수도 있습니다. - 이후 기존 카드 결제처럼 승인 요청과 결제 완료 절차가 진행됩니다. ## Edge와 Cloud를 결합한 시스템 설계 - 단말기에서 처리하면 네트워크 지연이 적고 원본 이미지가 외부로 전송되지 않아 프라이버시에 유리합니다. - 반면 단말기의 하드웨어 제약으로 모델 크기와 정확도에 한계가 있고, 모델 업데이트와 고객 정보 동기화가 어렵습니다. - 서버에서 처리하면 강력한 GPU와 최신 모델을 사용할 수 있으며, 중앙에서 모델과 로그를 관리하기 쉽습니다. - 대신 이미지 전송 지연과 서버 통신 보안 문제가 발생합니다. - 페이스페이는 단말기에서 초기 처리를 수행한 뒤 서버에서 얼굴 특징 추출·인식·결제를 진행하는 혼합 구조를 사용합니다. - 이를 통해 단말기 처리의 속도와 서버 처리의 정확성·관리 편의성을 함께 확보합니다. ## 다층적인 개인정보 보호와 보안 - 단말기와 서버 간 통신은 TLS로 암호화하고, 이미지 자체에도 AES-256 암호화를 적용합니다. - Matrix Projection 기반의 취소 가능한 생체인증을 사용해 동일한 얼굴도 키에 따라 다른 벡터로 변환합니다. - 생체 벡터가 유출되더라도 키를 변경해 새로운 벡터를 발급할 수 있어 비밀번호 변경과 유사한 대응이 가능합니다. - 저장된 특징 정보는 원본 얼굴 이미지와 직접 대응하지 않으며, 해당 정보만으로 얼굴을 복원하기 어렵게 설계됩니다. - 생체정보 접근 권한을 제한하고 모든 접근을 기록·관리합니다. - 개인정보보호위원회의 사전 적정성 검토와 부정 결제 전액 보상 제도 등 기술 외 제도적 보호장치도 함께 활용합니다. ## 실용적인 결론 얼굴결제는 편리함만으로 완성되는 기술이 아니라, 정확한 얼굴인식 모델과 대규모·정제 데이터, Edge-Cloud 분산 구조, 암호화와 취소 가능한 생체인증, 제도적 보상 체계가 함께 작동해야 합니다. 사용자는 편리성을 누리되, 등록·이용 전 개인정보 처리 방식과 부정 결제 보상 정책, 추가 인증 수단을 확인하는 것이 좋습니다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

스마트폰 카메라를 활용한 수동적 심장 건강 모니터링을 향하여

스마트폰 전면 카메라로 일상적인 얼굴 영상을 촬영해 심박수(HR)와 안정시 심박수(RHR)를 수동 개입 없이 추정하는 연구 시스템 PHRM이 소개되었습니다. PHRM은 8초 영상과 딥러닝을 활용해 심전도(ECG) 대비 HR 오차 10% 미만을 달성했고, 하루 단위 RHR도 웨어러블 수준의 정확도로 추정했습니다. 특히 다양한 피부색을 포함한 대규모 데이터로 학습해 피부색에 따른 성능 격차를 줄인 점이 핵심입니다. ## 스마트폰을 활용한 수동 심박 모니터링 - 심박수는 활동량, 스트레스, 질병 등 생리 상태를 반영하는 주요 생체 지표입니다. - 안정시 심박수는 심혈관 건강과 장기적인 건강 위험을 나타내며, 높은 RHR이나 장기적 상승은 심혈관 질환 및 사망 위험 증가와 관련됩니다. - PHRM은 얼굴 잠금 해제 직후 전면 카메라로 약 8초간 얼굴 영상을 촬영합니다. - 사용자가 별도로 손가락을 카메라에 대거나 측정을 시작하지 않아도 일상적인 스마트폰 사용 중 데이터를 수집합니다. - 스마트폰은 전 세계 약 50억 명이 사용하는 기기이므로 웨어러블 접근성이 낮은 환경에서 건강 모니터링을 확대할 가능성이 있습니다. ## 카메라 기반 PPG와 PHRM 기술 - PHRM은 광용적맥파(PPG) 원리를 사용합니다. - 혈액이 맥박에 따라 흐를 때 피부와 빛의 상호작용이 변하는 현상을 카메라로 감지합니다. - 얼굴 영상에서 심박 신호를 추출하는 원격 PPG(rPPG) 모델을 적용합니다. - 기기 내에서 실행 가능한 효율적인 시계열 이동 합성곱 신경망을 사용해 HR과 예측 신뢰도 점수를 계산합니다. - 하루 동안 얻은 여러 HR 측정값을 신뢰도 점수와 칼만 필터로 통합해 일일 RHR을 추정합니다. - 웨어러블처럼 지속적으로 착용해야 하는 센서가 아니라 스마트폰 사용 순간에 자연스럽게 측정하는 방식입니다. ## 피부색 다양성을 고려한 모델 설계 - 기존 rPPG 연구는 소규모·통제된 환경에 치우쳤고, 어두운 피부를 가진 참가자가 충분히 포함되지 않았습니다. - 멜라닌은 카메라가 PPG 신호를 감지하기 어렵게 만들 수 있어 피부색별 정확도 격차가 발생할 수 있습니다. - PHRM은 약 700명의 참가자로부터 35만 개 이상의 영상 클립을 수집했습니다. - 피부색 분포를 Monk Skin Tone 기준으로 설계했습니다. - 밝은 피부 그룹: 최소 25% - 중간 피부 그룹: 최소 25% - 어두운 피부 그룹: 최소 33% - 가장 측정이 어려운 사례에 더 많은 학습을 할당했습니다. - 피부색 그룹별 HR MAPE 차이가 5%포인트 미만이어야 한다는 비열등성 기준을 설정했습니다. ## 실험실 검증 결과 - 365명의 다양한 참가자로부터 조명과 활동 상태가 다른 환경에서 얼굴 영상과 ECG를 동시에 수집해 학습했습니다. - 별도의 104명 테스트 세트에서 최소 신뢰도 기준을 적용한 뒤 모든 피부색 그룹에서 MAPE 10% 미만을 기록했습니다. - 같은 데이터에서 비교한 15개 주요 rPPG 모델보다 우수한 성능을 보였습니다. - 모든 피부색 그룹에서 MAPE 10% 미만을 달성한 모델은 PHRM뿐이었습니다. - 신뢰도 점수가 낮은 측정값을 제외하는 confidence gating이 정확도 개선에 기여했습니다. ## 실제 생활 환경에서의 검증 - 231명이 개인 스마트폰에 연구 앱을 설치하고 8일 동안 평소처럼 사용했습니다. - 참가자들은 ECG 흉부 스트랩과 Fitbit Charge 6를 함께 착용해 비교 기준 데이터를 제공했습니다. - 얼굴 잠금 해제 직후 하루 평균 231개의 8초 영상 클립을 수집했습니다. - 참가자는 매일 영상 내용을 검토한 뒤 서버 업로드를 명시적으로 승인했습니다. - 민감한 장면이나 다른 사람의 얼굴이 포함된 영상은 제외할 수 있었습니다. - 데이터는 암호화된 보안 서버에 업로드되었습니다. - 별도로 확보한 101명 검증 세트에서 신뢰도 필터 적용 후 전체 MAPE는 6.09%였습니다. - 밝은 피부 그룹: 5.04% - 중간 피부 그룹: 5.12% - 어두운 피부 그룹: 7.84% - ECG 대비 평균적으로 HR을 0.64bpm 낮게 추정했으며, 95% 일치 한계는 -11.3~10.3bpm이었습니다. - 실제 생활 환경에서도 기존 15개 rPPG 모델보다 크게 우수했고, 모든 피부색 그룹에서 MAPE 10% 미만을 유지했습니다. ## 일일 안정시 심박수 추정 - PHRM은 하루 중 여러 번 측정한 심박수를 단순 평균하지 않고 신뢰도와 시간적 변동을 함께 고려합니다. - 칼만 필터를 사용해 잡음이 있는 개별 측정값을 통합하고 하루의 RHR을 추정합니다. - 연구 결과 일일 RHR 추정 정확도는 웨어러블 추적기와 비교해 평균 절대 오차(MAE) 5bpm 미만으로, 웨어러블 수준에 해당했습니다. - 따라서 스마트폰 사용만으로 장기적인 심박 변화와 건강 추세를 관찰할 가능성을 보여줍니다. ## 연구 데이터와 남은 과제 - 연구진은 지금까지 공개된 스마트폰 영상 기반 rPPG 데이터셋 중 가장 크고 다양한 데이터셋을 공개했습니다. - 자격을 갖춘 연구자는 데이터셋과 사전 학습 모델인 ‘PHRM-mini’에 접근을 신청할 수 있습니다. - 다만 연구 시스템은 스마트폰 전면 카메라가 얼굴을 안정적으로 촬영할 수 있어야 하며, 조명·움직임·카메라 성능에 따라 결과가 달라질 수 있습니다. - PHRM은 연구용 시스템이므로 질병 진단이나 응급 판단을 대신하는 의료기기로 사용해서는 안 됩니다. 스마트폰 카메라 기반 PHRM은 웨어러블이 없어도 심박수와 RHR을 수동적으로 추적할 수 있는 현실적인 접근입니다. 특히 피부색 다양성을 반영한 학습과 실제 생활 환경 검증이 강점이며, 향후에는 개인정보 보호, 배터리·성능 부담, 다양한 기기에서의 일관성 검증이 상용화의 핵심 과제가 될 것입니다.

원문 읽기(새 탭에서 열림)
figma3분 읽기큐레이션 요약

소프트웨어와 상호작용하는 방식을 재구상하는 6가지 디자인 | Figma 블로그

이번 Figma Make-a-thon 수상작들은 소프트웨어가 단순히 효율을 높이는 도구를 넘어, 사람들의 연결·놀이·창작 방식을 새롭게 설계할 수 있음을 보여준다. 공통적으로 기존의 익숙한 상호작용을 비틀고, 제약과 감각적 경험을 활용해 더 인간적인 디지털 경험을 만든다. 특히 Figma Make는 전문 개발 지식이 부족한 사람도 아이디어를 빠르게 프로토타입으로 구현하도록 돕는 도구로 소개된다. ## 소프트웨어 상호작용을 다시 상상한 Make-a-thon - Figma Make-a-thon은 핀치 줌, 좋아요 탭, 오른쪽 스와이프처럼 일상화된 상호작용의 다음 가능성을 탐구했다. - 수상작에는 총 10만 달러의 상금이 수여됐다. - 작품들은 새로운 기능보다 사람 사이의 연결, 놀이, 창의성, 장인정신에 초점을 맞춘다. - 얼굴 움직임으로 인터페이스를 조작하거나, 16비트 세계를 구현하는 등 익숙한 소프트웨어 사용 방식을 확장한다. ## 낯선 사람과 함께 만드는 자수 캔버스 **수상 부문: Best Overall — Common Thread** - 전통적인 자수 견본천(sampler)에서 영감을 얻은 멀티플레이어 디지털 캔버스다. - 사용자는 실의 색상과 스티치 유형을 선택해 공동 캔버스에 자신의 흔적을 남긴다. - 한 사람의 작업물이 아니라 여러 방문자가 이어서 완성하는 구조이며, 캔버스의 제한된 공간 자체가 중요한 경험이 된다. - 10만 개가 넘는 스티치가 쌓였으며, 작품은 완성되지 않은 채 계속 확장된다. - 제작자는 기능 목록보다 먼저 “어떤 느낌의 경험을 만들 것인가”를 설명하고, Figma Make로 구조를 만든 뒤 시각 디자인을 덧입히는 방식을 추천한다. - 실시간 협업과 인터랙티브 캔버스 기능을 개발 지식 없이 하루 만에 구현했다는 점도 강조된다. - 핵심 메시지는 속도와 규모를 중시하는 디지털 환경에서, 제한과 느린 공동 작업이 오히려 의미 있는 상호작용을 만든다는 것이다. ## 클릭 대신 입술 움직임으로 조작하기 **수상 부문: New Interaction — Pucker** - 손을 사용할 수 없거나 음성 명령을 원하지 않는 상황을 위해 얼굴 움직임을 입력 방식으로 활용한다. - 고개를 기울여 커서를 움직이고, 일정 시간 멈춰 항목을 선택하며, 입술을 오므리는 동작으로 선택을 확정한다. - 뜨개질, 요리, 베이킹, 디자인처럼 손이 바쁜 상황에서도 화면을 조작할 수 있다. - 전면 카메라로 실시간 추적하지만, 데이터는 저장하거나 전송하지 않는 방식으로 설계됐다. - 제작자는 기본적인 코드 구조를 이해하면 프로토타입을 수정하고 문제를 해결하는 데 큰 도움이 된다고 조언한다. - Pucker는 특정 제품이라기보다 여러 앱과 플랫폼에 적용할 수 있는 “유연한 인터랙션 레이어”로 제시된다. - 새로운 상호작용이 충분히 자연스러워지면 사용자가 의식하지 않고도 사용할 수 있으며, 이것이 접근성 높은 디자인으로 이어질 수 있다는 관점을 담고 있다. ## 시간과 공간의 제약을 없앤 사진 부스 **수상 부문: Reimagining Iconic Interactions — Duet Booth** - 1920년대부터 크게 변하지 않은 사진 부스의 개념을 원격 환경으로 확장한다. - 서로 다른 장소에 있는 두 사람이 비동기적으로 사진을 촬영할 수 있다. - 각자의 사진을 하나의 사진 스트립으로 결합해, 마치 두 사람이 같은 장소에 함께 있었던 것처럼 보여준다. - 사진 부스가 사진을 더 쉽고 즉각적이며 공유 가능한 경험으로 만들었다는 점을 디지털 공간에서 재해석한다. - 제작자는 시각적 세부 사항보다 핵심 상호작용을 먼저 완성하라고 조언한다. 기본 경험이 제대로 작동하면 이후의 디자인 요소가 이를 중심으로 정리되기 때문이다. 이 사례들이 보여주는 실용적인 방향은 기능을 많이 추가하는 것보다 사용자가 어떤 감정과 행동을 경험할지 먼저 정의하는 것이다. 그 후 핵심 상호작용을 빠르게 프로토타이핑하고, 시각 디자인과 세부 기능을 단계적으로 보완하면 제한된 시간과 개발 지식으로도 독창적인 소프트웨어 경험을 만들 수 있다.

원문 읽기(새 탭에서 열림)
google원문

현대 세계 매핑하기: S2Vec이 우리 도시의 언어를 학습하는 방법 (새 탭에서 열림)

Google Research가 발표한 S2Vec은 도로, 건물, 인프라와 같은 인위적 환경(Built Environment)의 복잡한 데이터를 범용적인 임베딩으로 변환하는 자기지도 학습(Self-supervised) 프레임워크입니다. 이 모델은 지리 공간 데이터를 컴퓨터 비전 모델이 이해할 수 있는 래스터(Raster) 이미지 형태로 변환하고 마스크 오토인코딩(MAE) 기법을 적용하여, 수동 레이블링 없이도 전 세계의 사회경제적 및 환경적 패턴을 정밀하게 예측합니다. 결과적으로 S2Vec은 미학습 지역에 대한 지리적 적응력에서 뛰어난 성능을 보이며, 위성 이미지 데이터와 결합했을 때 더욱 강력한 지리 공간 지능을 제공합니다. ### 지리 공간 데이터의 래스터화와 S2 기하학 활용 * **데이터 구조화의 어려움 해결:** 도시 블록은 수백 개의 데이터 포인트를 갖는 반면 농촌은 거의 없는 등 데이터의 밀도 편차가 크다는 문제를 해결하기 위해 S2 Geometry 라이브러리를 사용합니다. * **계층적 셀 분할:** 지구 표면을 계층적인 셀로 나누어 국가 단위부터 수 평방미터 단위까지 다양한 해상도로 데이터를 효율적으로 조회하고 관리합니다. * **특징 래스터화(Feature Rasterization):** 각 S2 셀 내의 건물이나 도로 유형을 계산하여 다층 이미지 형태로 재구성합니다. 예를 들어 특정 셀의 커피숍과 공원 수를 이미지의 '색상' 채널처럼 처리함으로써 성숙한 컴퓨터 비전 기술을 지리 데이터 분석에 그대로 적용할 수 있게 합니다. ### 마스크 오토인코딩(MAE)을 통한 자기지도 학습 * **레이블링 병목 현상 제거:** 전 지구적 데이터를 수동으로 태깅하는 것은 불가능하므로, 데이터의 일부를 가리고(Masking) 주변 맥락을 통해 이를 재구성하도록 학습시키는 MAE 기법을 도입했습니다. * **문맥 논리 학습:** 고층 아파트와 지하철역이 있는 곳에는 식료품점이 있을 가능성이 높다는 식의 도시 구성 요소 간 상관관계를 모델 스스로 파악합니다. * **범용 임베딩 생성:** 수백만 번의 학습 과정을 통해 특정 위치의 고유한 특성을 수학적 수치(임베딩)로 압축하며, 이는 별도의 추가 학습 없이도 다양한 분석 작업에 활용될 수 있습니다. ### 사회경제적 예측 성능 및 다중 모달 융합 * **우수한 지리적 적응성(Extrapolation):** 학습 데이터에 포함되지 않은 새로운 지역의 인구 밀도나 가구 소득 중앙값을 예측하는 제로샷(Zero-shot) 과제에서 기존 이미지 기반 모델들보다 뛰어난 성능을 입증했습니다. * **다중 모달 융합(Multimodal Fusion):** S2Vec의 인위적 환경 데이터와 위성 이미지 임베딩(RS-MaMMUT 등)을 결합했을 때 가장 높은 성능을 기록했습니다. * **환경 지표의 한계:** 탄소 배출량 예측에는 효과적이었으나, 수목 피복도(Tree cover)나 고도와 같은 자연 환경 요소 예측에는 건물 수 중심의 데이터만으로는 한계가 있어 위성 이미지와의 결합이 필수적임을 확인했습니다. S2Vec은 지리 공간 AI가 수동으로 제작된 니치 모델에서 벗어나 확장 가능한 파운데이션 모델로 나아가는 중요한 단계입니다. 도시 계획가나 연구자들은 이 임베딩을 활용해 인프라 변화가 지역 사회의 보건이나 경제에 미치는 영향을 전 지구적 규모에서 더욱 정확하게 분석할 수 있을 것으로 기대됩니다. 구체적인 환경 분석이 필요한 경우, S2Vec 단독 사용보다는 위성 이미지 모델과 결합하여 데이터의 상호보완성을 극대화하는 방식을 추천합니다.

toss원문

토스의 AI 기술력, 세계 최고 권위 NeurIPS 2025에서 인정받다: FedLPA 연구 (새 탭에서 열림)

토스는 데이터 주권 문제를 해결하면서도 미지의 데이터를 효과적으로 학습할 수 있는 새로운 연합학습 알고리즘 'FedLPA'를 개발하여 세계 최고 권위의 AI 학회인 NeurIPS 2025에 게재했습니다. 이 기술은 국가별로 상이하고 라벨이 부족한 현실 세계의 데이터 분포를 클라이언트 스스로 파악하여 모델을 최적화함으로써, 개인정보를 보호하는 동시에 글로벌 서비스의 정확도를 획기적으로 높입니다. 이를 통해 토스는 규제 리스크 없는 글로벌 진출과 초개인화된 금융 서비스 제공을 위한 독보적인 기술적 토대를 마련했습니다. ### 연합학습의 도입 배경과 기존 기술의 한계 - **데이터 주권과 보안**: '페이스페이'와 같은 서비스가 해외에 진출할 때, 현지 법령에 따라 생체 데이터를 국외로 반출할 수 없는 문제를 해결하기 위해 데이터를 서버로 모으지 않고 기기 내에서 학습하는 연합학습(Federated Learning)이 필수적입니다. - **데이터 불균형(Non-IID)**: 기존 연합학습은 모든 사용자의 데이터 분포가 유사하다고 가정하지만, 실제로는 국가나 지역별로 얼굴형, 조명, 결제 패턴 등이 판이하게 달라 성능이 저하되는 한계가 있습니다. - **미지 범주 대응 불가**: 서비스 운영 중 발생하는 새로운 인종적 특성이나 신종 부정 결제 패턴(Novel Class)을 기존 기술은 '알고 있는 범주'로만 분류하려다 보니 새로운 변화에 유연하게 대응하지 못했습니다. ### FedLPA의 3단계 혁신 파이프라인 - **신뢰도 기반 로컬 구조 발견(CLSD)**: 단순히 이미지 특징을 비교하는 수준을 넘어, 모델이 확신하는 데이터(High-confidence)의 예측 결과를 활용해 데이터 간의 유사도 그래프를 정교하게 구축하고 정제합니다. - **인포맵 클러스터링(InfoMap)**: 사람이 범주의 개수를 미리 정해주지 않아도, 그래프 내에서 데이터들이 자연스럽게 뭉치는 커뮤니티를 찾아내는 알고리즘을 통해 클라이언트가 스스로 데이터 내의 범주 개수를 파악합니다. - **로컬 사전 확률 정렬(LPA)**: 모델의 예측 결과 분포가 앞서 파악한 실제 데이터의 분포(Empirical Prior)와 일치하도록 강제하는 정규화 과정을 거칩니다. 이를 통해 특정 클래스에 데이터가 쏠려 있어도 모델이 편향되지 않고 균형 잡힌 학습을 수행할 수 있습니다. ### 기술 도입에 따른 비즈니스 기대 효과 - **글로벌 진출 가속화**: 각국의 금융 및 개인정보 규제를 준수하면서도 현지 데이터를 활용한 고성능 모델을 구축할 수 있어, 기술적 진입 장벽 없이 동남아나 유럽 등 글로벌 시장에 빠르게 안착할 수 있습니다. - **초개인화 금융 서비스**: 개별 사용자의 로컬 환경과 특이 패턴을 실시간으로 학습하여, 이상거래탐지(FDS)의 정확도를 높이고 국가별 특수성을 반영한 정교한 신용평가(CSS) 모델을 운영할 수 있습니다. - **운영 효율 극대화**: 새로운 유형의 데이터가 등장할 때마다 사람이 직접 라벨링하고 재학습시키는 과정을 줄여주며, AI가 스스로 새로운 패턴을 감지하고 학습하므로 모델 업데이트 주기와 운영 비용을 획기적으로 단축합니다. FedLPA는 데이터 보안과 모델 성능이라는 상충하는 목표를 동시에 달성함으로써 AI 기술의 실질적인 비즈니스 적용 가능성을 입증했습니다. 데이터 규제가 엄격한 글로벌 환경이나 사용자마다 데이터 특성이 극명하게 다른 금융 도메인에서 AI 서비스를 운영하고자 한다면, FedLPA와 같은 자가 학습 기반의 연합학습 구조를 적극적으로 검토할 것을 권장합니다.

google원문

산림 파괴 없는 공급망 (새 탭에서 열림)

구글 딥마인드와 구글 리서치 팀이 개발한 'Natural Forests of the World 2020'은 AI를 활용해 천연림과 인공 조림지를 10미터 해상도로 정밀하게 구분해내는 새로운 지도 데이터셋입니다. 이 프로젝트는 단순한 '수목 피복(tree cover)' 데이터가 가졌던 한계를 극복하고, 생물 다양성이 풍부한 천연 생태계를 상업용 식재지와 구분함으로써 글로벌 공급망의 탈산림화 목표 달성을 돕습니다. 92.2%의 높은 정확도를 기록한 이 데이터는 EU 산림전용방지법(EUDR) 등 엄격해지는 국제 환경 규제에 대응하기 위한 핵심적인 기준점(Baseline)을 제시합니다. **기존 산림 지도의 한계와 구분 필요성** * 기존의 위성 기반 지도는 모든 목본 식생을 단순히 '수목 피복'으로 분류하여, 수백 년 된 천연 생태계와 단기 수익형 식재 공간을 구분하지 못하는 '사과와 오렌지의 비교' 오류를 범해왔습니다. * 유럽연합의 산림전용방지법(EUDR)은 2020년 12월 31일 이후 산림이 파괴되거나 황폐화된 토지에서 생산된 커피, 카카오, 고무 등의 제품 판매를 금지하고 있어, 2020년 시점의 정확한 천연림 기준 지도가 필수적입니다. * 천연림은 탄소 흡수, 강수량 조절, 홍수 완화 등 기후 안정화와 생물 종 보호 측면에서 인공림이 대체할 수 없는 고유한 가치를 지닙니다. **MTSViT 모델을 활용한 AI 분석 기술** * 구글은 '다중 모드 시공간 비전 트랜스포머(MTSViT)' 모델을 개발하여, 단일 시점의 위성 이미지가 아닌 시간의 흐름에 따른 변화를 분석하도록 설계했습니다. * 이 모델은 센티넬-2(Sentinel-2) 위성의 시계열 이미지와 고도, 경사 등 지형 데이터, 지리적 좌표를 결합하여 분석합니다. * AI는 1280x1280미터 패치 단위를 관찰하며 각 10x10미터 픽셀이 천연림일 확률을 계산하며, 이를 통해 복잡한 천연림과 균일하고 빠르게 자라는 상업용 식재지의 질감 및 계절적 특성을 식별합니다. **데이터 생성 및 검증 과정** * 전 세계 120만 개 이상의 패치(1280x1280m)를 샘플링하여 대규모 다중 소스 학습 데이터셋을 구축하고 MTSViT 모델을 훈련시켰습니다. * 훈련된 모델을 지구 전체 육지에 적용하여 전 세계적으로 일관된 10미터 해상도의 천연림 확률 지도를 생성했습니다. * 독립적인 글로벌 산림 관리 데이터셋을 2020년 기준으로 업데이트하여 검증한 결과, 92.2%라는 업계 최고 수준의 정확도를 입증했으며 관련 연구는 '네이처 사이언티픽 데이터(Nature Scientific Data)'에 게재되었습니다. 이 데이터셋은 구글 어스 엔진(Earth Engine) 등을 통해 공개되어 있으며, 기업은 공급망 실사를, 정부는 산림 파괴 모니터링을, 보존 단체는 보호 구역 설정 등을 수행할 때 실질적인 기술적 토대로 활용할 수 있습니다.

google원문

StreetReaderAI: 문맥 인식 (새 탭에서 열림)

StreetReaderAI는 구글 리서치에서 개발한 시각장애인 및 저시력자를 위한 혁신적인 스트리트 뷰 프로토타입으로, 멀티모달 AI인 Gemini를 활용해 시각적 정보를 실시간 음성 정보로 변환합니다. 기존 지도 서비스가 제공하지 못했던 스트리트 뷰 이미지의 맥락과 지리적 특성을 실시간 대화형 인터페이스로 설명함으로써, 시각장애인이 가상 세계를 자유롭게 탐색하고 실제 경로를 미리 파악할 수 있도록 돕는 것이 이 기술의 핵심입니다. **사용자 중심의 직관적 내비게이션** * 키보드 화살표 키나 음성 명령을 사용하여 게임을 하듯 가상 공간 내 시점 전환 및 이동이 가능합니다. * 사용자가 시점을 회전할 때마다 현재 방위(예: "북동쪽을 보고 있습니다")와 정면에 랜드마크나 장소가 있는지를 음성으로 즉각 피드백합니다. * "가상 걸음(Virtual steps)" 기능을 통해 앞뒤로 이동하며 이동 거리와 도로 정보, 주변 상점 및 시설물에 대한 정보를 실시간으로 수신할 수 있습니다. **AI 디스크라이버(AI Describer)를 통한 상황별 맥락 인식** * 단순한 이미지 분석을 넘어 사용자의 위도·경도, 도로 데이터, 현재 시야의 스트리트 뷰 이미지를 결합해 맞춤형 설명을 생성합니다. * 보행 안전과 내비게이션 정보에 집중하는 '기본 모드'와 지역의 역사적·건축적 배경을 상세히 설명하는 '투어 가이드 모드'를 제공합니다. * 사용자가 현재 장면에서 궁금해할 만한 후속 질문(예: "저 건물의 입구는 어디인가요?")을 AI가 스스로 예측하여 제안함으로써 탐색의 효율성을 높였습니다. **AI 채팅과 강력한 세션 메모리 기능** * Gemini Multimodal Live API를 활용하여 사용자와 실시간 대화가 가능하며, 사용자의 질문에 맞춰 시각적 정보를 해석합니다. * 약 100만 토큰 이상의 긴 컨텍스트 윈도우를 활용해 사용자가 세션 동안 탐색한 모든 경로와 이미지를 기억합니다. * 이를 통해 "방금 지나온 버스 정류장에 벤치가 있었니?" 또는 "아까 본 편의점에서 여기까지 얼마나 떨어져 있어?"와 같은 과거의 맥락이 포함된 복합적인 질문에 정확히 답변할 수 있습니다. **사용자 평가 및 실무적 시사점** 11명의 시각장애인을 대상으로 한 연구 결과, 사용자들은 StreetReaderAI를 통해 목적지의 지형지물을 미리 확인하고 보행 경로를 계획하는 데 큰 도움을 얻었습니다. 이 기술은 수조 개의 스트리트 뷰 이미지를 텍스트 기반의 데이터로 변환할 필요 없이, 필요할 때마다 실시간으로 AI가 해석해 준다는 점에서 확장성이 매우 높습니다. 향후 이와 같은 멀티모달 AI 기술이 지도 앱에 통합된다면 시각장애인의 이동권과 정보 접근성을 획기적으로 개선할 수 있을 것입니다.

google원문

Snapseed의 대화형 온 (새 탭에서 열림)

Google은 Snapseed의 새로운 '개체 브러시(Object Brush)' 기능을 통해 모바일 기기에서도 전문가 수준의 정교한 이미지 선택 및 편집을 가능하게 하는 실시간 온디바이스 세분화(Segmentation) 기술을 도입했습니다. 이 기술은 사용자의 간단한 터치나 선 그리기만으로 20ms 이내에 대상을 정확히 감지하며, MediaPipe와 LiteRT의 GPU 가속을 활용해 지연 없는 상호작용을 제공합니다. 이를 통해 복잡한 마스킹 작업 없이도 인물, 동물, 하늘 등 특정 객체만을 직관적으로 분리하여 보정할 수 있습니다. **온디바이스 기반의 실시간 대화형 분할** - 대화형 세분화 모델(Interactive Segmenter)을 탑재하여 사용자가 이미지 위의 객체를 탭하거나 선을 그으면 즉시 해당 대상을 선택합니다. - MediaPipe 프레임워크와 LiteRT의 GPU 가속을 통해 모바일 기기에서 모든 프로세스를 처리하며, 20ms 미만의 초저지연 성능을 달성했습니다. - 전경 프롬프트(선택하려는 부분)와 배경 프롬프트(제외하려는 부분)를 자유롭게 추가하거나 제거하며 실시간으로 마스크 영역을 정교하게 수정할 수 있습니다. **교사-학생(Teacher-Student) 학습을 통한 모델 최적화** - 범용적인 객체 인식을 위해 350개 이상의 카테고리에서 수집한 3만 개의 고품질 마스크 데이터를 기반으로 '교사 모델(Interactive Segmenter: Teacher)'을 먼저 학습시켰습니다. - 교사 모델은 정확도는 높지만 모바일에서 구동하기에는 너무 크고 느리기 때문에, 이를 경량화된 '에지 모델(Interactive Segmenter: Edge)'로 지식 증류(Knowledge Distillation)하는 과정을 거쳤습니다. - 약 200만 장 이상의 대규모 데이터셋을 활용하여 교사 모델이 생성한 고정밀 마스크를 에지 모델이 학습하게 함으로써, 작은 크기임에도 높은 교차 분석(IOU) 성능을 유지하도록 설계했습니다. **사용자 행동을 모사한 프롬프트 생성 기술** - 실제 사용자가 객체를 선택하는 방식(스크리블, 탭, 박스 지정 등)을 학습 단계에서 시뮬레이션하여 모델의 반응성을 높였습니다. - 객체 내부에는 전경 프롬프트(Scribbles)를, 외부에는 배경 프롬프트를 무작위로 생성하여 모델이 사용자의 의도를 정확히 파악하도록 훈련했습니다. - 올가미(Lasso) 선택 방식을 지원하기 위해 객체 주위에 박스 프롬프트를 노출하는 학습 과정을 병행하여 다양한 편집 시나리오에 대응합니다. 이 기술은 강력한 AI 모델과 직관적인 UI를 결합하여 모바일 사진 편집의 제약 사항이었던 정밀 선택 문제를 해결했습니다. iOS용 Snapseed의 '수정(Adjust)' 도구 내 개체 브러시를 통해 이 기술을 직접 경험해 볼 수 있으며, 빠르고 효율적인 온디바이스 AI의 실용적인 사례를 보여줍니다.

google원문

거대 모델에서 모바일의 마 (새 탭에서 열림)

YouTube는 지식 증류(Knowledge Distillation) 기술과 MediaPipe를 이용한 온디바이스 최적화 아키텍처를 통해 대규모 생성형 AI 모델을 모바일 환경에서 실시간으로 구현했습니다. 이 시스템은 거대 모델의 성능을 소형화된 학생 모델에 전이함으로써 사용자 정체성을 유지하면서도 초당 30프레임 이상의 속도로 카툰 스타일 변환 등의 복잡한 효과를 제공합니다. 결과적으로 유튜브 쇼츠 사용자들은 고성능 GPU 서버 없이도 자신의 기기에서 즉각적이고 고품질의 AI 효과를 경험할 수 있게 되었습니다. ### 고품질 데이터와 지식 증류 아키텍처 * **다양성을 고려한 데이터 구축**: 성별, 연령, 피부색(Monk Skin Tone Scale 기준) 등이 균형 있게 분포된 라이선스 기반 얼굴 데이터셋을 사용하여 모든 사용자에게 일관된 품질의 효과를 제공합니다. * **교사-학생(Teacher-Student) 모델**: StyleGAN2 또는 Google DeepMind의 Imagen과 같은 강력한 '교사 모델'이 시각적 효과를 생성하면, UNet 기반의 가벼운 '학생 모델'이 이를 학습합니다. * **모바일 최적화 백본**: 학생 모델은 모바일 기기에 최적화된 MobileNet 백본을 인코더와 디코더에 사용하여 연산 부담을 최소화하면서도 이미지 변환 효율을 높였습니다. ### 반복적 증류 프로세스와 최적화 * **데이터 생성 및 증강**: 교사 모델을 통해 수만 쌍의 '변환 전후' 이미지 쌍을 생성하며, 이때 AR 안경, 합성된 손에 의한 가려짐(occlusion) 등 다양한 증강 기법을 적용해 실제 촬영 환경에 대비합니다. * **복합 손실 함수 활용**: 학생 모델 학습 시 단순 수치적 정확도를 넘어 시각적 사실감을 높이기 위해 L1, LPIPS, 적응형(Adaptive) 및 적대적(Adversarial) 손실 함수를 조합하여 사용합니다. * **신경망 구조 탐색(NAS)**: 뉴럴 아키텍처 서치 기술을 통해 모델의 깊이와 너비를 조정하며 각 효과에 가장 최적화된 효율적인 구조를 자동으로 찾아냅니다. ### 사용자 정체성 보존을 위한 PTI 기술 * **인버전 문제(Inversion Problem) 해결**: 생성 모델이 이미지를 잠재 공간(Latent Space)으로 변환할 때 사용자 고유의 이목구비나 피부색이 왜곡되는 문제를 해결하기 위해 PTI(Pivotal Tuning Inversion)를 도입했습니다. * **개별 특성 학습**: 원본 이미지의 특징을 정확히 표현할 수 있도록 모델의 가중치를 미세 조정하여, 효과가 적용된 후에도 사용자가 누구인지 명확히 인식할 수 있도록 정체성을 유지합니다. * **일관성 유지**: 단순한 필터 적용이 아니라 프레임별로 정체성을 보존하며 전체적인 스타일을 재구성하여 자연스러운 변환 결과를 도출합니다. ### MediaPipe를 통한 실시간 온디바이스 실행 * **크로스 플랫폼 최적화**: Google의 MediaPipe 프레임워크를 활용하여 Android와 iOS 모두에서 동일하게 고성능 그래프 시뮬레이션을 실행합니다. * **하드웨어 가속**: TFLite와 GPU 가속(Vulkan, OpenGL, Metal)을 통해 모바일 기기의 하드웨어 성능을 극한으로 끌어올려 실시간 카메라 스트림 처리를 지원합니다. * **효율적인 파이프라인**: 입력 영상의 전처리부터 모델 추론, 최종 렌더링까지 이어지는 전체 공정을 모바일 GPU 내에서 완결하여 지연 시간을 최소화했습니다. 이 기술적 성과는 복잡한 생성형 AI를 클라우드 서버 없이 모바일 기기 자체에서 구동할 수 있음을 증명합니다. 개발자들은 MediaPipe와 같은 오픈소스 도구를 활용하여 유사한 온디바이스 AI 기능을 설계할 수 있으며, 특히 사용자 개인정보 보호와 실시간 응답성이 중요한 서비스에서 지식 증류와 PTI 기술은 핵심적인 해결책이 될 것입니다.

line원문

LY Corporation의 AI 기술의 현재, Tech-Verse 2025 후기 (새 탭에서 열림)

Tech-Verse 2025는 LY Corporation이 LINE과 Yahoo Japan의 통합 이후 선보인 AI 전략의 핵심과 실무적인 기술 성과를 집약적으로 보여준 행사였습니다. 이번 컨퍼런스에서는 단순한 기술 트렌드 나열을 넘어, RAG와 MCP 등 최신 AI 기술을 실제 서비스와 개발 환경에 적용하며 겪은 시행착오와 구체적인 해결 방안이 중점적으로 다뤄졌습니다. 특히 AI가 개발 프로세스 전체에 스며들어 생산성과 품질을 동시에 확보하는 기술적 내공이 강조되었습니다. **AI 기반 개발 생산성 혁신: Ark Developer** * 사내 개발자들을 위해 구축된 'Ark Developer'는 RAG 기반의 코드 어시스턴트로, 코드 자동 완성, 리뷰, 보안 확인, 테스트 코드 작성을 지원합니다. * 사내 문서를 스트리밍 형태로 실시간 참조하여 코드의 맥락에 맞는 정확한 도움을 제공하며, GitHub와 연동되어 PR 생성까지 자동화된 워크플로우를 보여줍니다. * 단순히 코드 베이스를 텍스트 뭉치로 취급하는 대신, 디렉토리 구조를 그래프 형태로 분석(Graph Analysis)하여 연관 코드를 더욱 정밀하게 참조하는 기술적 차별점을 갖췄습니다. * 실제 현업 개발자들 사이에서 기존의 범용 AI 도구보다 체감 성능이 뛰어나다는 평가를 받으며 개발 사이클 전반에 깊숙이 통합되어 활용되고 있습니다. **생성형 AI의 품질 측정과 정교한 평가 체계** * 주관성이 강한 이미지 생성 기술의 품질을 관리하기 위해 분포 기반의 FID(Fréchet Inception Distance), IS(Inception Score)와 같은 전통적 지표를 넘어 다각적인 평가 모델을 도입했습니다. * 미적 기준을 측정하는 Aesthetic Score, LLM 기반의 CLIP-IQA 및 Q-Align, 그리고 비디오-언어 모델을 활용한 VQA(Visual Question Answering) 방식 등 정밀한 정량 평가를 수행합니다. * 이미지 번역 및 인페인팅 서비스에서는 단순한 텍스트 변환을 넘어 원래의 레이아웃과 구조까지 자연스럽게 복원해야 하는 복합적인 과제를 생성형 AI로 해결하고 있습니다. * 생성형 AI 기술의 완성도는 단순히 모델을 구현하는 것에 그치지 않고, '어떻게 정답이 없는 결과를 객관적으로 검증하고 개선할 것인가'에 달려 있음을 시사합니다. **실무형 AI 도입을 위한 통찰** 이번 컨퍼런스는 LLM과 에이전트 기술이 실험실을 벗어나 실제 서비스의 품질을 결정짓는 성숙기에 접어들었음을 보여줍니다. 특히 생성형 AI 결과물에 대한 정량적 평가 지표를 수립하고, 코드 베이스를 그래프 구조로 분석하는 등의 구체적인 접근법은 AI 서비스를 고도화하려는 실무자들에게 매우 유용한 벤치마킹 사례가 될 것입니다. 단순한 기술 도입보다는 우리 조직의 데이터 구조와 서비스 특성에 맞는 '평가와 검증 체계'를 먼저 고민하는 것이 품질 높은 AI 서비스를 만드는 핵심입니다.

line원문

AI로 생성한 이미지는 어떻게 평가할까요? (인페인팅 적용편) (새 탭에서 열림)

배경 인물 제거(BPR) 기능을 구현하기 위해서는 사진의 빈 공간을 자연스럽게 채워주는 '인페인팅(Inpainting)' 기술의 선정이 핵심적이지만, 단순히 논문의 수치만으로는 실제 서비스 성능을 가늠하기 어렵습니다. 이를 해결하기 위해 LY Corporation 개발팀은 다양한 생성형 AI 모델과 평가 지표를 비교 분석하여, 실제 사람의 시각적 평가와 가장 유사한 결과를 도출하는 최적의 평가 체계를 구축하고자 했습니다. 결과적으로 고해상도와 큰 삭제 영역 등 실무적인 제약 조건을 반영한 자체 테스트를 통해 서비스에 가장 적합한 모델 선정 기준을 마련했습니다. **배경 인물 제거(BPR)의 3단계 프로세스** * **인스턴스 분할(Instance Segmentation):** 사진 속 각 픽셀이 어떤 객체(사람, 건물, 나무 등)에 속하는지 식별하여 개별적으로 인식합니다. * **주요 객체 탐지(Salient Object Detection):** 이미지에서 시선이 집중되는 메인 피사체와 제거 대상인 배경 인물을 픽셀 단위로 구분합니다. * **인페인팅(Inpainting) 수행:** 배경 인물이 제거된 빈 영역을 주변 환경과 조화롭게 재구성하여 채워 넣는 최종 단계로, 전체 결과물 품질에 가장 큰 영향을 미칩니다. **인페인팅 모델의 기술적 접근 방식** * **디퓨전(Diffusion) 계열:** 랜덤 노이즈에서 점진적으로 이미지를 복원하며, 복잡한 세부 사항을 자연스럽게 살리는 데 유리하지만 생성 속도가 상대적으로 느립니다. * **GAN(Generative Adversarial Network) 계열:** 생성자와 판별자가 경쟁하며 학습하는 구조로, 디퓨전 모델에 비해 이미지 생성 속도가 빠르다는 장점이 있습니다. * **성능의 가변성:** 저해상도나 좁은 영역에서는 대부분의 모델이 준수한 성능을 보이나, 고해상도 이미지에서 큰 영역을 삭제할 경우 모델별로 결과물의 품질 차이가 극명하게 발생합니다. **신뢰할 수 있는 인페인팅 모델 평가의 어려움** * **벤치마크의 한계:** 논문에서 제시하는 256x256 등 고정된 저해상도 지표는 실제 서비스의 고해상도 환경을 대변하지 못합니다. * **정답의 부재:** 이미지 생성은 하나의 정답이 존재하지 않으며, 다양한 결과물이 모두 정답이 될 수 있어 수치화된 평가가 복잡합니다. * **상황별 성능 변화:** 특정 테스트셋에서 우수한 모델이 다른 인페인팅 영역이나 데이터셋에서는 실망스러운 결과를 보여주는 경우가 빈번합니다. **실험을 통한 최적의 평가 방법 탐색** * **데이터셋 구성:** 품질 편차가 큰 10개의 이미지를 모은 'BPR 평가 데이터셋'과 표준인 'Places365'를 활용해 11개의 최신 인페인팅 모델(LaMa, HINT, FLUX.1 등)을 테스트했습니다. * **사용된 지표:** 단일 이미지 품질을 측정하는 Aesthetics score, CLIP-IQA, Q-Align과 모델 간 선호도를 비교하는 PickScore, ImageReward 등을 적용했습니다. * **최종 목표:** 사람이 직접 눈으로 평가하는 비용과 시간을 줄이면서도, 인간의 주관적 평가 결과와 가장 높은 상관관계를 갖는 자동화된 평가 지표를 찾는 데 집중했습니다. **성공적인 AI 기능을 위한 실용적 제언** 논문상의 지표(Metric)에만 의존하기보다는 실제 서비스가 적용될 환경(해상도, 객체 크기 등)과 유사한 자체 데이터셋을 구축하여 테스트해야 합니다. 특히 배경 인물 제거와 같이 시각적 자연스러움이 중요한 작업에서는 정량적 수치 너머의 '심미적 점수'를 반영할 수 있는 최신 생성형 AI 평가 방법론을 병행하여 모델을 검증하는 것이 필수적입니다.

google원문

AMIE, 시각을 갖 (새 탭에서 열림)

구글 딥마인드가 텍스트를 넘어 이미지와 문서 등 멀티모달 정보를 통합하여 진단 대화를 수행하는 인공지능 에이전트 '멀티모달 AMIE'를 공개했습니다. 이 시스템은 제미나이 2.0 플래시(Gemini 2.0 Flash)를 기반으로 구축되었으며, 환자의 상태와 진단적 불확실성에 따라 지능적으로 정보를 요청하고 분석하는 능력을 갖췄습니다. 연구 결과, AMIE는 실제 의료 현장의 문진 과정을 효과적으로 모사하며 전문의에 필적하는 수준의 진단 및 관리 계획 수립 능력을 보여주었습니다. **상태 인지 기반의 추론 프레임워크와 문진 과정의 최적화** * AMIE는 실제 의사가 문진을 진행하는 방식과 유사하게 '병력 청취', '진단 및 관리', '사후 관리'의 3단계로 대화 흐름을 관리하는 '상태 인지 단계 전환 프레임워크'를 채택했습니다. * 모델의 내부 상태를 지속적으로 업데이트하여 환자에 대한 지식 격차와 진단적 불확실성을 실시간으로 추적합니다. * 특정 정보가 부족하다고 판단될 경우 피부 사진, 실험실 검사 결과, 심전도(ECG) 등 구체적인 멀티모달 자료를 환자에게 능동적으로 요청하고 이를 해석하여 진단을 정교화합니다. **시뮬레이션 환경 구축 및 전문가 평가를 통한 성능 검증** * SCIN(피부과) 및 PTB-XL(심전도)과 같은 실제 의료 데이터셋을 활용해 멀티모달 시나리오와 환자 에이전트를 생성하여 시스템을 훈련하고 평가할 수 있는 환경을 조성했습니다. * 전 세계 의료 교육에서 표준으로 사용되는 객관적 구조화 진료 시험(OSCE) 형식을 도입하여 1차 진료의(PCP)들과 AMIE의 성능을 비교 분석했습니다. * 평가 결과, AMIE는 다양한 임상 시나리오에서 의사들에 준하는 수준의 진단 정확도와 공감 능력을 보여주었으며, 복합적인 시각 데이터를 논리적으로 통합하는 역량을 입증했습니다. 이번 연구는 AI 에이전트가 단순한 대화 상대를 넘어 시각적 증거를 바탕으로 고도화된 임상적 추론을 수행할 수 있음을 보여줍니다. 향후 제미나이 2.5 플래시 등 최신 모델과의 결합을 통해 성능이 더욱 향상될 것으로 기대되며, 이는 의료진의 의사결정을 보조하고 원격 의료의 정확도를 높이는 혁신적인 도구가 될 것으로 전망됩니다.

google원문

지리공간 추론: 생성 (새 탭에서 열림)

구글 리서치는 생성형 AI와 다중 파운데이션 모델을 결합하여 복잡한 지리 공간 문제를 해결하는 '지형 공간 추론(Geospatial Reasoning)' 연구 프레임워크를 공개했습니다. 이 시스템은 고해상도 원격 탐사 데이터, 인구 역학, 이동 경로 모델을 통합하여 전문 지식 없이도 자연어로 고차원적인 지리적 분석 결과를 도출할 수 있게 지원합니다. 이를 통해 재난 대응, 도시 계획, 기후 회복력 강화 등 다양한 분야에서 데이터 기반의 의사결정 속도를 획기적으로 높일 것으로 기대됩니다. **지형 공간 파운데이션 모델의 기술적 토대** * **원격 탐사 모델의 아키텍처**: Masked Autoencoders, SigLIP, MaMMUT, OWL-ViT 등 검증된 시각-언어 모델 구조를 원격 탐사 영역에 맞게 최적화하여 적용했습니다. * **다양한 데이터 학습**: 텍스트 설명과 바운딩 박스(Bounding Box) 주석이 포함된 고해상도 위성 및 항공 이미지를 대규모로 학습하여, 이미지와 객체에 대한 정교한 임베딩을 생성합니다. * **자연어 기반 제로샷(Zero-shot) 분류**: 별도의 추가 학습 없이 "태양광 패널이 있는 주거용 건물"이나 "통행 불가능한 도로"와 같은 자연어 검색만으로 특정 지형이나 시설을 찾아낼 수 있습니다. * **성능 검증 및 실전 투입**: 분류, 세그멘테이션, 객체 탐지 벤치마크에서 SOTA(최고 수준) 성능을 기록했으며, 구글의 실제 재난 대응 및 도시/농업 경관 매핑 프로젝트에서 그 효용성을 입증했습니다. **데이터 통합과 에이전트 기반 추론 프레임워크** * **다중 모델 결합**: 인구 행동과 환경의 상호작용을 분석하는 '인구 역학 파운데이션 모델(PDFM)'과 궤적 기반의 '모빌리티 모델'을 통합하여 다각적인 분석이 가능합니다. * **LLM 기반 에이전트 워크플로우**: Gemini와 같은 거대언어모델(LLM)이 복잡한 지리 공간 데이터를 관리하고 조율하는 에이전트 역할을 수행하여, 복잡한 분석 과정을 자동화합니다. * **인구 역학 데이터의 글로벌 확장**: 기존 미국 중심의 PDFM 데이터를 영국, 호주, 일본, 캐나다, 말라위 등으로 확장하여 전 세계적인 분석 기반을 마련 중입니다. * **산업 파트너십**: Airbus, Maxar, Planet Labs 등 글로벌 위성 데이터 기업들과 협력하여 실무 환경에서의 테스트를 진행하고 있습니다. 현재 구글은 '신뢰할 수 있는 테스터 프로그램'을 통해 해당 모델들에 대한 접근권을 제공하고 있습니다. 지리 공간 데이터 분석의 높은 진입 장벽을 낮추고자 하는 조직은 구글 리서치가 제공하는 파운데이션 모델 임베딩을 활용해 독자적인 분석 모델을 고도화하거나, 자연어 기반의 지형 추론 워크플로우를 실험적으로 도입해 보는 것을 권장합니다.