Google Research

158 개의 포스트

research.google/blog

태그로 필터

google4분 읽기큐레이션 요약

빈 서가인가, 잃어버린 열쇠인가? 회상은 매개변수적 사실성의 병목이다

LLM의 사실 오류는 사실을 학습하지 못해서라기보다, 이미 저장한 사실을 필요할 때 꺼내지 못해서 발생하는 경우가 많다. Google Research는 이를 측정하는 ‘지식 프로파일링’과 WikiProfile 벤치마크를 제안했으며, 최신 모델에서는 지식 습득보다 지식 활용과 회상이 사실성의 병목이라고 결론 내린다. 따라서 모델 규모 확대만으로는 한계가 있고, 저장된 지식을 안정적으로 회수하도록 하는 후처리·추론 기법이 중요해진다. ## 인코딩과 회상을 구분해야 하는 이유 - 일반적인 정확도 지표는 모델이 사실을 아예 학습하지 못한 경우와, 학습했지만 답변하지 못한 경우를 구분하지 않는다. - 두 실패의 원인은 다르다. - **인코딩 실패**: 사실이 모델 파라미터에 충분히 표현되지 않음 → 모델 규모 확대나 학습 데이터 보강이 필요하다. - **회상 실패**: 사실은 저장되어 있지만 외부 단서 없이 검색·활용하지 못함 → 후처리 학습이나 추론 시점 기법으로 개선할 가능성이 있다. - 글에서는 다음과 같이 개념을 구분한다. - **인코딩**: 사전학습 당시와 유사한 문맥에서 사실을 재현할 수 있는 능력 - **지식**: 표현이 달라지거나 질문 방향이 바뀌어도 사실에 답하는 능력 - **회상**: 인코딩된 사실을 별도 외부 단서 없이 꺼내는 능력 - **인식**: 여러 선택지 중 올바른 사실을 식별하는 능력 ## 지식 프로파일링과 다섯 가지 사실 상태 - 분석 단위를 개별 질문이 아니라 **사실 자체**로 바꾼다. - 각 사실을 다음 다섯 가지 상태로 분류한다. - 인코딩 실패 - 회상 실패 - 직접 회상 - 사고를 거친 회상 - 인코딩 없이 추론 - ‘사고를 거친 회상’은 중간 계산이나 다단계 추론을 유도해야만 답할 수 있는 경우다. - ‘인코딩 없이 추론’은 해당 사실 자체는 저장되지 않았더라도, 다른 사실들을 조합하거나 추측해 정답에 도달하는 경우를 뜻한다. ## WikiProfile 벤치마크 구성 - Wikipedia에서 추출한 2,150개의 사실을 대상으로 한다. - 사실은 문서에 먼저 등장하는 주체와 객체의 순서쌍으로 정의된다. - 각 사실에는 총 10개의 과제가 연결된다. - 인코딩 측정 2개 - 지식 평가 4개 - 인식 평가용 객관식 문제 4개 - 질문은 직접 질문과 역방향 질문을 모두 포함한다. - 예: “B는 무엇인가?”와 “A는 무엇인가?” - 질문 생성 후 정제·검색 기반 필터링·수작업 검증을 거쳐 모호하거나 정답이 여러 개인 사례를 제거했다. - 13개 LLM을 사고 기능 활성화 여부에 따라 평가했으며, 모델·사실·과제별로 8개 응답을 샘플링해 약 450만 개의 응답을 자동 평가했다. ## 최신 LLM의 병목은 인코딩이 아니라 회상 - Gemini 2.5 Pro, Gemini 3 계열, GPT-5 같은 프런티어 모델은 사실 인코딩률이 거의 포화 상태다. - Gemini 3 Pro와 GPT-5는 약 **95~98%의 사실을 인코딩**하고 있다. - 그러나 사고 없이 직접 회상하는 데는 여전히 **26~34%의 사실에서 실패**한다. - 사고를 허용해도 **11~12%의 사실은 여전히 회상하지 못한다.** - 모델 규모를 키우면 인코딩 실패는 크게 줄지만, 회상 실패는 상당 부분 남는다. - 즉, 스케일링은 모델이 “무엇을 저장하는가”는 개선하지만, “저장된 것을 얼마나 안정적으로 꺼내는가”는 상대적으로 덜 개선한다. ## 회상이 어려워지는 조건 - 회상 능력은 사실을 학습할 때의 조건과 밀접하게 연결된다. - 질문의 표현, 문맥, 정보의 배열 순서가 학습 당시와 달라지면 사실이 저장되어 있어도 접근하기 어려워질 수 있다. - 이는 모델의 지식 부족이라기보다, 저장된 지식에 연결되는 단서가 충분히 활성화되지 않는 문제로 해석할 수 있다. ## 희귀 사실과 롱테일 지식 - 기존 연구는 모델이 희귀한 사실에 약한 이유를 주로 모델 용량 부족으로 설명했다. - 이 연구에서는 희귀 사실도 인기 있는 사실과 비슷한 수준으로 인코딩되는 경우가 많다고 본다. - 인기 있는 사실과 희귀한 사실의 인코딩률 차이는 비교적 작지만, 회상률 차이는 더 크게 나타난다. - 따라서 롱테일 사실의 문제는 “모델이 전혀 저장하지 않았다”기보다 “저장했지만 적절한 상황에서 꺼내지 못한다”는 관점으로 재해석할 수 있다. ## 실용적인 결론 - 사실성 개선을 위해 단순히 모델 크기와 학습 데이터만 늘리는 전략에는 한계가 있다. - 저장된 지식을 다양한 표현과 질문 방향에서 안정적으로 회수하도록 하는 후처리 학습, 프롬프트 설계, 사고 유도 기법을 함께 개발해야 한다. - 모델 평가에서도 단일 정답률보다 인코딩·직접 회상·사고 기반 회상·인식 능력을 분리해 측정하는 것이 바람직하다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

AMIE를 전문가 수준의 시청각 임상 상담으로 발전시키기

AMIE는 텍스트 기반 진료의 한계를 넘어, 실시간 영상과 음성을 활용하는 임상 상담 AI로 발전했다. 새로운 AMIE(Video)는 환자의 비언어적 신호를 관찰하고 가상 신체검사를 안내하면서 동시에 진단적 추론을 수행한다. 100개 시나리오와 300회 상담으로 구성된 무작위 연구에서 전문의 수준의 성능을 보였다는 것이 글의 핵심 주장이다. ## 텍스트 기반 의료 AI의 한계 - 기존 텍스트 인터페이스는 환자가 증상을 글로 설명하도록 요구한다. - 걸음걸이, 호흡, 불편함의 표정, 신체 움직임 같은 시각적 정보가 사라진다. - 환자가 신체검사 동작을 수행하도록 안내하거나 그 결과를 직접 관찰할 수 없다. - 디지털 문해력이나 건강 문해력이 낮은 환자에게 특히 불리할 수 있다. - 이러한 비언어적 단서는 진단뿐 아니라 환자 신뢰와 의사소통에도 중요하다. ## AMIE의 기존 발전 - AMIE(Articulate Medical Intelligence Explorer)는 임상 추론과 대화에 특화된 연구 의료 AI다. - 텍스트 기반 진단 대화에서 전문의 수준의 성능을 보였고, 임상의의 감별진단 보조 도구로 활용 가능성을 보였다. - 이후 질병 치료와 장기 관리, 종양학·심장학·안과 분야의 전문 평가로 기능을 확장했다. - 의료 이미지와 임상 문서를 활용한 멀티모달 진단 추론도 실험했다. - 실제 의료 적용을 위해 의사 중심의 감독 체계와 병원·의료 서비스 기업과의 임상 연구도 진행 중이다. ## 실시간 영상 상담을 위한 AMIE(Video) - AMIE(Video)는 Gemini와 Project Astra를 기반으로 한다. - 실시간 영상 상담에서 다음 기능을 수행한다. - 환자의 표정, 움직임, 신체적 징후 등 비언어적 단서 관찰 - 음성에서 호흡 이상이나 기타 임상적으로 의미 있는 신호 파악 - 환자에게 가상 신체검사 동작 안내 - 수집한 정보를 바탕으로 실시간 진단 추론 - 말의 자연스러운 속도와 깊은 임상 추론을 동시에 달성하는 것이 주요 설계 목표다. ## 비동기 멀티 에이전트 구조 AMIE(Video)는 하나의 에이전트가 모든 작업을 순차적으로 처리하는 대신, 세 에이전트가 병렬로 작동한다. - **Talker 에이전트** - 환자와 직접 대화한다. - 낮은 지연 시간으로 자연스러운 음성 상호작용을 유지한다. - 다른 에이전트의 분석과 지침을 대화에 반영한다. - **Planner 에이전트** - 백그라운드에서 임상 추론을 지속적으로 갱신한다. - 감별진단과 치료 계획을 정교화한다. - 부족한 정보를 찾고, 여러 임상 목표의 우선순위를 재조정한다. - **Perception 에이전트** - 영상과 음성 스트림을 계속 분석한다. - 고통의 징후, 신체 소견, 청각적 이상 등 임상적 단서를 식별한다. - 관찰 결과를 현재 대화 맥락과 연결한다. 이 구조는 깊은 추론 때문에 대화가 끊기는 문제를 줄이면서, 자연스러운 상담 속도와 지속적인 영상·음성 분석을 가능하게 한다. 자동 평가에서는 세 에이전트 모두 병력 청취, 임상 추론, 치료 권고, 환자 중심 의사소통, 응답 속도 등의 개선에 기여한 것으로 나타났다. ## 자동 평가 체계 - 연구진은 원격의료에 필요한 오디오·비주얼 임상 역량을 의학 문헌을 바탕으로 분류했다. - 평가 항목에는 다음이 포함된다. - 비언어적 시각 단서 인식 - 청각적 임상 신호 파악 - 신체검사 동작 안내 - 해부학적 좌우 구분 - 호흡 곤란 등 이상 징후 인식 - 단일 턴 평가에서는 특정 시각·청각 단서를 올바르게 인식하고 추론하는 능력을 측정했다. - 다중 턴 시뮬레이션에서는 대화 전체의 임상 성능을 평가했다. - 시각 정보는 환자 시뮬레이터가 “[카메라를 향해 종이를 들고 있음]”과 같은 텍스트 설명으로 주입됐다. - 이 평가를 통해 실제 사람을 대상으로 한 연구 전에 시스템의 강점과 실패 양상을 빠르게 파악하고 설계를 반복 개선했다. ## 무작위 영상 상담 연구 - 연구진은 동기식 영상 인터페이스를 이용한 대규모 무작위 OSCE(Objective Structured Clinical Examination)를 실시했다. - 100개 임상 시나리오가 포함됐으며, 심폐·복부·두경부·신경정신·근골격계 등 다섯 신체 계통을 다뤘다. - 15명의 훈련된 환자 역할 배우가 총 300회의 표준화 상담을 수행했다. - 비교군은 세 가지였다. - **AMIE(Video):** 실시간 영상 상담을 수행하는 AMIE - **AMIE(Text):** 오디오·비주얼 기능의 효과를 분리해 보기 위한 텍스트 기반 버전 - **PCP(Video):** 동일한 영상 인터페이스를 사용하는 보드 인증 일차의료 전문의 - 30명의 보드 인증 일차의료 전문의가 참여했고, 독립 평가단이 표준화된 임상 평가 기준으로 상담을 평가했다. 이 연구는 의료 AI가 단순한 텍스트 문답을 넘어, 환자를 보고 들으며 신체검사를 안내하는 실시간 임상 상담으로 확장될 수 있음을 보여준다. 다만 실제 의료 도입을 위해서는 환자 안전, 의사 감독, 다양한 환자군에서의 검증과 같은 추가 임상 연구가 필요하다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

Science One 프레임워크: 증거 사슬을 통한 검증 가능한 자율 연구 프레임워크

Science One Framework는 AI가 생성한 연구 결과의 모든 주장에 실제 근거를 연결하는 Chain-of-Evidence(CoE) 방식으로 환각과 재현성 문제를 줄이는 자율 연구 프레임워크다. 문헌 검색, 실험 탐색, 논문 작성 전 과정에서 증거 사슬을 구축하고, CoE Audit로 인용·점수·코드·방법의 일치 여부를 독립 검증한다. 실험 결과, 기존 시스템의 참고문헌 환각률이 최대 21%에 달한 반면 Science One Framework는 유령 참고문헌 없이 높은 재현성과 성능을 달성했다. ## 자율 연구 시스템에서 검증 가능성이 중요한 이유 - LLM 기반 연구 에이전트는 문헌 조사, 가설 수립, 실험 실행, 논문 작성까지 자동화하고 있다. - 그러나 생성 과정에서 발생한 오류가 다음 단계로 누적·증폭될 수 있다. - 대표적인 문제는 다음과 같다. - 존재하지 않는 논문을 참고문헌으로 생성 - 논문에 설명한 방법과 실제 실행 코드가 불일치 - 논문에 보고된 실험 점수가 코드를 다시 실행했을 때 재현되지 않음 - 따라서 논문의 문장 품질만이 아니라, 각 주장과 근거 사이의 연결을 검증해야 한다. ## Chain-of-Evidence(CoE)의 원칙 - CoE는 데이터베이스 트랜잭션의 ACID처럼 신뢰할 수 있는 연구 산출물이 갖춰야 할 속성을 정의하는 개념적 프레임워크다. - 핵심은 두 가지다. - **완전성**: 연구 산출물의 모든 주장에 기록된 증거 사슬이 있어야 한다. - **정확성**: 연결된 증거가 실제로 해당 주장을 뒷받침해야 한다. - 검증 대상이 되는 주장은 다음과 같다. - 참고문헌의 존재 여부 - 논문에 보고된 실험 수치 - 연구 방법 설명 - 최종 결론 - 증거는 학술 논문, 실험 로그, 실제 실행된 코드, 결과 테이블 등으로 연결된다. - 존재하지 않는 참고문헌, 재현되지 않는 점수, 코드와 다른 방법 설명은 모두 증거 사슬이 끊어진 사례다. ## 문헌을 근거로 고정하는 Problem Investigator - Semantic Scholar API를 사용해 주제별 인용 그래프를 구축한다. - 최대 100개의 전문 PDF를 읽어 구조화된 연구 브리프를 만든다. - 최종 논문의 참고문헌은 모델의 기억에서 생성하지 않고, API를 통해 실제로 검색·확인된 자료에서 가져온다. - 이 방식으로 존재하지 않는 참고문헌이 논문에 포함되는 문제를 방지한다. ## 병렬 탐색을 수행하는 Discovery Engine - 여러 탐색 브랜치를 병렬로 운영해 새로운 아이디어를 탐색하고 성능이 좋은 아이디어를 개선한다. - 각 독립 사이클에서 다음 작업이 수행된다. - Solver 에이전트가 해결책을 구현 - 문제별 evaluator가 결과를 평가 - 성능이 높은 브랜치를 반복적으로 개선 - 모든 evaluator의 원시 출력은 엄격한 읽기 전용 기록으로 저장된다. - 따라서 논문에 기재된 점수를 실제 평가 결과와 대조할 수 있다. ## 주장과 근거를 연결하는 Paper Writer와 Claim Verifier - 논문을 렌더링하기 전에 모든 사실 주장을 구조화하고, 각 주장에 인라인 증거 태그를 붙인다. - 증거 태그는 해당 주장을 뒷받침하는 특정 작업 공간 산출물에 연결된다. - Claim Verifier는 각 주장을 선언된 출처와 대조한다. - 주장이 근거보다 과장된 경우 삭제하기보다 근거가 뒷받침하는 수준으로 보수적으로 다시 작성한다. - 이를 통해 논문 내용이 실제 수행된 연구와 일치하도록 유지한다. ## CoE Audit의 네 가지 검증 CoE Audit는 생성된 논문, 코드, 해결책, 참고문헌을 대상으로 수행하는 사후 자동 감사 프로토콜이다. - **점수 검증** - 논문에서 보고된 점수를 추출한다. - 제출된 코드를 완전히 독립적으로 다시 실행해 결과를 비교한다. - **명세 위반 검사** - 코드가 실제 문제를 해결하는지 확인한다. - 평가 지표를 악용하거나 정답 파일을 직접 읽는 등의 부정한 구현을 검사한다. - **참고문헌 검증** - 모든 참고문헌을 학술 API와 대조한다. - 존재하지 않는 유령 참고문헌을 식별한다. - **방법-코드 정렬 검사** - LLM 심사자가 논문의 방법론 설명과 코드를 나란히 비교한다. - 논문이 실제 구현보다 복잡하거나 다른 알고리즘을 설명하는지 확인한다. ## 실험 결과 - ADRS 벤치마크의 5개 시스템 최적화 과제(Prism, Cloudcast, EPLB, LLM-SQL, transaction scheduling)에서 5개 시스템이 생성한 총 75편의 논문을 평가했다. - Science One Framework는 네 가지 무결성 검사 모두에서 기존 기준 시스템보다 우수했다. - 참고문헌 환각률은 0%였다. - 반면 기존 시스템에서는 최대 21%의 참고문헌이 존재하지 않았다. - 제출 코드의 독립 재실행을 통한 점수 검증에서 완벽한 결과를 보였다. - 방법 설명과 실제 코드의 일치도 역시 가장 높았다. - 일부 기준 시스템은 실제 코드가 단순한 결정론적 휴리스틱임에도 “하이브리드 뉴로-심볼릭 솔버”처럼 과장된 방법을 기술했다. - 검증 절차를 강화했음에도 연구 성능이 저하되지 않았다. - 5개 ADRS 과제에서 인간 전문가 수준 이상을 기록했다. - Cloudcast와 EPLB에서는 전체 시스템 중 최고 성능을 달성했다. - 외부 일반화 평가에서도 MLE-Bench의 의료 영상, 세밀한 이미지 인식, 3D 인식 관련 대회에 적용되었으며, 일부 과제에서 Gold Medal 성과를 기록했다. ## 실용적인 시사점 자율 연구 시스템은 논문을 완성한 뒤 사실을 확인하는 방식보다, 문헌·코드·실험 로그·결과를 생성 시점부터 연결하는 구조가 바람직하다. 특히 자동화된 연구 결과를 실제 의사결정이나 후속 연구에 사용하려면, 논문 자체뿐 아니라 독립적인 코드 재실행, 참고문헌 확인, 방법-코드 비교를 포함한 CoE Audit 같은 검증 절차를 함께 운영해야 한다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

오류를 통해 학습하는 양자 컴퓨터를 향하여

양자 컴퓨터는 아날로그 제어 신호의 드리프트 때문에 장시간 계산 중에도 지속적인 재보정이 필요하며, 기존 방식은 계산을 완전히 중단해야 한다는 한계가 있다. Google Quantum AI는 양자 오류 검출 데이터를 강화학습의 학습 신호로 활용해, 계산을 수행하는 동안 수천 개의 제어 매개변수를 자동 조정하는 방법을 제시했다. Willow 프로세서 실험과 대규모 시뮬레이션에서 이 방식은 논리적 안정성과 오류율을 개선해, 장시간 안정적인 양자 계산에 한 걸음 다가섰다. ## 양자 컴퓨터에서 지속적인 보정이 필요한 이유 - 양자 컴퓨터는 주파수, 진폭, 위상 같은 아날로그 제어 신호로 큐비트를 조작한다. - 하드웨어와 환경의 미세한 변화로 제어 매개변수가 드리프트하면 오류가 증가한다. - 기존에는 성능을 회복하려면 양자 계산을 완전히 종료한 뒤 전체 시스템을 재보정해야 했다. - 유용한 양자 알고리즘이 수일에서 수개월 동안 실행되어야 한다는 점에서, 계산과 보정의 분리는 큰 병목이다. ## 양자 오류 정정과 오류 검출 데이터 - 큐비트를 직접 측정하면 중첩 상태가 붕괴하므로, 여러 물리 큐비트로 논리 큐비트를 구성하는 양자 오류 정정(QEC)을 사용한다. - 물리 큐비트의 패리티 검사는 아날로그 잡음을 이진 오류 검출 이벤트로 변환한다. - 검출 이벤트는 오류가 특정 시공간 영역에서 발생했다는 사실은 알려주지만, 정확한 위치까지 알려주지는 않는다. - AlphaQubit 같은 신경망 디코더와 Tesseract 같은 알고리즘 디코더가 검출 데이터를 분석해 오류 위치를 추정하고 논리 정보를 복원한다. - 그러나 디코더는 오류를 수정할 뿐, 오류의 원인이 제어 불량인지 환경적 요인인지까지 해결하지는 못한다. ## 물리 모델 중심 보정의 한계 - 기존 양자 보정은 물리 법칙과 수작업으로 설계한 모델에 의존했다. - 실제 하드웨어에서는 복잡한 상호작용과 드리프트를 정확히 모델링하기 어렵기 때문에 성능에 한계가 생긴다. - 환경과의 상호작용으로 인한 결맞음 상실은 완전히 제거할 수 없지만, 부정확한 보정과 하드웨어 드리프트는 개선할 여지가 있다. - AlphaQubit이 기존 알고리즘 디코더를 능가한 것처럼, 양자 제어에서도 데이터 기반 학습이 기존 모델의 한계를 넘을 수 있다는 관점이 제시된다. ## 오류를 강화학습의 피드백으로 활용 - 강화학습 에이전트는 명시적인 제어 규칙 대신 행동 결과를 관찰하며 전략을 개선한다. - QEC에서 이미 생성되는 오류 검출 이벤트를 오류 수정뿐 아니라 학습 신호로도 활용한다. - 에이전트는 검출 이벤트의 변화를 관찰하면서 수천 개의 제어 매개변수를 동적으로 조정한다. - 제어 시스템은 새로운 오류를 줄이고, 계산 중 발생하는 드리프트를 지속적으로 상쇄한다. - 즉, 오류를 단순히 사후에 수정하는 것이 아니라 오류 패턴에서 원인을 학습해 제어 자체를 개선한다. ## Willow 프로세서 실험 결과 - Google의 Willow 초전도 프로세서에 의도적인 제어 매개변수 드리프트를 주입해 방법을 검증했다. - 강화학습 제어는 오류 정정 코드의 논리적 안정성을 3.5배 향상시켰다. - 프로세서가 신뢰할 수 있는 양자 메모리로 동작하는 시간이 그만큼 연장됐다. - 전문가가 수행한 기존 보정 이후에도 강화학습 미세 조정을 적용하자 논리 오류율이 추가로 20% 감소했다. - 최종적으로 표면 코드에서는 오류 정정 주기 1,000회당 1회 미만, 색상 코드에서는 100회당 1회 수준의 논리 오류율을 기록했다. ## 대규모 시스템으로의 확장 가능성 - 연구진은 수백 개의 큐비트와 수만 개의 제어 매개변수를 포함한 수치 시뮬레이션을 수행했다. - 초기에는 보정되지 않은 시스템의 물리 오류율이 높았지만, 강화학습 에이전트가 학습하면서 오류율을 점진적으로 낮췄다. - QEC를 적용하면 물리 큐비트 수가 증가할수록 논리 오류율이 지수적으로 억제되는 양상이 나타났다. - 중요한 점은 강화학습이 물리 오류율을 낮추는 속도가 시스템 크기에 크게 의존하지 않았다는 것이다. - 따라서 향후 더 큰 양자 컴퓨터에서도 학습 반복 횟수가 시스템 규모에 비례해 폭증하지 않을 가능성을 보여준다. ## 실용적인 의미 양자 오류 정정은 오류를 복구하는 역할을 넘어, 제어 시스템을 계속 학습시키는 센서로도 활용될 수 있다. 강화학습 기반 자동 보정이 실제 대규모 하드웨어에서 안정적으로 확장된다면, 계산을 중단하지 않고 드리프트에 대응하는 장시간·고신뢰성 양자 컴퓨터 구현에 기여할 수 있다.

원문 읽기(새 탭에서 열림)
google3분 읽기큐레이션 요약

SymptomAI: 일상적인 증상 평가를 위한 대화형 AI 에이전트를 향하여

SymptomAI는 일상적인 대화만으로 증상을 파악하고 감별진단 목록을 제시하는 AI 에이전트의 실효성을 대규모 실제 사용자 연구로 평가했다. 13,917명이 참여한 연구에서 SymptomAI의 감별진단은 임상의가 작성한 감별진단보다 전문가 평가에서 더 자주 선호되고, 실제 의료진의 최종 진단을 상위 5개 안에 포함하는 경우도 많았다. 다만 모든 결과는 연구용 분석이며, 확정적인 의료 진단이나 공식 의료 평가를 의미하지 않는다. ## 실제 환자 대화를 반영한 연구 설계 - 기존 언어모델 평가는 의료 지식이 정리된 사례나 합성 환자 문진에 의존해 실제 환자의 불완전하고 비정형적인 증상 설명을 충분히 반영하지 못했다. - 연구진은 이러한 한계를 보완하기 위해 13,917명의 동의한 참가자를 모집했다. - 참가자는 5개 유형 중 하나의 Gemini Flash 2.0 기반 SymptomAI 에이전트와 대화했다. - AI는 증상을 듣고 추가 질문을 진행한 뒤, 가능한 질환 목록인 감별진단(DDx)과 다음 단계에 대한 권고를 제시했다. - 참가자는 이후 의료기관을 방문했고, 2주 뒤 의료진에게 받은 실제 진단을 설문으로 보고했다. ## 임상의와의 비교 평가 - 세 명의 보드 인증 임상의가 대화 기록을 검토하고 독립적으로 감별진단을 작성했다. - 임상의들은 SymptomAI의 감별진단과 다른 임상의들의 감별진단을 모르는 상태에서 비교·순위를 매겼다. - SymptomAI의 감별진단은 전체 사례의 50% 이상에서 다른 임상의의 결과보다 선호됐다. - 전문가들은 SymptomAI의 감별진단을 전반적인 품질 측면에서 가장 우수한 목록으로 평가하는 경우가 더 많았다. - 실제 의료진이 참가자에게 내린 진단이 감별진단 상위 5개 안에 포함되는 비율도 SymptomAI가 다른 임상의들보다 높았다. ## 추가 질문이 진단 성능을 높임 연구에서는 문진 방식에 따라 다섯 가지 실험군을 비교했다. - **Dynamic Live, Dynamic Final** - AI가 대화 흐름에 따라 제한 없이 추가 질문을 생성했다. - **Fixed Canonical, Flexible Canonical** - 의과대학에서 가르치는 표준 병력 청취 질문 집합을 사용했다. - **Base** - 사용자가 주도적으로 질문하고 설명하는 일반적인 챗봇 사용 방식에 가까운 조건이었다. - AI가 적극적으로 후속 질문을 한 모든 방식은 Base 조건보다 감별진단 정확도가 유의미하게 높았다. - 이는 환자가 처음부터 제공하지 않은 정보까지 체계적으로 끌어내는 문진 능력이 진단 성능에 중요하다는 점을 보여준다. ## 임상의가 확신하지 못한 사례에서의 강점 - SymptomAI의 임상적 기준선 대비 우위는 임상의가 자신의 감별진단에 낮은 확신을 보인 사례에서 가장 크게 나타났다. - 증상이 모호하거나 정보가 부족해 사람도 판단하기 어려운 상황에서, AI의 체계적인 추가 질문과 후보 질환 비교가 도움이 될 가능성을 시사한다. - 다만 이 결과는 전문가 평가와 참가자의 사후 자기보고 진단을 기반으로 한 비교이며, 실제 임상 진료를 대체한다는 의미는 아니다. ## 웨어러블 생체신호와의 연관성 - 연구진은 SymptomAI의 진단 결과를 참가자 Fitbit 기기의 생체신호와 비교했다. - 참가자들의 대화 전 최대 30일 동안 수집된 일일 생체 데이터를 분석했다. - 특히 급성 호흡기 감염으로 분류된 사례에서 증상 보고 시점에 가까워질수록 생체신호가 변화하는 경향이 관찰됐다. - 이러한 변화는 감염이나 면역 반응과 관련된 생리적 추세일 가능성을 보여주며, SymptomAI의 대규모 증상 분류 결과를 웨어러블 데이터 분석에 활용할 수 있는 가능성을 제시한다. - 현재는 대규모 생리 데이터에 신뢰할 만한 임상 라벨을 붙이는 데 비용이 많이 들기 때문에, 정확한 증상 평가 시스템이 자동화된 참조 라벨 역할을 할 수 있다는 것이 연구진의 관점이다. ## 실용적인 시사점 SymptomAI 연구는 의료 챗봇이 단순히 사용자의 질문에 답하는 것보다 적극적으로 병력을 청취할 때 더 유용해질 수 있음을 보여준다. 그러나 연구 결과는 진단 보조 기술의 가능성을 평가한 것이므로, 실제 증상이 있을 때는 AI 결과만으로 판단하지 말고 의료진의 진료와 검사를 받아야 한다.

원문 읽기(새 탭에서 열림)
google3분 읽기큐레이션 요약

확산 모델의 창의성을 명확히 이해하기 위한 여정

확산 모델의 창의성은 학습 데이터의 단순 암기가 아니라, 신경망이 점수 함수(score function)를 완벽하지 않고 매끄럽게 학습하는 데서 비롯됩니다. 정규화와 신경망의 암묵적 정규화는 점수 함수의 급격한 변화를 완화하고, 생성 과정이 학습 샘플 사이를 보간하도록 만듭니다. 그 결과 모델은 데이터의 구조를 유지하면서도 학습 데이터에 없는 새롭고 그럴듯한 샘플을 생성할 수 있습니다. ## 확산 모델의 생성과 점수 함수 - 확산 모델은 실제 데이터를 노이즈로 오염시킨 뒤, 이를 단계적으로 되돌리는 **디노이징** 과정을 학습합니다. - 생성 과정에서 점수 함수는 현재 데이터가 어느 방향으로 이동해야 하는지 알려주는 일종의 힘의 장 역할을 합니다. - 점수 함수를 완벽하게 학습한다면 노이즈 입자들은 특정 학습 샘플로 수렴할 수 있습니다. - 이 경우 모델은 새로운 데이터를 만드는 생성기보다 학습 데이터를 찾아내는 검색 도구에 가까워집니다. - 즉, 점수 함수의 완벽한 재현은 오히려 암기를 유발할 수 있습니다. ## 1차원 사례에서 나타나는 보간 효과 - 학습 데이터가 `-1`과 `+1` 두 점뿐인 1차원 세계를 생각할 수 있습니다. - 완벽한 점수 함수는 `0` 부근에서 방향이 급격히 바뀝니다. - 왼쪽의 입자는 `-1`로 이동합니다. - 오른쪽의 입자는 `+1`로 이동합니다. - 결과적으로 모든 입자가 두 학습 데이터 중 하나에 도달합니다. - 신경망이 학습한 점수 함수는 이처럼 급격한 변화를 그대로 표현하기 어렵습니다. - 특히 weight decay 같은 정규화는 급격한 절벽 형태를 완만한 경사로 바꿉니다. - 중앙 영역의 힘이 약해지면서 입자들이 학습 데이터에 즉시 수렴하지 않고, 두 점 사이의 **보간 영역(interpolation zone)** 에 머무를 수 있습니다. - 이 보간 영역에서 생성된 샘플이 학습 데이터에는 없지만 두 데이터의 특성을 공유하는 새로운 결과가 됩니다. ## 정규화가 만드는 점수 함수의 평활화 - 연구진은 1차원 점수 함수를 두 층 ReLU 신경망으로 학습하고 AdamW와 다양한 weight decay 설정을 비교했습니다. - weight decay가 강할수록 점수 함수의 중앙 부분이 더 부드러워졌습니다. - 점수 함수가 부드러워지면 데이터 사이를 흐르는 입자의 속도가 느려지고, 특정 학습 샘플로의 붕괴가 완화됩니다. - 명시적인 weight decay를 사용하지 않아도 경사 기반 학습 알고리즘 자체의 **암묵적 정규화** 때문에 같은 평활화가 나타날 수 있습니다. - 따라서 확산 모델의 창의성은 우연한 학습 실패가 아니라, 신경망 학습 방식에서 자연스럽게 발생하는 수학적 결과로 해석할 수 있습니다. ## 데이터 매니폴드 복원 - 고해상도 이미지처럼 복잡한 데이터는 고차원 픽셀 공간에 존재하지만, 의미 있는 이미지가 차지하는 영역은 극히 일부입니다. - 이 의미 있는 데이터들의 집합을 **데이터 매니폴드**라고 하며, 확산 모델은 유한한 학습 데이터로부터 이 숨겨진 구조를 추정해야 합니다. - 생성은 단순히 학습 샘플을 복사하는 것이 아니라, 데이터 매니폴드 위에서 새로운 점을 찾는 문제로 볼 수 있습니다. - 다차원 공간에서 점수 평활화는 모든 방향에 동일하게 작용하지 않습니다. - 매니폴드에 접하는 방향에서는 학습 샘플로 지나치게 수렴하는 경향을 늦춥니다. - 매니폴드를 향하는 방향에서는 이동을 크게 방해하지 않습니다. - 이 특성 덕분에 입자는 무의미한 고차원 공간에서 매니폴드로 이동하면서도, 매니폴드 위에서는 특정 학습 데이터에 과도하게 붕괴하지 않습니다. - 결과적으로 생성물의 현실성과 새로움 사이에서 균형이 형성됩니다. ## 실용적 의미 확산 모델의 창의성을 이해하려면 단순히 데이터 암기 여부만 볼 것이 아니라, 학습된 점수 함수가 얼마나 매끄러운지와 정규화가 생성 궤적에 미치는 영향을 함께 분석해야 합니다. 적절한 평활화는 학습 데이터에 대한 충실도와 새로운 샘플 생성 능력을 동시에 확보하는 핵심 메커니즘으로 볼 수 있습니다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

SensorFM: 웨어러블 헬스 데이터를 위한 범용 지능과 인터페이스를 향하여

SensorFM은 500만 명의 웨어러블 사용자에게서 수집한 1조 분 이상의 센서 데이터를 학습한 대규모 웨어러블 건강 파운데이션 모델이다. 라벨이 거의 없는 현실 데이터를 자기지도학습으로 처리해 심혈관·대사·수면·정신건강 등 35개 과제에 전이 가능한 생리학 표현을 학습한다. 데이터와 모델 규모를 함께 키울수록 성능이 계속 향상됐으며, 적은 라벨만으로도 새로운 건강 예측 과제에 적용할 수 있음을 보였다. ## 웨어러블 건강 데이터가 가진 가능성과 한계 - 심박수, 움직임, 피부 온도, 혈중산소, 수면 등 웨어러블 데이터는 예방적·개인화 건강관리의 중요한 기반이다. - 사람마다 기본 생리 상태와 생활습관이 달라 같은 신호도 개인별 의미가 다를 수 있다. - 확진 진단, 검사 결과, 검증된 설문 같은 학습 라벨은 수집 비용이 높고 과거 데이터에 retrospectively 적용하기 어렵다. - 기존 모델은 특정 질환이나 결과 하나씩을 대상으로 설계돼 다른 건강 영역으로 일반화하기 어려웠다. ## 1조 분 분량의 다중 센서 사전학습 - 데이터는 2024년 9월부터 2025년 9월 사이 수집된 비식별화 데이터다. - 연구 활용에 동의한 500만 명의 참여자가 포함됐으며, 100개 이상 국가와 미국 50개 주, Fitbit·Pixel Watch 20개 이상 모델을 포괄한다. - 각 참여자에게서 수 주간의 데이터를 추출해 총 20억 시간, 1조 분 이상의 분 단위 신호를 구성했다. - 5개 센서 모달리티에서 도출한 34개 1분 집계 특성을 사용한다. - PPG: 심박수, 심박변이도, 혈중산소포화도 - 가속도계: 움직임과 걸음 수 - 피부전기활동(EDA): 피부 전도도 - 피부 온도 - 고도계: 활동 및 환경 변화 정보 - 데이터는 하루 24시간의 생리·행동 흐름을 표현한다. ## 결측 데이터를 활용하는 자기지도학습 - SensorFM은 정답 라벨 대신 마스킹된 센서 신호를 복원하는 방식으로 학습한다. - 웨어러블 데이터에는 센서 전원 주기, 기기 탈착, 절전 모드, 센서 비활성화 등으로 인한 결측과 단절이 일상적으로 발생한다. - 일반적인 자기지도학습은 이런 구간을 인위적으로 보간하거나 불완전한 구간을 버리지만, 두 방식 모두 편향을 만들거나 데이터를 낭비할 수 있다. - SensorFM의 AIM(Adaptive and Inherited Masking) 방식은 실제 결측 구간과 학습을 위해 인위적으로 가린 구간을 동일하게 취급한다. - 따라서 모델은 결측을 단순한 오류가 아니라 센서 데이터의 자연스러운 특성으로 학습하며, 불완전한 기록에서도 유용한 표현을 생성한다. ## 모델과 데이터 규모를 함께 확장한 효과 - 사전학습 데이터는 약 200만 시간부터 20억 시간까지, 모델은 10만 개부터 1억 개 파라미터까지 네 자릿수 범위로 실험했다. - 데이터와 모델 용량이 증가할수록 복원 손실과 실제 건강 과제 성능이 예측 가능하게 개선됐다. - 전체 데이터로 학습한 최대 모델 SensorFM-B는 가장 작은 모델보다: - 복원 손실 31% 감소 - 분류 과제 평균 AUC 9% 향상 - 회귀 과제 평균 피어슨 상관계수 21% 향상 - 데이터만 또는 모델 크기만 키우는 것보다 두 요소를 함께 확장할 때 가장 큰 효과가 나타났다. - 최대 모델은 35개 과제 중 33개에서 가장 높은 성능을 기록했으며, 성능 포화 징후도 나타나지 않았다. ## 하나의 표현으로 여러 건강 영역에 전이 - 3개 독립적이고 기관생명윤리위원회(IRB) 승인을 받은 전향적 연구에서 총 13,985명의 데이터를 활용했다. - 평가 과제는 다음 6개 영역의 35개 분류·예측 문제로 구성됐다. - 심혈관 건강 - 대사 위험 - 정신건강 - 수면 - 인구통계 - 생활습관 - SensorFM 인코더를 고정하고 그 위에 간단한 선형 헤드만 학습하는 방식으로 성능을 측정했다. - 센서에서 직접 설계한 특징을 이용한 지도학습 기준선보다 35개 중 34개 과제에서 우수했다. - 나이·성별 같은 인구통계 정보를 추가하면 성능이 소폭 상승했지만, 모델이 커질수록 추가 효과는 감소했다. - 이는 대형 모델이 사전학습만으로도 생리학적으로 의미 있는 개인 특성을 어느 정도 학습한다는 점을 시사한다. - 우울증과 불안처럼 센서 신호가 약하고 개인차가 큰 상태에서도 규모 확장의 효과가 특히 컸다. - 라벨 데이터가 일부만 있어도 인구통계 기반이나 수작업 특징 기반 모델을 빠르게 넘어섰다. ## 예측 헤드 구축을 자동화하는 에이전트 구조 - 범용 임베딩을 실제 예측 시스템에 적용하려면 과제별 특징 설계, 모델 구조 선택, 하이퍼파라미터 조정이 필요하다. - 연구진은 이 과정을 자동화하기 위해 여러 LLM 에이전트가 협력하고 경쟁하는 ‘교실(classroom)’ 구조를 만들었다. - 이 구조는 새로운 건강 예측 엔드포인트마다 수작업으로 예측 헤드를 설계해야 하는 부담을 줄이는 것을 목표로 한다. - 제공된 글은 해당 에이전트 시스템의 소개 도중 끝나므로, 구체적인 구성과 성능 수치는 본문만으로 확인할 수 없다. SensorFM의 실용적 의미는 웨어러블 데이터를 질환별 개별 모델이 아니라 재사용 가능한 공통 생리학 표현으로 다룬다는 데 있다. 다만 실제 의료 적용에는 데이터 편향, 개인정보 보호, 임상적 검증, 예측 결과의 해석 가능성에 대한 추가 평가가 필요하므로, 연구 성능을 곧바로 진단 도구로 간주해서는 안 된다.

원문 읽기(새 탭에서 열림)
google3분 읽기큐레이션 요약

협업의 힘: 교통 혼잡을 줄이는 방법

내비게이션 앱이 일부 차량의 경로만 분산해도 도시 전체의 교통 흐름과 배출량을 개선할 수 있다는 연구다. Google Research는 미국 10개 도시에서 혼잡 구간을 피해 비슷한 시간이 걸리는 대체 경로를 안내한 결과, 대상 도로의 속도와 연료 효율이 유의미하게 향상되는 것을 확인했다. 이는 개인별 최적 경로를 넘어, 네트워크 전체를 고려한 협력적 교통 관리가 가능함을 보여준다. ## 네트워크 단위 교통 최적화의 필요성 - 차량과 도로는 사람·물류 이동과 경제 활동을 뒷받침하지만, 교통 혼잡과 환경 비용도 크다. - 운전자는 평균적으로 평생 약 2.6년을 도로에서 보내며, 승용차와 밴은 전 세계 CO2 배출량의 약 10%를 차지한다. - 기존 내비게이션 서비스는 개별 운전자에게 가장 빠른 경로를 제공하는 데 집중했지만, 모든 차량의 경로를 고려한 시스템 전체 최적화는 충분히 구현되지 않았다. - 연결 차량, 스마트시티 인프라, 자율주행차의 확산으로 교통 흐름을 측정하고 조정할 수 있는 기반이 마련되고 있다. ## 혼잡 구간을 분산한 실험 설계 - 미국 주요 도시 10곳에서 6개월간 실험을 진행했다. - 각 도시에서 반복적으로 혼잡이 발생하거나 교통량이 높은 도로 구간 약 100개를 선정했다. - 실험일에는 Google Maps의 경로 알고리즘이 해당 구간의 비용을 높게 인식하도록 수정했다. - 대신 이동 시간이 비슷하고 도로 특성이 유사한 대체 경로를 우선 안내해 차량을 여러 도로로 분산했다. - 개별 차량을 무작위로 나누는 방식이 아니라, 도시 전체를 대상으로 다음 날에는 실험 경로, 그다음 날에는 기존 경로를 적용하는 스위치백(crossover) 설계를 사용했다. - 실제로 경로가 변경된 관측 차량은 전체의 2% 미만이었다. 즉, 소수의 차량만 조정해 전체 네트워크 효과를 측정했다. ## 교통 속도와 연료 효율 개선 - 분석에는 도시 단위와 시간대별 효과를 함께 추정하는 계층적 베이지안 모델을 사용했다. - 혼잡 대상으로 지정한 도로에서는: - 주행 속도가 중앙값 기준 약 2% 증가했다. - 연료 소비율은 약 0.5~1.0% 감소했다. - 경로 변경으로 영향을 받은 전체 도로 구간에서는: - 주행 속도가 중앙값 기준 약 0.35% 증가했다. - 출퇴근 등 교통량이 많은 시간대에는 약 0.5% 증가했다. - 이러한 개선은 통계적으로 유의미했으며, 도시 규모에 따라 도시당 연간 수천 톤의 CO2e 배출 저감으로 이어질 가능성이 있다. ## 차량 흐름 분산이 만든 네트워크 효과 - 차량을 단순히 한 도로에서 다른 도로로 옮긴 것이 아니라, 특정 병목 구간에 집중되던 교통량을 여러 주변 도로로 분산했다. - 대체 경로에 차량이 추가되었지만, 각 도로가 감당한 증가량은 상대적으로 작아 전체적인 평균 속도와 배출량이 개선됐다. - 애틀랜타 사례에서는 도심을 관통하는 중앙 고속도로의 차량이 주변부의 여러 도로로 분산됐다. - 효과는 해당 내비게이션 앱 사용자에게만 국한되지 않았다. 혼잡 구간이 완화되면서 앱을 사용하지 않는 운전자도 이동 시간 단축의 혜택을 받을 수 있었다. ## 향후 교통 관리로의 확장 - 이번 연구는 내비게이션 앱을 도시 교통을 능동적으로 조정하는 도구로 활용할 수 있음을 보여준다. - 향후에는 다음과 같은 시스템으로 확장할 수 있다. - 실시간 교통 신호 제어 - 도로 네트워크 전체의 동적 경로 최적화 - 차량·도로 인프라·스마트시티 센서 간 협력 - 자율주행차를 포함한 실시간 교통 수요 분산 - 다만 이번 결과는 비교적 단순한 우회 안내에 기반한 것이므로, 더 복잡한 도시 환경과 장기적인 운전자 경로 선택 변화에 대한 추가 검증이 필요하다. 실용적으로는 모든 운전자에게 무조건 가장 짧은 경로를 제시하기보다, 일부 차량에 비슷한 시간의 대체 경로를 분산 안내하는 방식이 효과적이다. 개인의 이동 시간을 크게 희생하지 않으면서도 도시 전체의 정체와 배출량을 줄일 수 있다는 점이 이 연구의 핵심적인 시사점이다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

TabFM 소개: 표 형식 데이터를 위한 제로샷 파운데이션 모델

TabFM은 표 형식 데이터를 위한 제로샷 파운데이션 모델로, 별도의 모델 학습·하이퍼파라미터 튜닝·복잡한 피처 엔지니어링 없이 분류와 회귀를 수행한다. 전체 학습 데이터와 예측 대상 행을 하나의 문맥으로 입력해 인컨텍스트 러닝(ICL) 방식으로 관계를 파악하며, 단 한 번의 순전파로 예측을 생성한다. Google은 TabArena 평가에서 TabFM이 기존의 튜닝된 트리 기반 모델들과 경쟁력 있는 성능을 보였다고 설명하며, BigQuery의 `AI.PREDICT` SQL 명령으로 제공할 계획이다. ## 기존 표 형식 머신러닝의 한계 - 고객 이탈 예측, 금융 사기 탐지 등 표 데이터 기반 분류·회귀 문제는 기업의 핵심 업무에 널리 사용된다. - AdaBoost, XGBoost, 랜덤 포레스트 같은 지도학습 트리 모델이 오랫동안 강력한 성능을 보여왔다. - 하지만 새로운 데이터셋마다 다음 작업을 반복해야 한다. - 모델 학습 - 하이퍼파라미터 최적화 - 도메인별 피처 엔지니어링 - 검증 및 재학습 - 따라서 단순히 `.fit()`을 호출하는 것만으로는 실무에서 신뢰할 만한 성능을 얻기 어렵다는 문제가 있다. ## 표 데이터를 위한 인컨텍스트 러닝 - TabFM은 기존처럼 데이터셋별로 모델 가중치를 업데이트하지 않는다. - 과거의 학습 행과 예측할 테스트 행을 하나의 통합된 입력 문맥으로 제공한다. - 모델은 추론 시점에 행과 열 사이의 관계를 분석해 새로운 작업을 수행한다. - 이는 대규모 언어 모델이 예시와 지시문만으로 새로운 작업을 수행하는 제로샷·인컨텍스트 러닝과 유사하다. - 결과적으로 데이터셋별 반복 학습, 튜닝, 수작업 피처 설계가 필요하지 않다. ## 행·열 구조를 반영한 하이브리드 아키텍처 표는 자연어처럼 일렬로 정렬된 토큰 시퀀스가 아니라, 행과 열로 구성된 2차원 구조이며 행이나 열의 순서를 바꿔도 의미가 본질적으로 달라지지 않는다. TabFM은 이를 처리하기 위해 TabPFN과 TabICL의 아이디어를 결합한 구조를 사용한다. - **행·열 교차 어텐션** - 여러 층의 어텐션 모듈이 열 방향과 행 방향을 번갈아 처리한다. - 각 피처의 상호작용과 각 샘플 간의 관계를 함께 학습한다. - 기존 피처 엔지니어링이 담당하던 복잡한 변수 간 의존성 추출을 모델 내부에서 수행한다. - **행 압축** - 각 행에서 얻은 풍부한 문맥 정보를 하나의 밀집 벡터로 압축한다. - 이후 단계가 원본 2차원 테이블 전체가 아니라 압축된 행 표현을 사용하도록 만든다. - **압축 표현 기반 ICL** - 전용 Transformer가 압축된 행 벡터들의 시퀀스에 어텐션을 적용한다. - 원시 테이블 전체에 직접 어텐션하는 방식보다 계산량이 크게 줄어든다. - 데이터셋 규모가 커져도 비교적 효율적으로 예측할 수 있도록 설계됐다. ## 합성 데이터로 대규모 사전 학습 - 산업용 표 데이터는 기업의 독점 스키마와 민감한 정보를 포함하는 경우가 많아 공개된 대규모 학습 데이터가 부족하다. - TabFM은 이 문제를 해결하기 위해 수억 개의 합성 데이터셋으로만 학습됐다. - 합성 데이터는 구조적 인과 모델(SCM)을 이용해 동적으로 생성된다. - 다양한 무작위 함수와 데이터 분포, 복잡한 피처 관계를 포함하도록 설계됐다. - 실제 데이터를 직접 대량 확보하지 않고도 다양한 표 구조를 학습해, 보지 못한 실제 데이터셋에 일반화하는 것을 목표로 한다. ## TabArena 벤치마크와 두 가지 모델 설정 - TabArena에서 분류 38개, 회귀 13개 데이터셋을 대상으로 평가했다. - 데이터셋 크기는 약 700개에서 150,000개 샘플까지 다양하다. - 모델 간 일대일 승률을 바탕으로 Elo 점수를 계산해 성능을 비교한다. - **TabFM** - 기본 제공 모델이다. - 튜닝이나 교차 검증 없이 한 번의 순전파로 예측한다. - 제로샷 사용 편의성을 중시한 설정이다. - **TabFM-Ensemble** - 성능 향상을 위해 교차 피처와 SVD(특이값 분해) 피처를 추가한다. - 비음수 최소제곱법으로 32개 모델 앙상블의 최적 가중치를 계산한다. - 분류 문제에서는 Platt scaling을 이용해 예측 확률을 보정한다. - 기본 TabFM보다 추가 계산과 처리 과정이 필요하지만 더 높은 성능을 목표로 한다. ## 제공 방식과 기대 효과 - TabFM은 Hugging Face와 GitHub를 통해 공개된다. - Google BigQuery에도 통합될 예정이며, 사용자는 `AI.PREDICT` SQL 명령으로 분류·회귀를 실행할 수 있다. - 별도의 머신러닝 전문 지식이나 전통적인 모델 개발 파이프라인 없이 표 데이터 예측을 수행하는 것이 목표다. 실무에서는 빠른 기준선 모델이나 반복적인 데이터셋별 모델 개발을 줄이는 용도로 TabFM을 먼저 적용할 수 있다. 다만 중요한 의사결정에 사용할 때는 데이터 누수, 예측 확률의 보정, 기존 모델과의 실제 데이터셋별 비교 및 비용·지연 시간까지 함께 검증하는 것이 좋다.

원문 읽기(새 탭에서 열림)
google3분 읽기큐레이션 요약

열 회복력 데이터를 전 세계 50개 이상의 도시로 확대하기

Google Research는 건물별 지붕 반사율(albedo)을 분석한 데이터를 50개 이상 글로벌 도시로 확대 공개했다. Sentinel-2 위성 영상과 30cm급 상업 위성 영상을 AI로 결합해 개별 건물 단위의 저반사 지붕을 식별하고, 도시가 쿨 루프(cool roof) 도입 지역을 우선순위화할 수 있도록 한 것이다. 연구에 따르면 이러한 표적형 개입은 전 세계 도시의 극심한 더위를 최대 0.5°C까지 완화할 가능성이 있다. ## 도시 열섬과 쿨 루프의 필요성 - 극심한 더위로 매년 약 50만 명이 사망하며, 도시 지역은 전 세계 평균보다 약 두 배 빠르게 따뜻해지고 있다. - 어두운 지붕과 도로는 태양 에너지를 많이 흡수하고, 녹지 부족은 도시의 열 배출을 어렵게 만든다. - 지붕의 반사율을 높이면 건물이 흡수하는 태양 복사 에너지를 줄여 지표면 온도를 낮출 수 있다. - 쿨 루프는 비교적 비용 효율적인 열 완화 수단으로, 취약 지역과 취약 계층을 보호하는 데 활용될 수 있다. ## 건물 단위 반사율을 산출하는 AI 방법 - 기존 Sentinel-2 기반 반사율 데이터는 전 세계적으로 이용 가능하지만 해상도가 10m라 개별 지붕을 구분하기 어렵다. - 연구진은 다음 두 종류의 데이터를 결합했다. - Sentinel-2: 전 세계 범위와 방사학적 정확성 제공 - Airbus Pléiades Neo: 30cm급 고해상도 공간 정보 제공 - 머신러닝과 방사 보정 기법을 적용해 서로 다른 파장대의 정보를 융합하고, 도시 각 픽셀의 종합적인 스펙트럼 반사 특성을 재구성했다. - 그 결과 반사율 분석 해상도를 10m에서 30cm로 높여 개별 건물별 분석이 가능해졌다. ## 정확도 검증과 활용 가능성 - 콜로라도주 볼더에서 항공 초분광 영상으로 수집한 지상 기준 데이터와 결과를 비교했다. - 30cm급 융합 반사율 지도는 기준 데이터 대비 RMSE 0.04를 기록해 높은 정밀도를 보였다. - 도시 전체나 동네 평균이 아니라 다음과 같은 건물을 직접 선별할 수 있다. - 반사율이 낮은 대형 건물 - 열 취약 지역에 위치한 건물 - 쿨 루프 개조 효과가 클 것으로 예상되는 건물 - 이를 통해 도시 계획자는 제한된 예산을 가장 효과적인 건물과 지역에 우선 배분할 수 있다. ## Heat Resilience Earth Engine App - Google은 분석 결과를 의사결정자가 활용할 수 있도록 고해상도 Earth Engine 앱으로 공개했다. - 주요 기능은 다음과 같다. - **건물 단위 시각화:** 저반사 지붕을 건물 중심점 형태로 표시 - **기준선 분석:** 현재 도시·건물의 반사율을 파악하고 시간에 따른 변화를 추적 - **데이터 다운로드:** 지역 분석과 정책 수립을 위해 고해상도 데이터 반출 - **동적 확대:** 인구조사 구역 단위 집계에서 개별 건물 정보로 단계적으로 확대 - 공개 데이터는 도시가 쿨 루프 정책, 기후 적응 계획, 반사 표면 도입 전략을 수립하는 데 활용될 수 있다. ## 50개 이상 도시로 확대된 데이터 - 이번 공개 데이터는 9개 국가의 50개 이상 도시를 포함한다. - 주요 대상 도시로 다음 지역이 언급됐다. - 유럽: 런던, 아테네, 바르셀로나 - 브라질: 리우데자네이루, 상파울루 - 미국: 로스앤젤레스, 오스틴, 뉴욕 - 2024년에는 14개 도시를 대상으로 시범 적용했으며, 일부 도시는 이를 바탕으로 쿨 루프 조례와 기후 적응 계획을 추진했다. - 데이터와 앱은 공개되어 도시 정부, 연구자, 계획 담당자가 직접 탐색하고 분석할 수 있다. 도시 계획자는 Heat Resilience Earth Engine App에서 취약 지역과 저반사 건물을 먼저 확인한 뒤, 현장 검증과 비용·효과 분석을 결합해 쿨 루프 사업의 우선순위를 정하는 것이 바람직하다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

동결된 멀티 토큰 예측으로 Pixel에서 Gemini Nano 모델 가속하기

기존 Gemini Nano v3 모델을 다시 학습하지 않고도 Multi-Token Prediction(MTP)을 추가해 Pixel 기기에서 온디바이스 추론을 가속하는 방법을 소개한다. 별도의 드래프터 모델 대신 본 모델에 가벼운 MTP 헤드를 붙이고, 기존 KV 캐시를 공유하는 zero-copy 구조를 사용해 메모리와 지연 시간을 줄였다. 그 결과 Pixel 9·10의 일부 기능에서 토큰 생성 속도가 50% 이상 향상되고, 인스턴스당 최대 130MB의 메모리를 절약했다. ## 모바일에서 자동회귀 생성이 느린 이유 - 기존 언어 모델은 한 번에 하나의 토큰만 생성하므로, N개 토큰을 만들려면 대형 모델의 추론을 N번 수행해야 한다. - 모바일 기기는 서버보다 RAM과 전력 예산이 제한적이다. - 토큰을 순차적으로 생성하는 과정은 연산 자원을 충분히 활용하지 못하고 메모리 대역폭과 배터리를 많이 소모한다. - 알림 요약, 메시지 교정처럼 짧은 응답도 빠르게 처리해야 하므로 추론 효율이 사용자 경험에 직접 영향을 준다. ## 별도 드래프터의 한계와 MTP - speculative decoding은 다음과 같은 두 단계로 동작한다. - **Draft:** 작은 드래프터 모델이 여러 후보 토큰을 빠르게 생성한다. - **Verify:** 대형 모델이 후보들을 병렬로 검증하고, 일치하는 토큰만 수용한다. - 별도 드래프터 모델은 추가 파라미터와 RAM을 필요로 한다. - 본 모델이 이미 계산한 풍부한 의미 정보를 활용하지 못하고, 텍스트 이력만으로 후보를 예측한다. - MTP는 별도 언어 모델 대신 본 모델의 마지막 층에 경량 Transformer 기반 MTP 헤드를 추가한다. - MTP 헤드는 본 모델의 hidden state를 이용해 여러 미래 토큰을 예측하고, 본 모델은 이를 병렬 검증한다. - 이러한 구조를 글에서는 본 모델의 깊은 지점에서 빠져나와 토큰을 예측하는 **“late exit” 전략**으로 설명한다. ## 동결된 백본에 MTP 헤드 추가 - 이미 배포된 Gemini Nano v3의 가중치는 그대로 동결한다. - 새로 학습하는 부분은 미래 토큰 예측을 담당하는 MTP 헤드뿐이다. - 기존 모델 전체를 다시 사전 학습하거나 별도 드래프터를 작업별로 미세 조정할 필요가 없다. - 백본을 동결하므로 기본 모델의 성능과 안전 정렬을 변경하지 않는다. - 잘못된 후보 토큰은 검증 단계에서 폐기되기 때문에 최종 출력은 기존 대형 모델과 비트 단위로 동일하다. - 따라서 기존 모델과의 하위 호환성을 유지하면서 추론 효율만 개선할 수 있다. ## KV 캐시를 공유하는 zero-copy 구조 - 일반적인 별도 드래프터는 자체 KV 캐시를 생성하고 유지해야 하므로 메모리를 중복 사용한다. - 제안된 MTP 헤드는 본 모델의 KV 캐시에 직접 cross-attention으로 접근한다. - 별도 프롬프트 처리(prefill)나 독립적인 과거 문맥 저장이 필요하지 않다. - 주요 효과는 다음과 같다. - 드래프터가 프롬프트를 다시 처리하지 않아 prefill 지연 감소 - 드래프터 전용 임베딩 테이블과 attention 구조 제거 - 애플리케이션별 튜닝 파라미터 및 중복 KV 캐시 절감 - standalone 드래프터와 비교해 인스턴스당 최대 130MB의 메모리를 절약했다. ## 풍부한 표현이 만드는 예측 정확도 향상 - MTP 헤드는 대형 백본이 이미 계산한 최종 hidden state를 활용하므로 별도 드래프터보다 정확한 후보를 생성한다. - Pixel 9에서 비슷한 규모의 standalone 드래프터보다 작업에 따라 50% 이상의 속도 향상을 보였다. - 복잡한 지시를 따르는 요약·재작성 작업에서 MTP가 크게 우수했다. - 스마트 답장처럼 문장 구조가 예측 가능한 작업에서는 본 모델의 구문 패턴을 잘 학습했다. - 이런 작업에서는 토큰 수용률이 최대 55% 향상됐다. ## Pixel 실사용 결과 - Gemini Nano MTP는 Pixel 9 및 Pixel 10 시리즈에 배포됐다. - 검증과 드래프팅 사이의 의존성을 처리하도록 온디바이스 추론 스택도 함께 재설계했다. - AI 알림 요약과 Proofread 같은 실제 작업에서 추론 한 번당 평균 약 2개의 추가 토큰을 정확히 예측했다. - 수용되는 토큰이 많아지면서 전체 검증 횟수가 감소했다. - 무거운 프로세서를 깨우는 횟수도 줄어들어 응답 시간이 짧아지고 배터리 사용량이 감소했다. ## 실용적인 결론 이미 배포된 온디바이스 모델을 유지해야 하는 경우, 별도 드래프터를 추가하는 것보다 동결된 백본에 MTP 헤드를 붙이고 KV 캐시를 공유하는 방식이 효율적이다. 특히 메모리와 전력이 제한된 모바일 환경에서 모델 출력의 동일성을 유지하면서 속도와 배터리 효율을 함께 개선할 수 있는 현실적인 최적화 전략이다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

선형 탄력적 캐싱으로 클라우드 비용 효율성 최적화

인메모리 캐시는 성능을 높이지만, 고정된 메모리 크기로 운영하면 수요가 낮을 때 비용이 낭비되고 수요가 많을 때 캐시 미스로 성능이 저하된다. 선형 탄력적 캐싱은 메모리 점유 비용과 캐시 미스 비용의 균형을 ‘스키 대여 문제’로 모델링해, 워크로드에 따라 페이지별 보관 시간과 캐시 크기를 동적으로 조정한다. Spanner 실험에서는 메모리 사용량을 15.5%, 총소유비용(TCO)을 약 5% 줄이면서 캐시 미스 증가는 5.5%에 그쳤다. ## 고정 크기 캐시의 비용 문제 - 기존 캐시는 미리 정한 메모리 용량 안에서 LRU 같은 정책으로 데이터를 제거한다. - 캐시가 너무 작으면 디스크나 다른 저장 시스템에 대한 접근이 늘어 성능이 떨어진다. - 반대로 피크 수요에 맞춰 캐시를 크게 잡으면 평상시 사용하지 않는 메모리 비용이 발생한다. - 특히 클라우드와 서버리스 환경에서는 메모리 용량과 사용 시간이 직접 비용으로 연결된다. ## 스키 대여 문제로 모델링한 캐싱 - 각 데이터 페이지는 다음 두 선택지 사이에서 판단된다. - **대여:** 데이터를 RAM에 유지하면서 메모리 비용을 계속 지불한다. - **구매:** 데이터를 제거해 메모리 비용을 아끼지만, 재요청 시 캐시 미스에 따른 지연 및 I/O 비용을 부담한다. - 페이지를 너무 오래 보관하면 메모리 비용이 커지고, 너무 빨리 제거하면 캐시 미스 비용이 커진다. - 전통적인 스키 대여 알고리즘은 누적 대여 비용이 재취득 비용과 같아지는 시점에 데이터를 제거하는 손익분기 전략을 사용한다. - 연구진은 최악의 경우를 보장하는 방식뿐 아니라, 실제 워크로드의 반복적인 접근 패턴을 학습해 더 나은 TTL을 예측하는 방법을 적용했다. ## TTL과 물리적 캐시 용량의 분리 - 이론적으로 캐시의 핵심 문제를 다음 두 부분으로 나눌 수 있음을 보였다. - 각 페이지를 얼마나 오래 보관할지 결정하는 문제 - 캐시가 실제로 가득 찼을 때 어떤 페이지를 제거할지 결정하는 문제 - 페이지 요청 시 스키 대여 알고리즘이 해당 페이지의 TTL을 계산한다. - TTL이 만료되기 전 재접근이 없으면 페이지를 자동으로 제거한다. - 캐시가 물리적으로 가득 차면 LRU 같은 전통적인 제거 정책이 보조적으로 작동한다. - 이 분리 덕분에 동적 캐시 크기 조절을 기존 캐시 시스템에 비교적 간단히 통합할 수 있다. ## Spanner의 경량 머신러닝 적용 - Spanner의 초당 수십억 건 요청을 처리하기 위해 TTL 예측 모델은 매우 가벼워야 했다. - 연구진은 몇 줄의 C++ 코드로 변환 가능한 얕은 결정 트리를 사용했다. - 모델이 고려한 주요 특징은 다음과 같다. - 데이터 페이지의 크기 - 캐시 미스 발생 시 데이터를 다시 가져오는 비용 - 수행되는 데이터베이스 연산의 유형 - 페이지의 과거 접근 패턴 - 결정 트리는 해석 가능하므로, 어떤 데이터가 오래 캐시할 가치가 있는지도 분석할 수 있다. ## Spanner 운영 환경의 실험 결과 - 고정 크기 캐시와 비교했을 때: - 메모리 사용량 **15.5% 감소** - 캐시 미스 **5.5% 증가** - 총소유비용(TCO) 약 **5% 감소** - 캐시 미스 증가는 비용이 낮은 데이터에 집중됐다. - 저장 시스템에 실제로 발생한 I/O 비용 증가는 약 **0.5%**에 불과했다. - 즉, 모든 캐시 미스를 동일하게 줄이기보다, 재취득 비용이 큰 데이터는 유지하고 저렴한 데이터는 적극적으로 제거하는 비용 인식형 전략이 효과적이었다. ## 공개 캐시 트레이스 검증 - Google 인프라에만 특화된 결과인지 확인하기 위해 다양한 공개 캐시 추적 데이터를 사용했다. - 고정 크기 캐시의 기준 정책으로는 페이지 크기가 서로 다른 상황을 처리할 수 있는 GDSF를 사용했다. - 여러 탄력적 캐시 변형을 비교했다. - 손익분기 스키 대여 정책 - 무작위화된 스키 대여 정책 - 학습된 TTL을 사용하는 정책 - 애플리케이션 수준의 특징이 없는 공개 데이터에서는 각 페이지별 최적 TTL을 학습했다. - 트레이스를 학습과 테스트로 나누고, 테스트 전에 일정 기간 캐시를 채우는 워밍업 절차를 적용했다. - 학습 데이터에서 관찰된 페이지는 미리 계산한 TTL을 사용하고, 처음 등장한 페이지는 기본 스키 대여 정책으로 처리했다. ## 다양한 워크로드에서의 효과 - 실험 결과, 탄력적 캐싱은 다양한 워크로드에서 고정 크기 캐시보다 일관되게 낮은 비용을 보였다. - 메모리 비용이 캐시 미스 비용보다 비싸질수록 탄력적 캐싱의 절감 효과가 커졌다. - 비슷한 메모리 규모를 사용하는 경우에도 탄력적 정책이 더 낮은 캐시 미스율을 보였다. - 캐시 크기를 수요에 맞춰 자동 조정하기 때문에 유휴 메모리 낭비를 줄이면서 성능을 유지할 수 있다. 실무에서는 모든 페이지를 동일하게 취급하는 LRU만 사용하기보다, 페이지 크기와 재조회 비용을 반영해 TTL을 차등 설정하는 방식이 유용하다. 특히 메모리 비용이 높고 데이터별 재취득 비용 차이가 큰 클라우드 데이터베이스에서는 선형 탄력적 캐싱을 적용해 비용 절감 효과를 측정해볼 만하다.

원문 읽기(새 탭에서 열림)
google3분 읽기큐레이션 요약

회상을 위한 사고: 추론은 LLM의 파라메트릭 지식을 어떻게 끌어내는가

LLM의 추론 과정은 복잡한 논리 문제가 없어도 단순한 사실을 회상하는 데 도움을 준다. 연구진은 그 이유로 생성된 추론 토큰이 추가 계산 공간으로 작동하는 효과와, 관련 사실을 먼저 떠올려 정답을 활성화하는 사실 프라이밍을 제시한다. 다만 중간에 생성한 사실이 환각일 수 있어, 이 방식은 정확성 검증과 함께 사용해야 한다. ## 단순한 사실 회상에도 추론이 효과적인 이유 - 일반적으로 Chain-of-Thought(CoT)는 수학, 프로그래밍, 다단계 질의응답처럼 복잡한 문제를 단계적으로 해결할 때 유용하다. - 그러나 “Mary Engle Pennington이 National Inventors Hall of Fame에 헌액된 연도는?”처럼 단일 사실을 묻는 질문에는 명시적인 논리 전개가 필요하지 않다. - 연구진은 이런 질문에서도 추론을 허용하면, 추론을 끈 상태에서는 사실상 회수하기 어려운 정답이 생성될 수 있음을 확인했다. - 실험에는 Gemini-2.5 Flash/Pro와 Qwen3-32B, SimpleQA Verified 및 EntityQuestions 데이터셋이 사용됐다. ## 지식 회수 한계 측정: pass@k - `pass@k`는 한 번의 최상위 답변만 보는 대신, 여러 번 생성한 답변 중 정답이 포함되는지를 측정한다. - 이를 통해 정답이 모델의 출력 분포 안에 잠재적으로 존재하는지, 현재 최상위 답변으로 선택되지 않았을 뿐인지 구분할 수 있다. - 추론 ON/OFF 모드를 비교한 결과, 세 모델과 두 데이터셋에서 추론을 활성화했을 때 정답 회수율이 일관되게 향상됐다. - 데이터셋이 주로 단순한 단일 단계 질문으로 구성되어 있어, 성능 향상이 복잡한 문제 분해 때문이라고 보기 어렵다. ## 생성 토큰이 제공하는 계산 버퍼 - 첫 번째 메커니즘은 추론 토큰이 모델에 추가적인 계산 시간과 내부 상태 갱신 기회를 제공한다는 것이다. - 연구진은 모델의 자연스러운 추론 내용을 제거하고, `"Let me think"` 같은 무의미한 문자열을 원래 추론과 같은 길이로 반복해 넣었다. - 의미 없는 토큰만 제공해도 추론을 완전히 끈 경우보다 사실 회상 성능이 크게 향상됐다. - 이는 추가 토큰이 의미를 전달하지 않더라도 여러 번의 forward pass를 통해 모델이 내부 표현을 정제하고, 접근하기 어려운 지식을 검색하게 만들 수 있음을 시사한다. - 다만 토큰을 계속 늘리면 효과가 감소하며, 자연스러운 추론의 성능에는 도달하지 못했다. - 따라서 계산량 자체가 중요하지만, 추론 과정에 포함된 실제 내용도 추가적인 역할을 한다. ## 관련 사실을 떠올리는 사실 프라이밍 - 자연스러운 추론을 분석한 결과, 모델은 논리적 증명을 수행하기보다 질문과 관련된 주변 사실을 먼저 나열하는 경우가 많았다. - 연구진은 이를 인간 기억의 ‘ spreading activation’과 유사한 현상으로 보고, **사실 프라이밍(factual priming)**이라고 명명했다. - 관련 사실을 생성하면 질문과 정답 사이에 의미적 연결 고리가 형성되어, 목표 사실을 회상하기 쉬워진다. - 실험에서는 추론 과정에서 나온 구체적인 사실만 추출하고, 채움말, 검색 계획, 정답 자체에 대한 직접 언급은 제거했다. - 짧은 사실 목록만 정답 생성에 제공해도 추론이 만들어내는 성능 향상의 상당 부분이 재현됐다. - 예를 들어 네팔의 제10대 왕을 묻는 질문에서 모델이 앞선 9명의 왕을 먼저 떠올리면, 이 정보들이 제10대 왕을 회상하기 위한 의미적 준비 단계로 작동할 수 있다. - 이 효과는 추론 모드가 꺼진 상태에서 사실 목록을 추가 문맥으로 제공했을 때도 나타났다. ## 환각으로 인한 위험 - 사실 프라이밍은 모델이 중간 사실을 스스로 생성한다는 점에서 근본적인 위험을 가진다. - 중간에 떠올린 관련 사실이 실제 지식이 아니라 환각일 경우, 잘못된 정보가 정답 회상을 방해하거나 오답을 강화할 수 있다. - 제공된 글은 이 위험을 검증하는 실험을 소개하는 도중에 끝나므로, 환각의 구체적인 측정 결과와 완화 방법은 확인할 수 없다. ## 실용적인 결론 - 단순한 사실 질문에서도 모델의 추론을 허용하면 잠재 지식 회수율을 높일 수 있다. - 성능 향상은 충분한 생성 길이를 제공하는 것과, 관련 사실을 먼저 회상하도록 유도하는 방식에서 비롯된다. - 다만 중간 추론을 그대로 신뢰하지 말고, 외부 검색·검증 또는 여러 독립 샘플의 일치 여부를 함께 확인하는 것이 안전하다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

픽셀에서 계획으로: 자연 복원을 위한 지구 AI

고해상도 딥러닝과 위성·LiDAR 데이터를 활용하면 기존 산림 조사에서 놓치던 생울타리, 방풍림, 작은 숲과 같은 미세한 생태 요소를 정밀하게 지도화할 수 있다. Google Research는 영국 전역의 픽셀 기반 지도인 *Farmscapes 2020*을 생태적 의미를 가진 벡터 데이터로 변환해, 탄소 저장량과 생물다양성 관리에 직접 활용할 수 있는 인벤토리를 공개했다. 이는 농경지를 크게 전환하지 않고도 기후변화와 생태계 훼손에 대응하는 방법을 제시한다. ## 농업과 자연 복원의 충돌 - 인구 증가로 식량 생산을 위한 농경지가 필요하지만, 대규모 산림 조성은 농업용지와 경쟁할 수 있다. - 한 지역의 보전 활동이 다른 지역의 개발이나 훼손을 유발하는 ‘누출(leakage)’ 문제도 발생할 수 있다. - 생울타리, 방풍림, 작은 숲과 같은 세밀한 목본 구조물은 농작물 생산을 크게 방해하지 않으면서 다음과 같은 기능을 제공한다. - 탄소 저장 - 수질 정화 - 야생동물 서식지와 이동 통로 제공 - 농경지 생태계의 연결성 강화 - 그러나 이러한 요소는 규모가 작아 기존 국가 단위 산림 조사나 일반 위성 분석에서 산림으로 인식되지 않는 경우가 많다. ## 픽셀 지도에서 활용 가능한 벡터 데이터로 - 기존 *Farmscapes 2020*은 영국 전역의 미세한 목본 지형을 식별한 고해상도 래스터, 즉 픽셀 기반 지도였다. - 래스터 데이터는 탐지에는 유용하지만, 실제 복원 사업이나 탄소 회계에 활용하려면 개별 객체의 경계와 유형을 가진 벡터 데이터가 필요하다. - 새 벡터 데이터셋은 다음 요소를 개별 도형으로 표현한다. - 생울타리 - 돌담 - 작은 숲과 나무 군락 - 선형 목본 통로 - 이를 통해 토지 소유자와 보전 기관은 특정 생태 요소의 위치와 규모를 파악하고, 보호·확장 계획을 세울 수 있다. ## 복잡한 농촌 지형을 표현하는 기술적 과제 - 농촌의 지형 요소는 서로 독립적이지 않다. - 생울타리가 밭 경계를 따라 형성될 수 있다. - 돌담이 생울타리 아래에 겹쳐 있을 수 있다. - 단일 레이어 모델은 지표면의 경계와 그 위에 존재하는 나무·벽을 동시에 표현하기 어렵다. - 대규모 지도를 S2 셀 단위로 나누어 처리하면, 셀 경계에서 하나의 생울타리나 숲이 인위적으로 잘리는 문제가 생긴다. - 영국 전역 13만㎢ 이상에서 수백만 개의 목본 요소를 처리해야 하므로, 일반적인 래스터-벡터 변환 방식은 계산량과 저장 공간 측면에서 비효율적이다. ## 사전 학습된 AI로 적은 학습 데이터 보완 - 영국 농촌의 생울타리처럼 구체적인 지형 유형을 학습시키려면 전문적으로 주석 처리된 데이터가 필요하지만, 확보된 데이터는 약 247㎢에 불과했다. - 연구진은 3억 장 이상의 전 세계 위성 이미지를 학습한 Remote Sensing Foundations의 Vision Transformer(ViT) 백본을 활용했다. - 전 세계 지형의 질감과 공간 패턴을 미리 학습한 모델을 영국의 특정 경관에 맞게 미세 조정해, 적은 주석 데이터로도 높은 정밀도를 확보했다. - 이 방식은 특정 지역의 데이터가 부족한 경우에도 대규모 지리 공간 모델을 적용할 수 있게 한다. ## 이중 레이어와 셀 경계 병합 - 지표면과 지상 구조물을 분리해 표현하기 위해 두 종류의 데이터를 함께 사용했다. - 서브미터급 영상: 밭, 물, 토지 경계 등 지표면 정보 - 1미터 LiDAR: 나무와 돌담처럼 지표면 위에 있는 구조물 정보 - 이중 레이어 라벨링을 통해 같은 위치에서 지면의 용도와 그 위의 목본·인공 구조물을 동시에 파악했다. - S2 셀별로 나뉜 도형은 별도의 확장 가능한 병합 알고리즘으로 연결했다. - 그 결과 셀 경계에서 잘린 객체도 하나의 완전한 지형 요소로 복원할 수 있었다. ## 기하학으로 생태적 기능 분류 - AI가 식생을 탐지하는 것만으로는 작은 숲과 긴 생울타리를 구분하기 어렵다. - 연구진은 도형의 형태를 수치화하는 Polsby–Popper 조밀도(compactness) 점수를 사용했다. - 형태별 분류 기준은 다음과 같다. - **산림:** 지름 30m 이상의 크고 연속적인 수관 - **목본 패치:** 작은 숲, 나무 군락, 개별 나무 - **선형 목본 요소:** 길고 좁은 형태를 가지며 조밀도 점수가 0.5 미만인 생울타리·생태 통로 - 이 방법으로 단순한 ‘녹색 영역’이 아니라 야생동물 이동에 중요한 선형 통로를 별도로 추출할 수 있었다. ## Google Earth Engine을 통한 전국 규모 처리 - 수백만 개의 지형 객체를 한꺼번에 처리하기 위해 Google Earth Engine을 사용했다. - 수천 개의 S2 셀을 병렬 처리해 기존 시스템의 계산 한계를 우회했다. - 이를 통해 영국 전역의 개별 목본 요소를 벡터 도형으로 변환하고, 대규모 자연 복원에 사용할 수 있는 데이터셋을 구축했다. ## 향후 활용 가능성 - 고정밀 탐지 기술은 실바목축(silvopasture), 혼농임업(agrisilviculture) 같은 자연 기반 해법에서 세밀한 목본 요소의 탄소·생태 가치를 산정하는 데 활용될 수 있다. - 보전 사업 주변에서 발생하는 누출, 즉 사업 지역 밖에서 탄소 저장이나 생물다양성 손실이 발생하는 현상도 감시할 수 있다. - 공개 데이터는 농민, 과학자, 정책 입안자가 기존 농경지를 크게 훼손하지 않고 생울타리와 작은 숲을 보호·확장하는 데 도움을 줄 수 있다. 이 사례는 자연 복원이 반드시 대규모 산림 조성만을 의미하지 않으며, 농경지 곳곳의 작은 생태 요소를 정확히 측정하고 관리하는 것에서도 시작될 수 있음을 보여준다. 이를 실제 사업에 적용할 때는 벡터 데이터와 현장 조사, 탄소·생물다양성 지표를 함께 검증하는 것이 바람직하다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

사용하지 않는 휴대폰으로 만드는 저탄소 컴퓨팅 플랫폼

사용이 끝난 스마트폰의 메인보드를 모아 클러스터로 구성하면, 새 서버 제조를 줄이면서 저비용·저탄소 클라우드 컴퓨팅 플랫폼으로 재활용할 수 있다. UC 샌디에이고와 Google은 2,000대의 Pixel 스마트폰으로 데이터센터를 구축해 교육·연구용 컴퓨팅을 제공할 계획이다. 이 방식은 스마트폰의 제한된 메모리와 코어 수에 맞는 작업을 선별하고, 대규모 배포에서 소비자용 하드웨어의 신뢰성을 검증하는 것을 목표로 한다. ## 컴퓨팅의 탄소 배출과 스마트폰 재활용 - 컴퓨팅의 탄소발자국은 크게 두 가지다. - **운영 탄소**: 기기 사용 중 소비되는 전력에서 발생하는 배출량 - **내재 탄소**: 하드웨어 제조와 원자재 추출 과정에서 발생하는 배출량 - 전력 효율 향상과 재생에너지 사용으로 운영 탄소는 줄일 수 있지만, 제조 과정의 내재 탄소는 해결이 더 어렵다. - 사람들은 평균 4년마다 스마트폰을 교체하지만, 교체된 기기에도 프로세서, 가속기, 메모리, 저장장치 등 핵심 컴퓨팅 기능이 남아 있다. - 기존 스마트폰을 재사용하면 새 하드웨어 생산과 추가적인 원자재 채굴을 피할 수 있다. ## 스마트폰과 서버의 성능 차이 - 2023년형 Pixel Fold의 고성능 코어는 SPEC 벤치마크에서 일부 최신 데이터센터 서버의 단일 코어 성능을 웃돈다. - 다만 스마트폰은 서버보다 다음과 같은 제약이 있다. - 코어 수가 적고 CPU 구성이 이기종임 - 메모리가 약 8~12GB로 제한됨 - 서버처럼 대규모 멀티스레드 처리나 대용량 메모리를 제공하지 못함 - 따라서 하나의 스마트폰에 들어갈 수 있거나, 여러 기기로 분할할 수 있는 작업이 적합하다. - 벤치마크상 약 25~50대의 스마트폰이 현대적인 서버 한 대에 해당하는 성능을 낼 수 있다. ## 스마트폰을 데이터센터 하드웨어로 개조 - 소비자용 스마트폰을 그대로 데이터센터에 배치하면 비효율적이고 위험하다. - 디스플레이, 배터리, 카메라, 케이스 등 서버에 필요 없는 부품이 공간을 차지함 - 특히 배터리는 데이터센터 환경에서 장시간 사용하기에 적합하지 않을 수 있음 - 따라서 메인보드만 분리해 클러스터에 사용한다. - 메인보드는 스마트폰 내재 탄소의 약 50%를 차지하는 가장 중요한 부품이므로, 이를 재사용하는 것이 환경적 효과가 크다. - Android 기반의 모바일 사용자 공간은 범용 Linux 배포판으로 교체한다. - 클라우드 작업에 필요한 프로그래밍 환경을 제공함 - 모바일 기기용 보호 기능을 제거하거나 조정할 수 있음 - 예를 들어 메모리 부족 시 애플리케이션을 종료하는 ‘Low Memory Killer’의 영향을 줄일 수 있음 - 컨테이너화된 애플리케이션을 Kubernetes로 관리해 25~50대 단위의 자기관리형 클러스터를 구성한다. ## 교육·연구용 저탄소 클라우드 - 대학에서 사용하는 Jupyter 환경, 과제 채점 시스템, 병렬 계산 수업용 애플리케이션 상당수는 스마트폰 한 대 또는 소규모 클러스터로 처리할 수 있다. - 일반적인 과제 채점 백엔드는 AWS t3.micro 수준인 2 vCPU·1GB 메모리 인스턴스에서도 실행된다. - 20대 스마트폰 클러스터를 이용한 실험에서: - 75명 이상 수강하는 수업의 최대 과제 제출량을 처리함 - 일반적인 AWS 백엔드보다 낮은 채점 지연 시간을 기록함 - 약 50초가 걸리는 CPU 집약적 행렬 곱셈 과제도 처리 가능했음 - 2,000대 규모의 클러스터는 약 50대의 서버에 해당하는 컴퓨팅 자원을 제공하고, 동시에 약 100개 수업을 지원할 수 있을 것으로 예상된다. - 2026년 가을 전체 시스템 운영을 시작할 계획이다. ## 대규모 운영에서 검증할 과제 - 소비자용 스마트폰 메인보드를 장기간 데이터센터 부하로 사용할 때의 신뢰성을 검증해야 한다. - 다수 기기의 장애를 감지하고 작업을 재분배하는 클러스터 관리가 중요하다. - 제한된 메모리와 이기종 코어 구조에 맞도록 애플리케이션을 설계해야 한다. - 이 프로젝트는 실제 교육·연구 서비스를 제공하는 동시에 스마트폰 기반 컴퓨팅의 확장성과 지속 가능성을 시험하는 테스트베드 역할을 한다. 사용이 끝난 스마트폰은 서버 전체를 대체하기보다는 교육, 과제 채점, 소규모 웹 서비스처럼 자원 요구량이 제한적인 작업에 재활용하는 것이 현실적이다. 특히 메인보드 재사용과 컨테이너·Kubernetes 기반 클러스터 관리를 결합하면 비용 절감과 제조 탄소 감축을 동시에 달성할 가능성이 있다.

원문 읽기(새 탭에서 열림)