time-series-forecasting

4 개의 포스트

netflix4분 읽기큐레이션 요약

콘텐츠 출시의 위험 예측: 데이터 기반 인사이트가 출시 계획을 혁신하는 방법

넷플릭스는 콘텐츠 출시 준비 과정에서 수작업으로 입력된 미디어 전달 일정이 자주 부정확하거나 누락된다는 문제를 발견했습니다. 이에 제작 진행 데이터와 메타데이터를 활용한 머신러닝 모델로 Locked Cut과 최종 IMF 전달까지 남은 일수를 예측하고, 출시 지연 위험을 줄이려 합니다. 백테스트 결과 예측 일정은 수작업 일정에 비해 정확도와 제공 범위가 높았으며, 출시 직전 일정 오차와 출시 지연 사이의 상관관계도 완화했습니다. ## 콘텐츠 출시 준비와 일정 리스크 - 넷플릭스 콘텐츠는 개발, 프리프로덕션, 제작, 후반작업, 출시 준비 단계를 거쳐 공개됩니다. - 후반작업이 끝나면 최종 오디오·비디오 파일인 IMF가 전달되고, 이를 기반으로 다음 작업이 진행됩니다. - 아트워크와 예고편 제작 - 자막 생성 - 관람등급 지정 - 품질관리(QC) - 일부 작업은 최종본이 아닌 Locked Cut으로 미리 시작할 수 있습니다. - 다만 Locked Cut 이후 IMF가 크게 변경되면 추가 conformance 작업이 필요합니다. - IMF를 기다리면 일정이 압축될 수 있고, Locked Cut으로 일찍 시작하면 수정 비용이 발생하는 트레이드오프가 존재합니다. ## 수작업 일정의 한계 - 콘텐츠 파트너가 제작 일정에 Locked Cut과 IMF의 예상 전달일을 수동으로 입력합니다. - 실제 제작은 일정 변경, 인력·장비 충돌, 예기치 못한 문제 등으로 지속적으로 변동됩니다. - 그 결과 다음 문제가 발생합니다. - 일부 콘텐츠에는 예상 전달일 자체가 없음 - 기존 예상일이 실제 전달일과 크게 다름 - 출시 준비팀이 언제 작업을 시작해야 할지 판단하기 어려움 - 넷플릭스는 축적된 제작 데이터를 활용해 일정 누락을 보완하고 예상일의 정확도를 높이려 했습니다. ## 일정 오차와 출시 지연의 관계 - 일정 부정확성을 측정하기 위해 **Accumulated Error Days(AED)**라는 지표를 만들었습니다. - AED는 예상 전달일과 실제 전달일 사이의 편차를 시간에 따라 누적한 값으로, 두 일정 곡선 사이의 면적에 해당합니다. - 출시 지연이 발생한 콘텐츠는 지연이 없는 콘텐츠보다 평균 AED가 유의미하게 높았습니다. - 특히 전달일에 가까운 마지막 기간의 AED가 출시 지연과 더 강한 상관관계를 보였습니다. - 따라서 장기적인 평균 오차뿐 아니라 출시 직전 일정이 얼마나 정확한지가 출시 리스크 관리에 중요합니다. ## 머신러닝 기반 전달일 예측 - 예측 모델은 부스티드 트리 회귀 모델로, 진행 중인 제작물에 대해 IMF 또는 Locked Cut 전달까지 남은 일수를 예측합니다. - 다음과 같은 데이터를 입력값으로 활용합니다. - 제작 진행 상황과 관련된 운영 신호 - 콘텐츠 및 타이틀 메타데이터 - 계절성 신호 - 제작 과정의 매일 업데이트된 스냅샷 데이터를 사용해, 각 날짜 시점의 제작 상태를 모델링합니다. - 이 방식의 장점은 다음과 같습니다. - 새로운 정보가 들어올 때마다 최신 예측 생성 - 제작 단계가 달라도 적용 가능한 유연한 모델 구축 - 시간에 따라 변하는 동적 특성 반영 - 수작업 일정이 없는 콘텐츠에도 항상 예측일 제공 ## 종합적인 모델 평가 지표 - 실제 전달일과 비교해 예측일의 정확도를 평가하기 위해 여러 지표를 사용했습니다. - 평균·중앙값 절대 오차(MAE 등) - 평균·중앙값 오차를 통한 과대·과소 예측 편향 - 오차 표준편차를 통한 예측 분포의 변동성 - 전달일까지 일정 기간 이상 차이 나는 큰 오차의 비율 - 수작업 일정은 전달일까지 남은 기간별로 일정이 존재하는 콘텐츠의 비율인 coverage도 측정했습니다. - 예측 모델은 항상 날짜를 제공하도록 설계되어 수작업 일정의 공백을 보완할 수 있습니다. ## 수작업 일정 대비 개선 효과 - 백테스트에서 예측 일정은 대부분의 전달 시점과 평가 지표에서 수작업 일정보다 우수했습니다. - IMF와 Locked Cut 모두에서 평균 절대 오차가 크게 감소했습니다. - 큰 오차나 이상치도 수작업 일정에서 예측 일정으로 전환했을 때 줄어들었습니다. - 예측 모델은 단순히 최종 시점의 정확도를 높이는 것뿐 아니라 더 일찍 유용한 신호를 제공합니다. - Locked Cut 전달 6개월 전부터 예측일이 수작업 일정보다 정확했던 콘텐츠 비율은 76%였습니다. - 예측 일정의 MAE는 6.1주였으며, 수작업 일정이 같은 수준에 도달하려면 전달 11주 전까지 기다려야 했습니다. - AED를 6개월 또는 더 짧은 기간에 걸쳐 계산했을 때도 예측 IMF·Locked Cut 일정이 수작업 일정 대비 AED를 낮췄습니다. - 이러한 효과는 여러 구매 조직과 콘텐츠 유형, 즉 시리즈와 단편 콘텐츠 전반에서 대체로 나타났습니다. ## 기존 업무 흐름에 예측 일정 적용 - 전달 예상일은 이미 관련 팀의 업무 과정에 포함되어 있기 때문에, 예측 날짜를 도입해도 기존 프로세스를 전면 개편할 필요가 없습니다. - 다만 수작업 일정과 예측 일정이 동시에 존재하면 어느 쪽을 더 신뢰할지 판단해야 합니다. - 예측 일정이 평균적으로 더 정확하더라도 모든 상황에서 수작업 일정을 능가하는 것은 아니므로, 두 일정의 신뢰도를 비교하고 상황별로 선택하는 운영 체계가 필요합니다. - 제공된 글은 이 문제를 해결하기 위한 후속 방식 설명 중간에서 끝나 있어, 최종 의사결정 규칙이나 운영 정책은 확인할 수 없습니다. 실무적으로는 예측일을 기존 일정의 대체재라기보다, 누락된 일정을 보완하고 위험 신호를 조기에 제공하는 계층으로 도입하는 것이 적절합니다. 특히 출시 직전 AED와 일정 오차를 지속적으로 모니터링하면 출시 지연 가능성이 높은 콘텐츠에 우선 대응할 수 있습니다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

경험적 연구 지원(ERA): Nature 게재에서 계산적 발견 촉진까지

ERA는 Gemini를 활용해 과학 문헌을 탐색하고, 실험 코드를 작성·개선하며, 수천 가지 해결책을 비교하는 과학 연구 지원 도구다. Nature 논문에서 유전체학, 공중보건, 위성영상, 신경과학, 시계열 예측, 수학 등 다양한 벤치마크에서 전문가 수준의 성능을 보였다. Google은 ERA를 활용한 여러 과학 연구 결과를 공개하고, AlphaEvolve와 결합한 Computational Discovery를 Google Labs의 신뢰할 수 있는 테스터 프로그램으로 제공하기 시작했다. ## 과학 코드를 자동으로 탐색하고 최적화하는 ERA - 사용자가 과학적 문제와 성공 기준을 제시하면 ERA가 다음 작업을 수행한다. - 관련 과학 문헌 검색 - 분석 및 예측 코드 작성 - 여러 알고리즘과 기법 조합 - 실행 결과 평가 - 성능이 낮은 접근법 수정 및 반복 실험 - 트리 탐색(tree search) 방식으로 수천 가지 후보를 검토하고, 주어진 목표에 맞춰 코드를 최적화한다. - 단순한 코드 생성이 아니라, 가설과 구현 방법을 실험적으로 비교해 가장 성능이 좋은 계산 모델을 찾는 데 초점을 둔다. ## 다양한 과학 분야에서의 전문가 수준 성능 - Nature 논문에서는 다음 분야의 문제를 대상으로 ERA를 평가했다. - 유전체학 - 공중보건 - 위성영상 분석 - 신경과학 예측 - 일반 시계열 예측 - 수학 - 여러 벤치마크에서 전문가 수준의 결과를 달성했다. - 이 결과는 고급 계산 모델링 기술에 대한 접근성을 넓히고, 기존 전문가의 연구 역량도 확장할 가능성을 보여준다. ## 감염병 입원 환자 예측 - 미국 각 주의 독감, 코로나19, RSV 병원 입원 건수를 최대 4주 앞서 예측했다. - ERA 기반 예측은 세 감염병 모두에서 미국 질병통제예방센터(CDC) 예측 리더보드의 최상위권 또는 1위를 기록했다. - 다른 국가나 질병에도 비교적 쉽게 적용할 수 있는 기법을 사용했다는 점이 강조됐다. ## 캘리포니아 물 공급과 적설 유출량 예측 - 눈으로 물이 공급되는 캘리포니아 강 유역의 계절성 유출량을 예측하는 모델을 개발했다. - ERA 모델은 봄철 유출량을 조기에 예측하는 데 기존 공식 전망인 Bulletin 120(B120)보다 높은 정확도를 보였다. - 예측 정확도가 향상되면 농업과 주민 생활에 중요한 수자원 관리와 배분을 개선할 수 있다. ## 위성 데이터를 활용한 대기 CO₂ 지도 작성 - 정지궤도 기상위성 데이터와 추가 정보를 결합해 대기 중 CO₂ 농도를 추정했다. - 기존 위성인 Orbiting Carbon Observatory-2가 약 16일마다 특정 지점을 측정하는 것과 달리, ERA 모델은 넓은 지역의 CO₂ 농도를 약 10분 간격으로 추정할 수 있다. - 로스앤젤레스 분지의 도시 배출 증가를 식별하고, 식물이 낮 동안 CO₂를 흡수하면서 농도가 감소하는 현상도 포착했다. - 이러한 고해상도 추정치는 온실가스의 공간적·시간적 변화를 모니터링하고 모델링하는 데 활용될 수 있다. ## 태양에너지 장치 설계 최적화 - ERA와 Google Antigravity를 함께 사용해 3차원 태양에너지 포집 구조를 탐색했다. - ERA는 500개의 삼각형으로 구성된 입체 팬(volumetric fan) 형태가 산란된 태양광을 가두면서 후방 음영을 만들지 않아 에너지 포집을 극대화할 수 있다고 제안했다. - 이는 AI 시스템들이 서로 다른 설계·최적화 작업을 결합할 수 있음을 보여주는 사례다. ## 소매 판매 예측 - 미국 경제지표, Google Trends, 과거 판매 패턴, 소비자 심리 등을 입력으로 사용했다. - ERA가 설계한 모델은 상용 컨센서스 전망과 Chicago Fed의 CARTS 월간 소매 판매 예측을 충족하거나 넘어섰다. - 정확한 소매 예측은 재고 부족과 폐기물을 줄이고, 기업 운영과 경제 정책 수립을 지원할 수 있다. ## Computational Discovery로의 확장 - Google은 ERA와 AlphaEvolve를 결합한 Computational Discovery를 공개하기 시작했다. - Computational Discovery는 과학 문제를 계산적으로 탐구하는 보다 넓은 실험 도구로 소개됐다. - Gemini for Science의 다른 도구들과 역할이 구분된다. - Computational Discovery: 계산 실험과 모델 탐색 - Hypothesis Generation: AI Co-Scientist 기반의 가설 생성 - Literature Insights: 과학 문헌 분석 - 이 도구들은 과학적 방법의 서로 다른 단계를 지원하도록 설계됐다. ERA는 과학자의 반복적인 코드 작성과 실험 최적화 작업을 자동화해, 복잡한 계산 연구를 더 빠르고 폭넓게 수행하도록 돕는 도구다. 특히 감염병 예측, 수자원 관리, 기후 모니터링처럼 실제 정책과 공공복지에 직접 연결되는 문제에서 활용 가능성이 크며, 연구자는 ERA를 최종 판단을 대신하는 시스템이라기보다 다양한 계산적 가설을 빠르게 검증하는 연구 파트너로 활용하는 것이 적절하다.

원문 읽기(새 탭에서 열림)
google원문

AI로 예측하는 산림의 (새 탭에서 열림)

구글 딥마인드와 구글 리서치 팀은 인공지능을 활용해 삼림 벌채 위험을 사전에 예측하는 딥러닝 모델인 '포레스트캐스트(ForestCast)'를 공개했습니다. 이 모델은 과거의 손실을 기록하는 수준을 넘어 위성 데이터와 비전 트랜스포머(Vision Transformer) 기술을 결합하여 미래의 위험 지역을 정확하게 식별해냅니다. 연구팀은 기술적 투명성을 위해 훈련 데이터와 평가 데이터를 벤치마크 데이터셋으로 공개하여 전 세계적인 삼림 보호 노력을 지원하고자 합니다. ## 기존 삼림 벌채 예측 방식의 한계 * 삼림 벌채는 경제적, 정치적, 환경적 요인이 복잡하게 얽힌 인간 중심의 프로세스이며, 이를 예측하기 위해 기존에는 도로망, 경제 지표, 정책 집행 데이터 등 특화된 지리 공간 정보를 수집해야 했습니다. * 하지만 이러한 외부 데이터는 지역별로 파편화되어 있고 일관성이 없으며, 시간이 지나면 빠르게 구식이 된다는 단점이 있어 전 지구적인 확장이 어려웠습니다. ## 위성 데이터 기반의 순수 모델링 접근법 * 포레스트캐스트는 외부 변수 없이 Landsat 및 Sentinel 2 위성에서 얻은 '순수 위성 데이터'만을 입력값으로 사용합니다. * 특히 '변화 이력(Change history)'이라는 개념을 도입하여, 각 픽셀의 과거 벌채 여부와 시점을 데이터화해 모델에 제공합니다. * 이 방식은 위성 데이터의 연속성 덕분에 전 세계 어디에나 동일하게 적용할 수 있고, 미래에도 지속적으로 업데이트가 가능한 '미래 보장형(Future-proof)' 모델입니다. ## 비전 트랜스포머를 활용한 기술적 혁신 * 풍경의 공간적 맥락과 최근의 벌채 경향을 파악하기 위해 전체 이미지 타일(Tile)을 한 번에 처리하는 커스텀 비전 트랜스포머 모델을 설계했습니다. * 연구 결과, 도로 지도와 같은 특정 데이터를 사용한 기존 모델보다 정확도가 높거나 대등한 수준의 성능을 보였으며, 타일 내에서 다음에 벌채될 가능성이 높은 픽셀을 정교하게 예측해냈습니다. * 흥미롭게도 '변화 이력' 데이터가 가장 중요한 입력값으로 작용했는데, 이는 해당 데이터가 최근 벌채 속도의 변화와 이동하는 벌채 전선(Deforestation fronts)에 대한 고밀도 정보를 포함하고 있기 때문입니다. ## 글로벌 확장을 위한 벤치마크 공개 * 연구팀은 모델의 투명성과 재현성을 보장하기 위해 동남아시아 지역을 대상으로 한 훈련 및 평가 데이터를 공개 벤치마크 데이터셋으로 배포했습니다. * 이 데이터셋은 머신러닝 커뮤니티가 모델의 예측 원리를 분석하고 성능을 개선하는 데 활용될 수 있습니다. * 향후 라틴 아메리카와 아프리카의 열대림은 물론, 산불이나 가축 방목 등 다른 동인에 의해 숲이 사라지는 온대 및 냉대 지역으로까지 모델 적용 범위를 확장할 계획입니다. 전 지구적 온실가스 배출의 약 10%가 토지 이용 변화에서 발생하는 만큼, 이러한 AI 기반 예측 기술은 기후 위기 대응과 생물 다양성 보존을 위한 실질적인 조기 경보 시스템으로 기능할 수 있을 것입니다.

google원문

시계열 파운데이션 모델 (새 탭에서 열림)

구글 리서치는 시계열 파운데이션 모델인 TimesFM에 '인-맥락 파인튜닝(In-Context Fine-tuning, ICF)' 기법을 도입하여, 추론 시점의 몇 가지 예시만으로 예측 성능을 극대화하는 퓨샷 학습(Few-shot Learning) 접근법을 제안했습니다. 기존의 제로샷 모델이 가진 한계를 극복하기 위해 지속적인 사전 학습(Continued Pre-training)을 활용했으며, 이를 통해 사용자가 복잡한 추가 학습을 수행하지 않고도 태스크별로 최적화된 정교한 예측 결과를 얻을 수 있음을 입증했습니다. ## 기존 모델의 한계와 퓨샷 학습의 필요성 * 시계열 예측은 비즈니스 전반에 필수적이지만, 기존 방식은 각 태스크마다 특화된 모델을 개별적으로 구축해야 하므로 시간과 비용이 많이 소모됨. * 제로샷 모델인 TimesFM은 별도 학습 없이도 준수한 성능을 보이지만, 관련 있는 과거 데이터나 유사한 사례(예: 인근 도로의 교통량)를 참고하여 성능을 더 높일 수 있는 유연성이 부족했음. * TimesFM-ICF는 모델이 추론 시점에 주어진 몇 개의 관련 예시(In-Context Examples)로부터 스스로 학습하여 예측에 반영하도록 설계됨. ## 구분자 토큰(Separator Token)을 통한 데이터 혼선 방지 * 서로 다른 출처의 데이터를 단순히 나열하여 입력하면 모델이 이를 하나의 연속된 흐름으로 오해하여 잘못된 패턴(예: 갑작스러운 급증락)을 학습할 위험이 있음. * 이를 해결하기 위해 학습 가능한 '공통 구분자 토큰'을 도입하여 각 예시 데이터 사이의 경계를 명확히 설정함. * 모델은 이 구분자를 통해 개별 예시들을 독립적으로 인식하며, 각 데이터의 고유한 패턴만 추출하여 현재 예측하려는 시계열에 적용할 수 있게 됨. ## 모델 구조 및 지속적 사전 학습 방식 * TimesFM의 기본 구조인 패치 데코더(Patched Decoder)를 유지하며, 32개의 시점을 하나의 토큰으로 변환한 뒤 트랜스포머 스택을 거쳐 128개 시점을 예측함. * 인-맥락 예시와 구분자 토큰이 포함된 새로운 데이터셋으로 '지속적 사전 학습'을 수행하여 모델이 예시로부터 정보를 얻는 방법을 익히게 함. * 인과적 자기 주의 집중(Causal Self Attention, CSA) 레이어를 통해 미래 데이터를 참조하지 않으면서도 과거의 맥락 정보를 효율적으로 통합함. ## 성능 검증 및 벤치마크 결과 * 모델이 학습 과정에서 한 번도 본 적 없는 23개의 데이터셋을 대상으로 성능을 평가함. * 실험 결과, TimesFM-ICF는 기존 제로샷 방식보다 월등한 성능을 보였으며, 훨씬 더 복잡한 과정인 지도 파인튜닝(Supervised Fine-tuning)과 대등한 수준의 정확도를 기록함. * 특히 시계열 데이터 처리 능력이 부족한 GPT-4o와 같은 일반적인 대규모 언어 모델(LLM)들에 비해 훨씬 더 정교하고 효율적인 예측 성능을 입증함. TimesFM-ICF는 시계열 예측 분야에서 모델의 재학습 없이도 도메인별 맥락을 즉각적으로 반영할 수 있는 실용적인 해결책을 제시합니다. 사용자는 예측하고자 하는 데이터와 유사한 소수의 샘플을 함께 입력하는 것만으로도 전문가 수준의 최적화된 예측 결과를 얻을 수 있습니다.