database-monitoring

8 개의 포스트

datadog

자율형 SRE 에이전트를 위한 대규모 실세계 평가 플랫폼 구축 방법 (새 탭에서 열림)

Datadog이 Gartner의 2026년 Observability Platforms 매직 쿼드런트에서 Leader로 선정되었다는 소식을 전하는 글입니다. 글에 제공된 내용은 Datadog이 인프라·애플리케이션·로그·보안·디지털 경험·소프트웨어 제공·서비스 관리·AI를 아우르는 통합 플랫폼을 제공한다는 점을 강조합니다. 다만 Gartner의 평가 기준이나 Datadog의 구체적인 강점·약점에 대한 본문은 포함되어 있지 않습니다. ### Gartner 매직 쿼드런트 리더 선정 - Datadog은 Gartner® Magic Quadrant™ for Observability Platforms 2026에서 Leader로 소개되었습니다. - 이는 Datadog이 관측 가능성 플랫폼 시장에서 비전과 실행력을 모두 갖춘 업체로 평가되었음을 의미합니다. - 제공된 발췌문에는 평가 점수, 경쟁사 비교, 선정 근거 등 구체적인 Gartner 분석 내용은 없습니다. ### 통합 인프라 모니터링 - 호스트, 메트릭, 컨테이너, Kubernetes, 네트워크, 서버리스 환경을 모니터링합니다. - 클라우드 비용, 스토리지, GPU까지 관리 범위를 확장합니다. - Cloudcraft를 통해 클라우드 인프라를 시각적으로 구성하고 파악할 수 있습니다. ### 애플리케이션 성능 관측 - APM으로 애플리케이션 성능과 서비스 간 의존성을 분석합니다. - Universal Service Monitoring, Continuous Profiler, Dynamic Instrumentation을 제공합니다. - Agent Observability를 통해 AI 에이전트의 동작과 성능도 관찰할 수 있습니다. ### 로그·데이터·파이프라인 관리 - 로그 관리와 민감 데이터 탐지, 감사 추적 기능을 제공합니다. - Observability Pipelines로 로그와 관측 데이터를 수집·필터링·라우팅할 수 있습니다. - 데이터베이스, 데이터 스트림, 데이터 품질, 작업 실행 상태를 모니터링합니다. ### 보안과 관측성의 통합 - 코드 보안, SAST, IAST, 소프트웨어 구성 분석, IaC 보안을 지원합니다. - 클라우드 보안 상태, 권한, 취약점, 규정 준수를 관리합니다. - Cloud SIEM, 워크로드 보호, 애플리케이션·API 보호 기능도 포함합니다. - 관측 데이터와 보안 데이터를 한 플랫폼에서 연계해 위협 탐지와 대응을 지원하는 방향입니다. ### 디지털 경험과 소프트웨어 제공 - Browser·Mobile RUM으로 실제 사용자 경험을 측정합니다. - Session Replay, Synthetic Monitoring, 오류 추적, 제품 분석 기능을 제공합니다. - CI Visibility, 테스트 최적화, 지속적 테스트, 코드 커버리지로 배포 과정의 품질을 관리합니다. - 내부 개발자 포털, 기능 플래그, IDE 플러그인 등 개발자 생산성 기능도 제공합니다. ### 서비스 관리와 AI 기능 - 이벤트 관리, 서비스 카탈로그, SLO, 인시던트 대응, 워크플로 자동화를 지원합니다. - Watchdog과 Bits AI를 활용해 이상 징후 분석, 조사, 자동화된 대응을 수행할 수 있습니다. - AI 에이전트, AI 통합, MCP 서버, AI 기반 조사·보안 분석 기능을 제공하며 AI 운영 환경까지 관측 범위를 넓히고 있습니다. 제공된 내용만 보면 이 글의 핵심은 Datadog이 단순한 모니터링 도구가 아니라 인프라부터 보안, 개발, 사용자 경험, AI 운영까지 포괄하는 통합 관측성 플랫폼으로 자리매김했다는 점입니다. 실제 도입을 검토한다면 Gartner 평가 원문과 함께 데이터 보존 비용, 지원 환경, 기존 도구와의 연동성, 기능별 과금 구조를 별도로 확인하는 것이 좋습니다.

datadog

업서트가 업데이트되지 않아도 쓰기가 발생하는 경우: 대규모 Postgres 성능 디버깅 (새 탭에서 열림)

Datadog이 Gartner의 2026년 Observability Platforms 매직 쿼드런트에서 ‘Leader’로 선정되었다는 내용을 소개하는 페이지입니다. 제공된 본문에는 선정 근거와 평가 세부사항보다 Datadog의 제품군 및 관련 링크 목록이 대부분 포함되어 있습니다. 따라서 이 자료만으로는 Gartner의 구체적인 평가 기준이나 Datadog의 강점·약점을 자세히 분석하기 어렵습니다. ### Gartner 매직 쿼드런트 선정 - Datadog이 Gartner의 **Observability Platforms 부문 Leader**로 소개됩니다. - 연결된 리소스는 Datadog의 시장 평가 및 제품 포지셔닝을 강조하기 위한 홍보 자료로 보입니다. - 제공된 내용에는 Gartner의 평가 방법론, 경쟁사 비교, 실행 능력 및 비전 완성도에 대한 구체적인 설명은 없습니다. ### 인프라 모니터링 - 호스트, 메트릭, 컨테이너, 네트워크, 서버리스 환경을 모니터링합니다. - Kubernetes 오토스케일링, 클라우드 비용 관리, 스토리지 및 GPU 모니터링 기능을 제공합니다. - Cloudcraft를 통해 클라우드 인프라를 시각화할 수 있습니다. ### 애플리케이션 및 데이터 관측성 - APM, 서비스 모니터링, 연속 프로파일링, 동적 계측을 지원합니다. - 데이터베이스, 데이터 스트림, 데이터 품질, 작업 실행 상태를 관찰할 수 있습니다. - 애플리케이션 성능 문제와 데이터 파이프라인 문제를 하나의 플랫폼에서 분석하는 방향을 보여줍니다. ### 로그 및 보안 - 로그 관리, 민감 데이터 탐지, 감사 추적, 관측성 파이프라인 기능을 제공합니다. - 코드 보안, SAST·IAST, IaC 보안, 클라우드 보안, 취약점 관리, SIEM 등을 포함합니다. - 애플리케이션·API 보호와 워크로드 보호까지 보안 영역을 확장하고 있습니다. ### 디지털 경험 및 소프트웨어 전달 - 브라우저·모바일 RUM, 세션 리플레이, 합성 모니터링, 오류 추적을 지원합니다. - CI 가시성, 테스트 최적화, 지속적 테스트, 코드 커버리지, 기능 플래그 등을 제공합니다. - 사용자 경험부터 코드 변경과 배포 과정까지 관측 범위를 넓힌 것이 특징입니다. ### 서비스 관리와 AI - 이벤트 관리, SLO, 인시던트 대응, 워크플로 자동화, 서비스 카탈로그를 제공합니다. - Watchdog과 Bits 계열 AI 기능을 활용해 이상 탐지, 조사, 보안 분석, 자동화를 지원합니다. - MCP 서버, AI 에이전트, GPU 모니터링 등 AI 운영 환경을 위한 기능도 포함합니다. 실제로 Datadog 도입이나 경쟁 제품 비교에 활용하려면, 연결된 Gartner 리포트의 평가 기준과 한계, 비용 구조, 데이터 보존 정책, 기존 인프라와의 통합성을 별도로 확인해야 합니다.

datadog

Husky 쿼리 엔진 내부 (새 탭에서 열림)

제공된 내용은 Datadog이 Gartner의 「Observability Platforms」 매직 쿼드런트에서 Leader로 선정됐다는 홍보 문구와 Datadog 제품 메뉴 목록이 중심입니다. 따라서 관측 가능성 플랫폼의 평가 근거나 Husky Query 아키텍처의 기술적 내용은 본문에 포함되어 있지 않아 구체적인 분석은 어렵습니다. 링크의 실제 글 본문이 제공되어야 기술적인 요약이 가능합니다. ### Gartner 매직 쿼드런트 선정 - Datadog이 Gartner의 「Observability Platforms」 부문에서 Leader로 선정됐다고 소개합니다. - 연결된 링크는 Datadog의 Gartner 평가 관련 리소스 페이지입니다. - 평가 기준, 경쟁사 비교, Datadog이 Leader로 분류된 근거는 제공된 텍스트에 포함되지 않았습니다. ### Datadog의 제품 영역 제공된 메뉴는 Datadog이 단일 모니터링 도구가 아니라 여러 운영 영역을 통합하는 플랫폼임을 보여줍니다. - **인프라 모니터링**: 호스트, 메트릭, 컨테이너, Kubernetes, 네트워크, 서버리스, GPU, 클라우드 비용 등을 모니터링 - **애플리케이션 모니터링**: APM, 서비스 모니터링, 지속적 프로파일링, 동적 계측 제공 - **데이터 및 로그**: 데이터베이스, 데이터 스트림, 로그 관리, 데이터 품질, 민감정보 탐지 지원 - **보안**: 코드 보안, SAST, SCA, 클라우드 보안, SIEM, 워크로드 보호, API 보호 등 포함 - **디지털 경험**: 브라우저·모바일 RUM, 세션 리플레이, 신세틱 모니터링, 오류 추적 제공 - **소프트웨어 개발 및 서비스 관리**: CI 가시성, 테스트 최적화, 서비스 카탈로그, SLO, 인시던트 대응, 워크플로 자동화 지원 - **AI 기능**: AI 에이전트 관측성, GPU 모니터링, Bits AI, MCP 서버 및 AI 기반 조사 기능 제공 ### Husky Query 아키텍처 관련 정보 - 메뉴의 Product 링크에는 `husky-query-architecture`라는 경로가 포함되어 있습니다. - 그러나 Husky Query의 저장 구조, 쿼리 실행 방식, 확장성, 성능 개선 방법 등 실제 글의 내용은 제공되지 않았습니다. - 따라서 해당 아키텍처의 기술적 설계나 장단점은 현재 자료만으로 요약할 수 없습니다. 실제 블로그 본문을 붙여 주시면 Husky Query의 아키텍처, 데이터 처리 흐름, 성능 최적화 방식까지 섹션별로 구체적으로 정리할 수 있습니다.

datadog

비용, 품질, 안전성을 고려 (새 탭에서 열림)

Datadog은 Gartner의 2026년 Observability Platforms 매직 쿼드런트에서 ‘Leader’로 선정되었다고 홍보한다. 제공된 내용은 실제 기술 블로그 본문이 아니라 Datadog 제품 메뉴와 관련 링크가 대부분이므로, 포스트모템에서 LLM을 활용하는 구체적인 방법이나 기술적 결론은 확인할 수 없다. ### Gartner 매직 쿼드런트 선정 - Datadog이 관측성 플랫폼 분야의 리더로 평가받았다는 내용이다. - 관련 링크는 Gartner 보고서 다운로드 또는 안내 페이지로 연결된다. - 이는 Datadog의 시장 영향력과 제품 역량을 강조하기 위한 홍보성 메시지다. ### Datadog 관측성 제품 범위 제공된 메뉴는 Datadog이 단일 모니터링 도구를 넘어 여러 운영 영역을 통합하려는 플랫폼 전략을 보여준다. - **인프라 모니터링** - 호스트 맵, 메트릭, 컨테이너, Kubernetes 오토스케일링 - 네트워크, 서버리스, GPU, 스토리지, 클라우드 비용 관리 - **애플리케이션 성능 관리** - APM, 서비스 모니터링, 연속 프로파일링 - 동적 계측과 AI 에이전트 관측성 - **로그·데이터 관측성** - 로그 관리, 민감 데이터 탐지, 감사 추적 - 데이터베이스, 데이터 스트림, 데이터 품질 및 작업 모니터링 - **보안** - 코드 보안, SAST, IAST, IaC·클라우드 보안 - SIEM, 워크로드 보호, 취약점 및 비밀정보 탐지 - **디지털 경험** - 브라우저·모바일 RUM, 세션 리플레이 - 신세틱 모니터링, 오류 추적, 제품 분석 - **소프트웨어 제공 및 서비스 관리** - CI/CD 가시성, 테스트 최적화, 코드 커버리지 - 인시던트 대응, SLO, 이벤트 관리, 워크플로 자동화 - **AI 기능** - Bits AI 에이전트와 조사 기능 - AI 통합, MCP 서버, GPU 모니터링, AI 에이전트 관측성 ### 제공된 자료의 한계 - 링크의 제목으로 보아 원문은 LLM을 활용한 포스트모템 작성 또는 분석을 다루는 글로 보인다. - 그러나 본문, 구현 방식, 프롬프트, 데이터 처리 과정, 정확성 검증 방법은 제공되지 않았다. - 따라서 LLM 기반 포스트모템 자동화의 장단점이나 실제 적용 절차를 이 자료만으로 요약할 수는 없다. 실제 기술 블로그 본문을 요약하려면 링크의 본문 내용이나 전체 텍스트를 추가로 제공해야 한다.

datadog

대규모 시계열 인 (새 탭에서 열림)

제공된 내용에는 본문이 거의 없고, Datadog 웹사이트의 메뉴 목록과 “Gartner Observability Platforms 2026 리더 선정” 문구만 포함되어 있습니다. 따라서 링크된 기술 글인 **“Timeseries Indexing at Scale”**의 핵심 주장이나 구현 세부사항은 정확히 요약할 수 없습니다. ### 확인 가능한 내용 - Datadog이 Gartner의 Observability Platforms 2026 Magic Quadrant에서 Leader로 선정되었다는 홍보 문구가 포함되어 있습니다. - 페이지 메뉴에는 다음과 같은 Datadog 제품군이 나열되어 있습니다. - 인프라 모니터링, 메트릭, 컨테이너·네트워크 모니터링 - APM, 데이터베이스·로그 모니터링 - 보안, RUM, CI/CD, 서비스 관리 - AI 에이전트, 대시보드, 알림 및 워크플로 자동화 - 링크 주소상 원래 기술 글의 주제는 대규모 환경에서의 **시계열 데이터 인덱싱**입니다. ### 정확한 요약을 위해 필요한 내용 - 기술 글 본문 전체를 붙여 넣거나 - 본문이 포함된 링크 내용을 다시 제공해 주세요. 현재 자료만으로는 시계열 인덱싱의 데이터 구조, 샤딩·파티셔닝, 쓰기 및 조회 최적화 방식 같은 기술적 세부사항을 신뢰성 있게 설명하기 어렵습니다.

datadog

.NET 컨티뉴어스 프로 (새 탭에서 열림)

Datadog은 Gartner의 2026년 Observability Platforms Magic Quadrant에서 ‘Leader’로 선정되었다고 발표합니다. 제공된 내용은 이 발표와 Datadog 제품군의 탐색 메뉴를 중심으로 구성되어 있어, 선정 근거나 Gartner의 세부 평가 내용은 확인할 수 없습니다. ## Gartner Magic Quadrant 리더 선정 - Datadog이 **Gartner® Magic Quadrant™ for Observability Platforms 2026**에서 Leader로 분류되었다는 소식입니다. - 다만 제공된 본문에는 다음 정보가 포함되어 있지 않습니다. - 평가 기준 - Datadog의 구체적인 강점과 약점 - 경쟁 업체와의 비교 - Gartner 보고서의 원문 분석 - 따라서 이 글은 기술적 분석보다는 Datadog의 리더 선정 사실을 알리는 홍보성 콘텐츠에 가깝습니다. ## Datadog의 인프라·애플리케이션 관측성 - 인프라 모니터링 - 메트릭, 컨테이너, Kubernetes 오토스케일링 - 네트워크, 서버리스, GPU, 스토리지 모니터링 - 클라우드 비용 관리와 Cloudcraft - 애플리케이션 성능 관리 - APM과 Universal Service Monitoring - Continuous Profiler를 통한 코드 성능 분석 - Dynamic Instrumentation과 Agent Observability - 데이터 계층 - 데이터베이스 및 데이터 스트림 모니터링 - 데이터 품질과 작업(Job) 모니터링 ## 로그·보안·디지털 경험 관리 - 로그 관리 - Log Management와 Observability Pipelines - Sensitive Data Scanner를 통한 민감 정보 탐지 - Audit Trail을 통한 활동 추적 - 보안 - 코드 보안, SAST, IAST, 소프트웨어 구성 분석 - 클라우드 보안, 취약점 관리, Cloud SIEM - 워크로드 및 애플리케이션·API 보호 - 디지털 경험 - 브라우저·모바일 RUM - 세션 재생, 신세틱 모니터링, 오류 추적 - 제품 분석과 모바일 앱 테스트 ## 소프트웨어 전달·서비스 관리·AI - 소프트웨어 개발 및 배포 - CI Visibility, 테스트 최적화, 지속적 테스트 - 코드 커버리지, 기능 플래그, 내부 개발자 포털 - 서비스 관리 - 이벤트 관리, 인시던트 대응, SLO - 서비스 카탈로그, 케이스 관리, 워크플로 자동화 - AI 기능 - Bits AI Agents, Bits Chat, Bits Investigation - AI 에이전트 관측성, GPU 모니터링 - MCP Server와 AI 기반 보안 분석 도구 ## 실용적인 결론 제공된 자료만으로는 Datadog이 Gartner에서 리더로 선정된 구체적 이유를 판단하기 어렵습니다. 도입이나 비교를 검토한다면 원문 Gartner 보고서에서 평가 기준과 제한 사항을 확인한 뒤, 실제 환경의 로그·메트릭·트레이스 비용, 데이터 보존 기간, 연동 범위, 보안 요구사항을 함께 검증하는 것이 좋습니다.

datadog

Rust 및 Linux를 위한 코어당 (새 탭에서 열림)

Datadog이 Gartner의 2026년 Observability Platforms Magic Quadrant에서 ‘Leader’로 선정됐다는 발표가 글의 중심 내용입니다. 제공된 내용은 Datadog의 관측성 플랫폼과 관련 제품군을 나열하며, 인프라부터 애플리케이션·로그·보안·디지털 경험·소프트웨어 전달·AI까지 통합 모니터링 범위를 강조합니다. 다만 Gartner 평가 기준이나 Datadog의 구체적인 강점·약점에 대한 본문은 제공되지 않았습니다. ### Gartner Magic Quadrant 리더 선정 - Datadog은 Gartner의 **Observability Platforms 부문 Magic Quadrant 2026**에서 Leader로 소개됩니다. - 관측성을 단일 모니터링 기능이 아니라 다음 영역을 통합하는 플랫폼으로 포지셔닝합니다. - 인프라와 클라우드 - 애플리케이션 성능 - 로그와 데이터 - 보안 - 사용자 경험 - 소프트웨어 개발 및 운영 - AI 시스템 ### 인프라 및 클라우드 모니터링 - 인프라 모니터링, 메트릭, 컨테이너 및 Kubernetes 모니터링을 제공합니다. - 네트워크, 서버리스, GPU, 스토리지 상태도 관찰할 수 있습니다. - Cloud Cost Management와 Cloudcraft를 통해 클라우드 비용과 아키텍처 시각화까지 다룹니다. - Kubernetes Autoscaling으로 모니터링 결과를 운영 자동화와 연결합니다. ### 애플리케이션과 데이터 관측성 - APM을 기반으로 애플리케이션 성능과 서비스 간 의존성을 추적합니다. - Universal Service Monitoring, Continuous Profiler, Dynamic Instrumentation 등을 통해 실행 중인 서비스의 동작과 성능 병목을 분석합니다. - 데이터베이스, 데이터 스트림, 데이터 품질, 배치 작업을 위한 별도 모니터링 기능도 제공합니다. - Agent Observability를 통해 AI 에이전트의 동작을 관찰하는 영역까지 확장합니다. ### 로그 관리와 보안 통합 - Log Management와 Observability Pipelines를 통해 로그 수집·처리·전송을 관리합니다. - Sensitive Data Scanner로 로그와 데이터에 포함된 민감정보를 탐지합니다. - Cloud SIEM, 클라우드 보안, 취약점 관리, 워크로드 보호, 애플리케이션·API 보호 기능을 제공합니다. - 코드 보안, SAST, IAST, IaC 보안, Secret Scanning 등 개발 단계의 보안 기능도 포함합니다. ### 디지털 사용자 경험 모니터링 - Browser 및 Mobile RUM으로 실제 사용자의 성능과 오류를 측정합니다. - Session Replay를 통해 사용자 세션을 재현하고 문제 발생 과정을 분석할 수 있습니다. - Synthetic Monitoring으로 실제 사용자가 없어도 주요 경로를 주기적으로 테스트합니다. - Product Analytics, Experiments, Error Tracking, Mobile App Testing 등을 제공해 제품 분석과 품질 개선을 지원합니다. ### 소프트웨어 전달과 서비스 운영 - CI Visibility, Test Optimization, Continuous Testing으로 빌드·테스트 파이프라인을 관찰합니다. - 코드 커버리지, Feature Flags, IDE 플러그인 등을 통해 개발 workflow와 운영 데이터를 연결합니다. - Software Catalog, SLO, Event Management, Incident Response, Workflow Automation으로 서비스 운영과 장애 대응을 지원합니다. - 내부 개발자 포털과 Case Management를 통해 개발자 생산성과 운영 프로세스를 관리합니다. ### AI 기반 운영 - Bits AI Agents, Bits Chat, Bits Investigation 등 AI 기반 분석·조사 기능을 제공합니다. - MCP Server와 Agent Builder를 통해 외부 도구 및 자동화 workflow와 연동할 수 있습니다. - AI 에이전트의 성능과 동작을 관찰하는 Agent Observability를 별도 영역으로 제시합니다. - GPU Monitoring을 통해 AI 인프라의 GPU 사용량과 상태를 추적합니다. 실제로 이 글의 평가 근거를 검토하려면 Gartner 보고서 원문에서 평가 기준, Datadog의 강점과 주의점, 경쟁 제품과의 차이를 추가로 확인해야 합니다. 제공된 본문만으로는 Datadog이 다양한 관측성 기능을 하나의 플랫폼으로 통합하고 있다는 점이 가장 분명한 결론입니다.

figma

사후 분석: 202 (새 탭에서 열림)

2020년 1월 21~22일 Figma 장애는 장시간 실행된 고비용 쿼리와 PostgreSQL의 잘못된 쿼리 실행 계획, 그리고 이로 인해 누적된 공격적 autovacuum이 복합적으로 발생한 사건이었다. 1월 21일에는 문제 쿼리를 취소해 복구했지만, 그 여파로 데이터베이스 정리 작업이 밀리면서 다음 날 쓰기 IOPS와 잠금 경합이 급증했다. Figma는 PostgreSQL 11로 업그레이드해 문제를 안정화했고, 이후 고비용 쿼리 모니터링과 실행 시간 제한을 강화하기로 했다. ## 장애 발생 경과 ### 1월 21일: 장시간 실행 쿼리 - 오전 6시 11분, 자동 모니터링에서 오류율 증가를 감지했다. - 조사 결과, 데이터베이스 CPU를 과도하게 사용하는 장시간 실행 쿼리가 발견됐다. - 오전 6시 54분 해당 쿼리를 취소하자 성능이 정상으로 돌아왔다. - 그러나 쿼리 취소 과정에서 데이터베이스 내부에 정리해야 할 작업이 누적되었고, 이것이 다음 날 장애의 배경이 됐다. ### 1월 22일: 쓰기 부하와 잠금 경합 - 데이터베이스 CPU는 평소보다 낮았지만 쓰기 IOPS와 잠금 경합이 증가했다. - 오전 11시 42분에는 API 요청이 대기열에 쌓이며 일부 사용자가 서비스를 이용할 수 없게 됐다. - 불필요한 쿼리를 취소하고 할당된 IOPS를 늘려 일시적으로 안정화했지만, 오후 2시경 다시 성능이 악화됐다. - 데이터베이스를 재시작해 문제를 일으킨 것으로 추정한 백그라운드 프로세스를 임시 비활성화했다. - 오후 7시부터 긴급 점검을 진행하며 PostgreSQL을 업그레이드했고, 오후 8시 15분 서비스와 데이터베이스 지표가 정상화됐다. ## 공격적 autovacuum의 영향 - PostgreSQL의 autovacuum은 오래된 행 버전을 정리하고 트랜잭션 ID 고갈을 방지하는 자동 유지보수 작업이다. - 1월 21일 장시간 쿼리가 종료된 뒤 정리 대상 데이터가 대량으로 쌓였다. - 이 backlog가 임계치를 넘으면서 트랜잭션 ID 래핑을 막기 위한 더 공격적인 autovacuum이 실행됐다. - 당시 사용하던 PostgreSQL 버전에서는 이 작업이 테이블 잠금과 쓰기 작업에 큰 영향을 줬다. - Figma가 대형 테이블에서 실행 중인 autovacuum을 취소하자 지표가 일시적으로 개선됐지만, 작업은 다시 재개됐다. - `autovacuum_freeze_max_age` 값을 조정하고 데이터베이스를 재시작해야 공격적 autovacuum을 완전히 억제할 수 있었다. - 다만 autovacuum을 비활성화한 뒤에도 쓰기 지연과 잠금 경합이 계속되어, 이것만이 유일한 원인은 아니라고 판단했다. ## 잘못된 쿼리 실행 계획 - 문제의 핵심 쿼리는 복잡한 서브쿼리를 포함하고 있었고, 잠금 경합에 반복적으로 관여했다. - PostgreSQL 9의 통계 정보가 변경된 뒤 쿼리 플래너가 비효율적인 실행 계획을 선택한 것으로 분석됐다. - 실행 계획은 실제 결과가 3개 행뿐인데도 2천만 개 이상의 행을 반환할 것으로 잘못 추정했다. - 그 결과 인덱스를 사용하지 않고 전체 테이블 스캔을 수행했다. - 처리 과정에서 임시 버퍼에 대량의 데이터를 기록해 높은 쓰기 IOPS와 임시 데이터 사용량을 유발했다. - 즉, 낮은 CPU 사용률만으로 데이터베이스 상태가 양호하다고 판단하기 어려웠으며, 쓰기 지연·잠금·임시 버퍼 사용량을 함께 살펴야 했다. ## PostgreSQL 11 업그레이드 - PostgreSQL 9.6 이후에는 autovacuum과 관련된 중요한 최적화가 포함됐다. - PostgreSQL 10 이상에서는 Amazon RDS의 성능 분석 도구가 개선되어 원인 조사에 도움이 된다. - Figma는 이미 스테이징 환경을 PostgreSQL 11로 업그레이드하고 수개월간 테스트한 상태였다. - 운영 환경 업그레이드 절차도 사전에 마련해 두었기 때문에 긴급 상황에서도 업그레이드를 진행할 수 있었다. - PostgreSQL 11의 개선된 쿼리 플래너는 문제가 된 실행 계획이 선택될 가능성을 제거했다. - autovacuum의 성능 특성도 PostgreSQL 9에서 11로 오면서 개선되어 두 가지 주요 원인을 함께 완화했다. ## 후속 조치 - 고비용·장시간 실행 쿼리에 대한 모니터링을 강화한다. - 쿼리가 실행될 수 있는 시간에 더 엄격한 제한을 둔다. - 실행 계획의 예상 행 수와 실제 행 수 사이의 큰 차이를 지속적으로 점검한다. - CPU뿐 아니라 쓰기 IOPS, 쓰기 지연, 잠금 경합, 임시 버퍼 사용량, autovacuum backlog를 함께 모니터링해야 한다. - 데이터베이스 버전 업그레이드는 장애 발생 후 처음 검토하기보다, 스테이징 테스트와 운영 전환 계획을 미리 준비해야 한다. 실무적으로는 장시간 쿼리에 타임아웃을 설정하고, 정기적으로 `EXPLAIN ANALYZE`와 실행 계획 변화를 검토하며, autovacuum 상태를 별도 지표로 관리하는 것이 중요하다. alc-vesm.