security-monitoring

7 개의 포스트

gitlab원문

GitLab CI/CD 및 Duo를 이용한 탐지 테스트 자동화 (새 탭에서 열림)

GitLab의 신호 엔지니어링(Signals Engineering) 팀은 보안 모니터링 파이프라인이 예기치 않게 중단되는 '침묵하는 실패'를 방지하기 위해 자동화된 탐지 테스트 프레임워크인 **WATCH(Weekly Attack Testing for Continuous Health)**를 개발했습니다. 이 프레임워크는 스테이징 환경에서 실제 악성 행위를 시뮬레이션함으로써 로그 수집부터 SIEM 탐지, SOAR 알림 라우팅에 이르는 전체 과정을 엔드투엔드(End-to-End)로 검증합니다. 이를 통해 보안팀은 인프라 변경이나 설정 오류 속에서도 핵심 탐지 로직이 상시 정상 작동한다는 확신을 얻을 수 있습니다. ### 기존 탐지 검증 방식의 한계 * **로그 재주입의 맹점:** 단순히 과거의 악성 로그를 SIEM에 다시 밀어 넣는 방식은 실제 로그 소스에서 SIEM으로 데이터가 흐르는 '로그 수집(Ingestion)' 단계의 오류를 포착할 수 없습니다. * **배포와 실행의 간극:** '코드로서의 탐지(Detections as Code)' 파이프라인은 탐지 규칙이 성공적으로 배포되었는지는 확인할 수 있지만, 실제 환경에서 해당 규칙이 트리거되어 경보까지 이어지는지는 보장하지 못합니다. * **환경의 가변성:** 로그 스키마 변경, SIEM 업데이트, 파이프라인 오설정 등 탐지 시스템을 망가뜨릴 수 있는 변수는 무수히 많으며, 이는 실제 사고 발생 시 경보가 울리지 않는 치명적인 결과로 이어질 수 있습니다. ### WATCH 프레임워크의 작동 원리 * **무작위 스케줄링:** 매주 GitLab CI/CD 파이프라인이 활성화된 모든 테스트를 탐색하고, 이를 일주일 중 무작위 시간대에 분산 배치합니다. 이는 테스트가 예측 가능해지는 것을 막고 실제 위협 상황과 유사한 환경을 조성합니다. * **사전 알림 및 등록:** 테스트 실행 직전, WATCH는 SOAR 시스템에 '사전 알림'을 보내 예상되는 탐지 항목을 등록하고 추적 가능한 기록을 생성합니다. * **공격 시뮬레이션:** 스테이징 환경에서 관리자 계정 비밀번호 재설정이나 수상한 API 호출과 같은 실제 공격 행위를 스크립트로 실행합니다. * **알림 상관관계 분석:** SIEM에서 발생한 경보가 실제 침해 사고인지 WATCH 테스트인지 판별하기 위해 '실행 시간, 행위자 식별자(IP/ID), 탐지 규칙 ID'라는 세 가지 요소를 대조합니다. 이를 통해 테스트 경보가 실제 사고 대응팀(SIRT)으로 에스컬레이션되는 것을 방지합니다. ### GitLab CI/CD를 활용한 파이프라인 구조 * **`schedule_pipelines` 단계:** 전체 테스트를 그룹화하고 무작위 실행 시간이 설정된 하위 파이프라인을 생성하여 일주일간의 테스트 일정을 관리합니다. * **`run_tests` 단계:** 할당된 시뮬레이션을 실제로 수행하며, 실행 통계와 SOAR 레코드 ID를 저장하여 후속 단계에서 검증할 수 있도록 준비합니다. * **`pages` 단계:** SOAR 시스템을 쿼리하여 경보가 정상적으로 생성 및 라우팅되었는지 최종 확인합니다. 결과는 GitLab Pages 대시보드에 업데이트되며, 탐지 실패 시 보안팀의 슬랙 채널로 즉시 알림을 보냅니다. 상용 침해 및 공격 시뮬레이션(BAS) 도구는 비용이 많이 들고 개별 기업의 특수한 탐지 스택에 맞춤화하기 어렵습니다. GitLab의 WATCH 사례처럼 자사의 CI/CD 인프라와 SOAR를 결합한 자동화 프레임워크를 구축하면, 저비용으로도 보안 모니터링 시스템의 건강 상태를 지속적으로 검증하고 신뢰도를 높일 수 있습니다.

kakao5분 읽기큐레이션 요약

수억 건의 보안 신호 속 진짜 위협 찾기 — AI로 보안 모니터링의 패러다임을 바꾸다

수억 건의 보안 이벤트를 사람이 규칙만으로 분석하는 방식은 오탐, 맥락 부족, 비용 증가 때문에 지속하기 어렵다. 글은 규칙 기반 필터와 AI 분석, 멀티모델 교차 검증, 자가 학습을 결합한 다단계 보안 모니터링 구조를 제안한다. 핵심은 모든 이벤트를 AI에 맡기는 것이 아니라, 정상 패턴과 노이즈를 먼저 걸러낸 뒤 맥락 판단이 필요한 위협만 정밀 분석하는 것이다. ## 대규모 보안 이벤트와 AI의 필요성 - 엔드포인트에서는 프로세스 실행, 네트워크 연결, 파일 변경, 권한 상승 등이 모두 이벤트로 수집된다. - 서비스가 확장될수록 이벤트는 기하급수적으로 증가하지만, 실제 공격의 비율은 극히 낮다. - 이벤트 증가에 맞춰 분석 인력을 계속 늘리는 방식은 지속 가능하지 않다. - 문제의 본질은 데이터의 양뿐 아니라, 여러 이벤트의 관계와 맥락을 이해해야 하는 복잡성에 있다. - 따라서 단순히 경보 수를 늘리는 것이 아니라, 실제 대응 가치가 높은 신호를 선별하는 시스템이 필요하다. ## 규칙 기반 탐지와 상관분석의 한계 - 규칙은 특정 명령어 실행이나 파일 생성처럼 명확한 패턴을 빠르게 탐지하지만, 실행 목적과 주체, 업무 맥락은 이해하지 못한다. - 정상적인 배포 작업과 악성 백도어 설치가 동일한 명령어를 사용할 수 있어 오탐이 많다. - 분석가의 경험과 근무 시간에 따라 판정 품질이 달라지는 문제도 발생한다. - 호스트 정보, 프로세스 이력, 네트워크 세션, 파일 변경 로그를 사건 단위로 조합하는 작업은 높은 인지 부담을 요구한다. - SIEM 상관분석은 여러 로그를 연결할 수 있지만, 사전에 정의된 공격 시나리오에 의존하므로 알려지지 않은 공격이나 변형된 행위에 취약하다. - 규칙이 늘어날수록 유지보수 비용과 매칭 성능 부담도 커진다. - 결국 기존 방식은 이벤트를 연결하는 데는 성공했지만, “왜 해당 행위가 위협인지”를 맥락적으로 설명하는 데 한계가 있다. ## 다단계 깔때기와 하이브리드 분석 - 수억 건의 이벤트를 모두 AI에 전달하지 않고, 단계별로 분석 대상을 줄이는 깔때기 구조를 사용한다. - 1단계에서는 규칙 기반 필터가 명백한 노이즈를 제거한다. - 2단계에서는 반복되는 정상 패턴을 학습해 예외 처리한다. - 3단계에서야 AI가 정밀 분석을 수행하므로 비용과 처리량을 관리할 수 있다. - 명확한 패턴은 규칙이 빠르게 처리하고, 복합적인 맥락 판단은 AI가 담당하는 하이브리드 방식을 채택한다. - 새로운 위협 유형이나 분석 범주가 추가되어도 동일한 파이프라인에서 처리할 수 있도록 확장성을 고려했다. ## 멀티모델 교차 검증과 운영 신뢰성 - 서로 다른 추론 특성을 가진 여러 AI 모델이 동일한 이벤트를 독립적으로 분석한다. - 모델 간 결과를 비교해 특정 모델의 편향, 오탐, 누락을 보완한다. - 판정이 일치하지 않으면 이를 불확실성 신호로 보고 분석가의 추가 검토를 유도한다. - 모델 장애, API 가용성 저하, 모델 업데이트에 따른 품질 변동에도 다른 모델로 전환할 수 있다. - 목표는 단순한 정확도 향상뿐 아니라 중단 없이 운영되는 복원력과 신뢰성 확보이다. ## 보안 환경의 맥락을 AI에 주입 - 범용 LLM에 이벤트만 전달하면 내부 서버 역할, 서비스 구성, 자동화 계정, 정상적인 네트워크 흐름을 알 수 없어 정상 작업을 공격으로 오인할 수 있다. - 이를 해결하기 위해 호스트 역할, 관련 서비스, 정상 행위 패턴 등을 구조화해 AI에 제공한다. - 중요한 것은 원본 데이터를 전달하는 것이 아니라, 올바른 판단에 필요한 배경 지식을 함께 설계하는 것이다. ## 개별 이벤트가 아닌 행위 흐름 분석 - `curl`로 파일을 내려받고 `chmod`로 권한을 바꾼 뒤 스크립트를 실행하는 행위는 정상 배포와 공격 모두에서 나타날 수 있다. - 개별 명령어만 보면 정상과 악성을 구별하기 어렵다. - 프로세스 실행 이력, 네트워크 세션, 파일 변경 등을 시간 순서로 연결해 호스트 단위의 전체 행위 흐름으로 분석한다. - 같은 명령어라도 실행 시점, 순서, 주체, 주변 맥락에 따라 위협성이 달라진다는 점을 활용한다. ## 표준화된 이벤트 스키마와 동적 피처 - 원본 이벤트에는 분석과 무관한 정보가 많아 토큰을 낭비하고 정확도를 떨어뜨릴 수 있다. - 통계 기반 이상 탐지와 행위 시퀀스 분석은 필요한 정보가 서로 다르다. - 표준화된 이벤트 스키마로 데이터를 정제하고, 탐지 유형별로 필요한 특징만 동적으로 구성한다. - 분석 관점에 맞는 피처를 선별해 토큰 효율과 판단 정확도를 함께 개선한다. ## WALT 기반 자가 학습 피드백 루프 - 초기에는 AI 분석 결과를 분석가가 수동으로 검토한 뒤 탐지 정책에 반영해야 했다. - 이를 자동화하기 위해 WALT(Whitelist-Assisted Learning and Tuning)를 구축했다. - AI가 반복적으로 정상이라고 판정하고 검증된 패턴은 자동으로 예외 정책에 등록된다. - 이후 동일한 이벤트는 AI 분석 전에 필터링되어 불필요한 분석과 오탐을 줄인다. - 수천 건의 탐지 정책이 자동 생성되어 운영 중이며, 시간이 지날수록 정상 패턴 학습이 축적된다. - 다만 필터링을 강화하면 비용과 속도는 개선되지만 실제 위협을 놓칠 위험이 있고, 멀티모델 검증은 신뢰성을 높이는 대신 비용을 증가시킨다. ## 비용·속도·정확도의 균형 - 모든 이벤트를 AI로 분석하면 수억 건 규모에서 비용과 지연 시간이 급증한다. - 따라서 사전 필터링으로 AI 투입량을 줄이고, 필요한 이벤트에만 고비용 분석을 적용해야 한다. - 시스템 설계에서는 탐지 누락 위험, 모델 호출 비용, 실시간 대응 속도, 모델 장애 대응력을 함께 조율해야 한다. - 글의 제공된 본문은 이 과제를 설명하는 도중 끝나므로, 이후의 구체적인 구현 방식과 최종 성과는 확인할 수 없다. 실무에서는 규칙을 AI로 전면 대체하기보다, 규칙으로 대량의 노이즈를 제거하고 AI에는 충분한 내부 맥락과 행위 흐름을 제공하는 방식이 현실적이다. 또한 멀티모델 불일치와 자동 생성 정책을 반드시 검증 대상으로 두어, 비용 절감이 탐지 누락으로 이어지지 않도록 운영해야 한다.

원문 읽기(새 탭에서 열림)
datadog원문

eBPF를 활용한 실시간 파일 모니터링 확장: 분당 수십억 개의 커널 이벤트를 필터링하는 방법 (새 탭에서 열림)

Datadog은 현대적인 대규모 인프라에서 신뢰할 수 있는 파일 무결성 모니터링(FIM) 시스템을 구축하기 위해 기존의 주기적 스캔이나 `auditd` 방식 대신 eBPF 기술을 채택했습니다. 이들은 커널 수준에서 실시간 가시성을 확보함으로써 프로세스 및 컨테이너 맥락이 포함된 상세한 보안 데이터를 수집하는 데 성공했습니다. 특히 초당 수십억 건에 달하는 방대한 이벤트를 처리하기 위해, 데이터의 94%를 커널 내부에서 미리 걸러내고 에이전트 단위에서 로컬 규칙 검사를 수행하는 2단계 필터링 아키텍처를 통해 시스템 성능 저하 없이 보안 가시성을 극대화했습니다. ### 기존 모니터링 방식의 기술적 한계 * **주기적 파일 시스템 스캔:** 스캔 사이에 발생했다가 복구된 공격자의 변경 사항을 감지할 수 없으며, 파일이 '어떻게', '왜', '누구에 의해' 변경되었는지에 대한 맥락 정보가 부족합니다. * **inotify:** 파일 이벤트와 프로세스 또는 컨테이너 간의 상관관계를 파악하는 데 필요한 시스템 레벨의 컨텍스트를 제공하지 못합니다. * **auditd:** 시스템 부하가 높은 환경에서 과도한 오버헤드가 발생하며, 대규모 환경에서의 확장성 문제가 고질적인 단점으로 지적됩니다. ### eBPF를 활용한 심층 가시성 확보 * **실시간 커널 모니터링:** eBPF를 통해 커널에서 직접 실시간 파일 활동을 관찰함으로써, 파일 변경 사실뿐만 아니라 이를 유발한 프로세스와 컨테이너 정보까지 포함된 풍부한 보안 데이터를 확보했습니다. * **데이터 폭증의 난제:** 모든 인프라에서 발생하는 파일 관련 이벤트가 분당 100억 건을 넘어서며, 이벤트당 약 5KB인 데이터를 모두 전송할 경우 초당 수 테라바이트의 네트워크 트래픽이 발생하는 심각한 규모의 문제에 직면했습니다. ### 에이전트 기반의 로컬 규칙 필터링 * **에지(Edge)에서의 결정:** 수집된 모든 데이터를 백엔드로 전송하는 대신, 각 호스트의 에이전트에서 로컬 보안 규칙에 따라 데이터를 1차 검증합니다. * **트래픽 절감:** 로컬 필터링을 통해 백엔드로 전송되는 데이터를 분당 100억 건에서 약 100만 건 수준으로 획기적으로 줄여, 네트워크 비용과 시스템 자원 소모를 최소화했습니다. ### 커널 내부 프리필터링(In-kernel prefiltering)을 통한 최적화 * **링 버퍼(Ring Buffer) 드롭 방지:** 에이전트가 처리할 수 있는 속도보다 더 빠르게 이벤트가 생성될 경우 데이터 유실이 발생하는데, 이를 막기 위해 처리 로직의 상당 부분을 커널 내 eBPF 프로그램으로 이동시켰습니다. * **2단계 평가 모델:** * **커널 내부 필터링:** 'Approvers'와 'Discarders' 개념을 도입하여, 무관한 시스템 호출(syscall)의 94%를 유저 공간으로 넘기기 전에 커널 단계에서 즉시 폐기합니다. * **유저 공간 평가:** 커널을 통과한 선별된 이벤트에 대해서만 유저 공간에서 상세한 맥락 정보를 결합하고 복잡한 상관관계 분석을 수행합니다. ### 실용적인 제언 대규모 시스템에서 FIM을 구현할 때는 단순한 데이터 수집보다 '불필요한 데이터의 조기 차단'이 성능의 핵심입니다. eBPF를 활용하되 모든 로직을 커널에 넣기보다는, 커널 내에서의 가벼운 필터링과 유저 공간에서의 심층 분석을 결합한 하이브리드 접근 방식을 취하는 것이 확장성과 보안성을 모두 잡는 전략이 될 수 있습니다.

datadog2분 읽기큐레이션 요약

Datadog의 3세대 이벤트

Datadog은 2026년 Gartner® 매직 쿼드런트™ Observability Platforms 부문에서 Leader로 선정되었다고 소개한다. 제공된 내용은 이 발표와 Datadog 제품 메뉴를 중심으로 구성되어 있어, 선정 근거와 경쟁사 비교, Gartner의 세부 평가 점수는 확인할 수 없다. ## Gartner 매직 쿼드런트 리더 선정 - Datadog이 Observability Platforms 부문에서 Leader로 평가받았다는 내용이다. - 링크는 Datadog의 공식 발표 자료이며, 제품 홍보 성격의 콘텐츠로 보인다. - 제공된 본문에는 다음과 같은 세부 정보가 포함되어 있지 않다. - Gartner의 평가 기준 - Datadog의 강점과 약점 - 경쟁 업체와의 비교 - 실행력(Ability to Execute)과 비전 완성도(Completeness of Vision) 점수 ## 통합 옵저버빌리티 플랫폼 범위 제품 목록은 Datadog이 인프라부터 애플리케이션, 로그, 보안, 사용자 경험, 소프트웨어 전달까지 폭넓은 영역을 하나의 플랫폼에서 제공한다는 점을 보여준다. - **인프라 모니터링** - 호스트, 메트릭, 컨테이너, Kubernetes, 네트워크, 서버리스 환경 모니터링 - 클라우드 비용, 스토리지, GPU 모니터링 지원 - **애플리케이션 성능 관리** - APM, 서비스 모니터링, 지속적 프로파일링, 동적 계측 - AI 에이전트 관찰 기능 제공 - **데이터와 로그 관리** - 데이터베이스 및 데이터 스트림 모니터링 - 로그 관리, 민감 데이터 탐지, 감사 추적, 관측성 파이프라인 - **보안** - 코드 보안, SAST, IAST, 소프트웨어 구성 분석 - 클라우드 보안, CSPM, CIEM, 취약점 관리, Cloud SIEM - 워크로드 및 애플리케이션·API 보호 - **디지털 경험** - 브라우저·모바일 RUM - 세션 리플레이, 신세틱 모니터링, 오류 추적 - 제품 분석과 모바일 앱 테스트 - **소프트웨어 개발·운영** - CI 가시성, 테스트 최적화, 지속적 테스트, 코드 커버리지 - 내부 개발자 포털, 기능 플래그, IDE 플러그인 - **서비스 관리** - 이벤트 관리, 서비스 카탈로그, SLO, 사고 대응 - 케이스 관리와 워크플로 자동화 - **AI 기능** - Bits AI Agents, Bits Chat, Bits Investigation 등 - MCP Server, 에이전트 디렉터리, AI 통합 기능 ## 제공된 글의 한계 - 실제 기사 본문이나 Gartner 보고서의 평가 내용은 제공되지 않고, Datadog 웹사이트의 내비게이션 정보가 대부분이다. - 따라서 “Leader” 선정의 구체적인 이유나 기술적 우수성을 이 자료만으로 검증하기는 어렵다. - 도입을 검토한다면 Gartner 원문과 함께 가격, 데이터 보관 비용, 지원 범위, 기존 도구와의 연동성, 벤더 종속성 등을 별도로 확인해야 한다. Datadog은 인프라·애플리케이션·로그·보안·사용자 경험을 통합하려는 조직에 적합한 후보로 볼 수 있다. 다만 Leader 선정 자체는 제품 도입의 충분조건이 아니므로, 실제 워크로드와 비용 구조를 기준으로 검증하는 것이 바람직하다.

원문 읽기(새 탭에서 열림)
datadog3분 읽기큐레이션 요약

Go 1.18의 프로

Datadog이 Gartner의 **2026 Observability Platforms Magic Quadrant에서 Leader로 선정되었다**는 홍보성 페이지입니다. 제공된 내용에는 선정 근거, 평가 기준, 경쟁사 비교 등 본문은 포함되지 않고, Datadog의 제품 메뉴와 기능 목록이 주로 담겨 있습니다. 따라서 구체적인 기술적 결론보다는 Datadog이 통합 관측성 플랫폼으로 다양한 영역을 제공한다는 점을 확인할 수 있습니다. ### Gartner Magic Quadrant 리더 선정 - Datadog은 Gartner의 **Observability Platforms 부문 2026 Magic Quadrant에서 Leader로 평가**되었다고 소개합니다. - 다만 제공된 발췌문에는 다음과 같은 세부 정보가 없습니다. - Gartner의 평가 기준 - Datadog의 강점과 약점 - 다른 공급업체와의 비교 - 리더 선정의 구체적인 근거와 점수 ### 인프라 및 애플리케이션 모니터링 - 인프라 영역에서는 다음 기능을 제공합니다. - 호스트 및 인프라 모니터링 - 메트릭 수집과 분석 - 컨테이너 및 Kubernetes 모니터링·오토스케일링 - 네트워크, 서버리스, GPU 모니터링 - 클라우드 비용 및 스토리지 관리 - 애플리케이션 영역에는 다음 기능이 포함됩니다. - APM(Application Performance Monitoring) - 서비스 간 상태를 확인하는 Universal Service Monitoring - Continuous Profiler를 통한 코드 성능 분석 - Dynamic Instrumentation - 데이터베이스 및 데이터 스트림 모니터링 ### 로그 및 데이터 관측성 - 로그 관리와 민감 데이터 탐지를 지원합니다. - Observability Pipelines를 통해 로그의 수집·가공·전송 흐름을 관리할 수 있습니다. - 데이터 품질 모니터링과 작업(Job) 모니터링도 제공해 데이터 파이프라인의 상태를 관찰할 수 있습니다. - Audit Trail을 이용해 플랫폼 내 활동을 추적할 수 있습니다. ### 보안과 디지털 경험 - 보안 플랫폼에는 다음 기능이 포함됩니다. - 클라우드 보안 및 보안 상태 관리(CSPM) - 취약점 관리와 권한 관리 - Cloud SIEM 및 워크로드 보호 - 코드 보안, SAST, IAST, IaC 보안 - 비밀정보 및 민감 데이터 탐지 - 디지털 경험 영역에서는 다음을 제공합니다. - 브라우저·모바일 Real User Monitoring - 세션 리플레이 - Synthetic Monitoring - 오류 추적 - 제품 분석 및 실험 기능 ### 소프트웨어 개발 및 운영 관리 - CI Visibility, 테스트 최적화, 지속적 테스트, 코드 커버리지 등 소프트웨어 전달 과정을 모니터링합니다. - Feature Flags와 IDE 플러그인을 통해 개발 워크플로와 배포 과정도 지원합니다. - 서비스 카탈로그, SLO, 이벤트 관리, 인시던트 대응, 워크플로 자동화 기능을 제공합니다. - 이를 통해 개발·운영·보안팀이 동일한 플랫폼에서 장애 대응과 서비스 상태 관리를 수행하도록 구성되어 있습니다. ### AI 기반 기능 - Datadog은 AI 에이전트 관측성, GPU 모니터링, AI 통합 기능을 별도 영역으로 제공합니다. - Bits AI Agents, Bits Chat, Bits Investigation 등은 장애 분석과 운영 자동화를 지원하는 기능으로 소개됩니다. - MCP Server, Agent Builder, Agent Directory 등을 통해 AI 에이전트와 Datadog 기능을 연결하는 구조도 제시합니다. 실제로 Gartner 평가의 의미나 Datadog 도입 타당성을 판단하려면 원문 보고서에서 평가 기준과 경쟁 제품 비교를 추가로 확인해야 합니다. 제공된 페이지 내용만 보면 Datadog은 인프라·애플리케이션·로그·보안·사용자 경험·개발 운영을 하나의 플랫폼에서 통합하려는 제품 전략을 강조하고 있습니다.

원문 읽기(새 탭에서 열림)
datadog2분 읽기큐레이션 요약

Cgo와 Python | Dat

Datadog은 Gartner의 2026년 Observability Platforms 매직 쿼드런트에서 ‘Leader’로 선정되었다고 소개합니다. 제공된 내용은 이 평가 결과를 알리는 페이지 제목과 Datadog 제품 메뉴 중심으로 구성되어 있어, 구체적인 평가 기준이나 경쟁사 비교, 선정 근거는 확인할 수 없습니다. ### Gartner 매직 쿼드런트 리더 선정 - Datadog이 Gartner® Magic Quadrant™ for Observability Platforms 2026에서 Leader로 분류되었다는 내용입니다. - 링크는 Gartner 보고서 또는 관련 리소스 다운로드 페이지로 연결됩니다. - 본문 원문이 제공되지 않아 Gartner가 평가한 실행 능력, 비전 완성도, 점수 등의 세부 내용은 알 수 없습니다. ### 통합 옵저버빌리티 플랫폼 제공된 제품 목록에 따르면 Datadog은 다음 영역을 하나의 플랫폼에서 제공하는 전략을 강조합니다. - **인프라 모니터링** - 메트릭, 컨테이너, Kubernetes 오토스케일링 - 네트워크, 서버리스, GPU, 스토리지 및 클라우드 비용 모니터링 - **애플리케이션 성능 관리** - APM, 서비스 모니터링, 코드 프로파일링 - 동적 계측과 AI 에이전트 관측성 - **로그 및 데이터 관측성** - 로그 관리, 데이터베이스 모니터링 - 데이터 스트림, 데이터 품질, 작업 모니터링 - 민감 데이터 탐지와 옵저버빌리티 파이프라인 - **디지털 경험** - 브라우저·모바일 RUM - 세션 리플레이, 합성 모니터링, 오류 추적 - 제품 분석과 모바일 앱 테스트 ### 보안과 소프트웨어 운영 범위 확장 - 코드 보안, SAST, IAST, 소프트웨어 구성 분석을 제공합니다. - 클라우드 보안, 취약점 관리, CSPM, CIEM, Cloud SIEM 등을 포함합니다. - CI 가시성, 테스트 최적화, 코드 커버리지, 기능 플래그 등 소프트웨어 전달 과정도 관측 대상에 포함합니다. - 이벤트 관리, SLO, 인시던트 대응, 서비스 카탈로그, 워크플로 자동화로 운영 관리까지 확장합니다. ### AI 기반 운영 지원 - Bits AI Agents, Bits Chat, Bits Investigation 등 AI 기능을 제공합니다. - AI 에이전트의 동작을 관찰하는 Agent Observability와 AI 인프라의 GPU 모니터링을 함께 제공합니다. - MCP Server, 에이전트 디렉터리, 에이전트 빌더 등을 통해 AI 도구와 Datadog 데이터를 연결하려는 방향을 보여줍니다. 실무적으로는 ‘Leader’ 선정 자체보다 Gartner 보고서 원문에서 평가 기준과 제한 사항을 확인하는 것이 중요합니다. Datadog 도입을 검토한다면 인프라·로그·APM·보안 데이터를 통합해야 하는지, 그리고 사용량 기반 비용과 데이터 보존 정책이 조직 요구에 맞는지 함께 비교하는 것이 좋습니다.

원문 읽기(새 탭에서 열림)
datadog원문

ChatOps를 통한 클라우드 보안 가시성 향상 (새 탭에서 열림)

Datadog은 대규모 AWS 환경에서 발생하는 막대한 API 호출을 효율적으로 감시하기 위해 서버리스 기반의 보안 모니터링 및 알림 파이프라인을 구축했습니다. 이 시스템은 모든 API 활동을 실시간으로 분석하여 잠재적 위협과 설정 오류를 탐지하며, Slack과 Duo를 활용한 사용자 직접 확인 절차를 통해 보안팀의 운영 부담을 최소화합니다. 결과적으로 적은 인력으로도 수많은 계정의 보안 상태를 높은 가용성으로 유지할 수 있는 중앙 집중형 구조를 완성했습니다. ### 데이터 필터링과 위험도 분류 * **로그 중심의 선택적 집중:** 모든 API 호출을 실시간 감시하는 것은 불가능하므로, 보안상 의미 있는 API를 식별하여 로그(Log), 알림(Notify), 경고(Alert)의 세 단계로 분류했습니다. * **단계별 대응 체계:** 단순 변경(CreateGroup 등)은 추후 조사를 위해 로그로 남기고, 권한 변경(CreateUser 등)은 실행한 엔지니어에게 직접 확인을 요청하며, 치명적인 설정 오류(보안 그룹을 0.0.0.0/0으로 개방 등)는 즉시 보안팀에 경고를 보냅니다. * **엔지니어 직접 검증:** 알림 단계에서는 해당 API를 호출한 엔지니어에게 Slack 메시지를 보내 본인이 수행한 작업인지 확인하게 함으로써, 계정 탈취 여부를 확인하는 동시에 보안팀의 오탐(False-positive) 분석 업무를 획기적으로 줄였습니다. ### 중앙 집중형 아키텍처 및 파이프라인 * **교차 계정 데이터 통합:** 15개 이상의 AWS 계정에서 발생하는 이벤트를 하나의 중앙 보안 계정으로 수집하기 위해 CloudWatch 이벤트 규칙과 SNS, SQS를 조합했습니다. * **지연 및 비용 최적화:** CloudWatch가 SQS로 직접 데이터를 보내지 못하는 제약을 SNS를 통해 해결했으며, Lambda를 2분마다 트리거하여 SQS 큐의 데이터를 처리함으로써 실시간성과 알림 피로도 사이의 균형을 맞췄습니다. * **인프라 코드화:** Terraform을 사용하여 모든 AWS 계정에 동일한 데이터 수집 설정을 신속하고 일관되게 배포할 수 있는 구조를 갖췄습니다. ### 보안 오케스트레이션과 자동화 로직 * **워크플로우 자동화:** 보안 오케스트레이션 플랫폼인 Komand(현 Rapid7 InsightConnect)를 도입하여 복잡한 결정 트리와 브랜칭 로직을 구현했습니다. * **상세 분석 플러그인:** 커스텀 플러그인을 통해 호출자 identity, API 파라미터 내용, 요청 시간 등을 정밀하게 파싱하여 경고 여부를 결정합니다. * **다중 인증(MFA) 연동:** 엔지니어가 Slack 알림에서 본인의 작업임을 승인하면 Duo Push를 통해 2차 인증을 거치게 되며, 응답이 없거나 본인 작업이 아니라고 응답할 경우에만 보안팀에 비상 호출(PagerDuty)이 전달됩니다. * **가시성 확보:** 모든 워크플로우 실행 결과는 Elasticsearch로 전송되어 대시보드화되며, 이를 통해 보안 이벤트 추세와 시스템 효율성을 측정합니다. 대규모 클라우드 환경을 운영하는 조직이라면 모든 이벤트를 보안팀이 직접 처리하려 하기보다, 이처럼 자동화된 오케스트레이션과 사용자 참여형 검증 시스템을 구축하여 '확장 가능한 보안(Scalable Security)'을 실현하는 것이 권장됩니다.