anomaly-detection

10 개의 포스트

cloudflare4분 읽기큐레이션 요약

신원 인식형 분석으로 통제 불능 AI 행동 포착하기

AI 사용량의 이상 징후를 파악하려면 요청마다 검증된 사용자·에이전트 신원과 각 계정의 정상적인 사용 기준선이 필요하다. Cloudflare는 AI Gateway와 Cloudflare Access를 결합해 요청별 신원을 확인하고, User Insights로 계정별 사용 패턴에서 벗어난 행동을 탐지한다고 밝혔다. 이를 통해 비용 관리뿐 아니라 과도한 사용이나 악성·오작동 에이전트 탐지까지 가능하게 한다. ## AI Gateway를 통한 중앙 관리 - AI Gateway는 OpenAI, Anthropic, Google, Workers AI 등 여러 모델로 향하는 요청을 하나의 제어 지점으로 통합한다. - 애플리케이션뿐 아니라 Claude Code, Codex, GitHub Copilot 같은 개발자용 에이전트도 동일한 관찰·보안·거버넌스 정책을 적용할 수 있다. - 모든 AI 트래픽을 한곳에서 분석하므로 비용, 모델 사용량, 접근 제어를 통합 관리할 수 있다. ## Cloudflare Access 기반의 신원 확인 - AI Gateway 앞에 사용자 정의 도메인을 두고 Cloudflare Access로 보호할 수 있다. - Okta, Entra 등 SAML을 지원하는 ID 공급자를 이용해 인증하며, 별도의 Cloudflare API 키를 배포할 필요가 없다. - 인증된 요청에는 사용자의 Access ID가 `cf.user_id` 메타데이터로 포함된다. - 관리자는 실제 요청자를 기준으로 로그, 분석 데이터, 비용을 필터링할 수 있다. - 공유 API 키 때문에 누가 얼마나 사용했는지 알기 어려웠던 문제를 해결한다. ## 사용자별 비용 한도와 정책 - `cf.user_id`를 기반으로 사용자마다 독립적인 예산 한도를 설정할 수 있다. - 한도에 도달하면 요청을 차단하거나 더 저렴한 모델로 자동 전환할 수 있다. - 향후 ID 공급자의 그룹 정보와 연동해 팀별로 모델 접근 권한과 지출 한도를 설정할 예정이다. - 머신러닝 팀에는 최고급 모델 허용 - 지원팀에는 지출 상한 적용 - 특정 프로젝트 구성원에게 공동 예산 할당 ## User Insights의 역할 - User Insights는 AI Gateway를 통과하는 기존 트래픽을 별도 설정 없이 분석한다. - 사람과 에이전트 각각의 평소 행동 패턴을 학습하고, 그 패턴에서 벗어난 계정을 보여준다. - 비용뿐 아니라 캐시 적중률이 낮거나 컨텍스트 윈도우가 과도하게 큰 등 비용 낭비 요인도 추적한다. - 단순히 “많이 사용했는가”가 아니라 “그 계정의 평소 사용 방식과 다른가”를 판단하는 데 초점을 둔다. ## 사람과 에이전트별 행동 기준선 - 계정은 사용자든 에이전트든 시간에 따라 고유한 행동 패턴을 만든다. - 일정한 간격으로 티켓을 요약하는 에이전트와, 프롬프트·세션 길이가 불규칙한 사람은 정상 패턴이 다르다. - 따라서 모든 계정에 동일한 절대 비용 기준을 적용하면 오탐이 많아진다. - 평소 비용이 큰 사용자의 500달러 지출은 정상일 수 있다. - 평소 5달러를 쓰는 에이전트의 50달러 세션은 10배 증가한 이상 징후일 수 있다. ## 세션 비용 기반 이상 탐지 - User Insights는 개별 요청이 아니라 세션 단위로 비용을 평가한다. - 최근 30일 동안 해당 계정의 세션 비용 p95를 개인 기준선으로 사용한다. - 세션 비용이 개인 p95의 2배를 초과하면 이상 행동 후보로 분류한다. - 단, 상대적 급증만으로는 부족하므로 조직 전체 세션 비용의 p99도 함께 사용한다. - 최종적으로 다음 조건을 모두 만족하는 세션만 경고 대상이 된다. - 해당 계정의 최근 기준선보다 2배 이상 비쌈 - 조직 전체 세션 중 가장 비싼 1% 수준에 해당함 - 절대 비용 하한선도 적용해, 소액 사용자의 몇 센트짜리 급증이 불필요한 경고를 발생시키지 않도록 한다. ## 동적으로 갱신되는 기준선 - 기준선은 고정값이 아니라 계정의 최근 사용 습관에 따라 계속 변한다. - 계정의 rolling p95와 2배 임계값이 이동하므로 현재 행동에 맞는 경고가 가능하다. - 정상적인 고사용자 활동은 제외하고, 평소 패턴을 깨면서도 실제 조사 가치가 있는 고비용 세션만 추린다. - 결과적으로 관리자는 정상 트래픽을 모두 살펴보는 대신, 의심스러운 계정 중심의 “rogue behavior feed”를 확인할 수 있다. ## 보안과 비용 관리의 결합 - 이상 사용은 새로운 도구나 명백히 차단된 행동으로 나타나지 않을 수 있다. - 이미 권한을 가진 계정이나 서비스 계정이 허용된 작업을 평소보다 훨씬 많이 수행하는 방식으로 나타날 수 있다. - 따라서 사용자 신원 확인과 행동 기준선 분석을 함께 적용해야 비용 폭증과 보안 위험을 동시에 발견할 수 있다. 실무적으로는 모든 AI 요청을 AI Gateway로 통합하고, Cloudflare Access로 개인·에이전트 신원을 연결한 뒤, 사용자별 예산과 User Insights의 상대적 기준선을 함께 활용하는 방식이 권장된다.

원문 읽기(새 탭에서 열림)
kakao5분 읽기큐레이션 요약

수억 건의 보안 신호 속 진짜 위협 찾기 — AI로 보안 모니터링의 패러다임을 바꾸다

수억 건의 보안 이벤트를 사람이 규칙만으로 분석하는 방식은 오탐, 맥락 부족, 비용 증가 때문에 지속하기 어렵다. 글은 규칙 기반 필터와 AI 분석, 멀티모델 교차 검증, 자가 학습을 결합한 다단계 보안 모니터링 구조를 제안한다. 핵심은 모든 이벤트를 AI에 맡기는 것이 아니라, 정상 패턴과 노이즈를 먼저 걸러낸 뒤 맥락 판단이 필요한 위협만 정밀 분석하는 것이다. ## 대규모 보안 이벤트와 AI의 필요성 - 엔드포인트에서는 프로세스 실행, 네트워크 연결, 파일 변경, 권한 상승 등이 모두 이벤트로 수집된다. - 서비스가 확장될수록 이벤트는 기하급수적으로 증가하지만, 실제 공격의 비율은 극히 낮다. - 이벤트 증가에 맞춰 분석 인력을 계속 늘리는 방식은 지속 가능하지 않다. - 문제의 본질은 데이터의 양뿐 아니라, 여러 이벤트의 관계와 맥락을 이해해야 하는 복잡성에 있다. - 따라서 단순히 경보 수를 늘리는 것이 아니라, 실제 대응 가치가 높은 신호를 선별하는 시스템이 필요하다. ## 규칙 기반 탐지와 상관분석의 한계 - 규칙은 특정 명령어 실행이나 파일 생성처럼 명확한 패턴을 빠르게 탐지하지만, 실행 목적과 주체, 업무 맥락은 이해하지 못한다. - 정상적인 배포 작업과 악성 백도어 설치가 동일한 명령어를 사용할 수 있어 오탐이 많다. - 분석가의 경험과 근무 시간에 따라 판정 품질이 달라지는 문제도 발생한다. - 호스트 정보, 프로세스 이력, 네트워크 세션, 파일 변경 로그를 사건 단위로 조합하는 작업은 높은 인지 부담을 요구한다. - SIEM 상관분석은 여러 로그를 연결할 수 있지만, 사전에 정의된 공격 시나리오에 의존하므로 알려지지 않은 공격이나 변형된 행위에 취약하다. - 규칙이 늘어날수록 유지보수 비용과 매칭 성능 부담도 커진다. - 결국 기존 방식은 이벤트를 연결하는 데는 성공했지만, “왜 해당 행위가 위협인지”를 맥락적으로 설명하는 데 한계가 있다. ## 다단계 깔때기와 하이브리드 분석 - 수억 건의 이벤트를 모두 AI에 전달하지 않고, 단계별로 분석 대상을 줄이는 깔때기 구조를 사용한다. - 1단계에서는 규칙 기반 필터가 명백한 노이즈를 제거한다. - 2단계에서는 반복되는 정상 패턴을 학습해 예외 처리한다. - 3단계에서야 AI가 정밀 분석을 수행하므로 비용과 처리량을 관리할 수 있다. - 명확한 패턴은 규칙이 빠르게 처리하고, 복합적인 맥락 판단은 AI가 담당하는 하이브리드 방식을 채택한다. - 새로운 위협 유형이나 분석 범주가 추가되어도 동일한 파이프라인에서 처리할 수 있도록 확장성을 고려했다. ## 멀티모델 교차 검증과 운영 신뢰성 - 서로 다른 추론 특성을 가진 여러 AI 모델이 동일한 이벤트를 독립적으로 분석한다. - 모델 간 결과를 비교해 특정 모델의 편향, 오탐, 누락을 보완한다. - 판정이 일치하지 않으면 이를 불확실성 신호로 보고 분석가의 추가 검토를 유도한다. - 모델 장애, API 가용성 저하, 모델 업데이트에 따른 품질 변동에도 다른 모델로 전환할 수 있다. - 목표는 단순한 정확도 향상뿐 아니라 중단 없이 운영되는 복원력과 신뢰성 확보이다. ## 보안 환경의 맥락을 AI에 주입 - 범용 LLM에 이벤트만 전달하면 내부 서버 역할, 서비스 구성, 자동화 계정, 정상적인 네트워크 흐름을 알 수 없어 정상 작업을 공격으로 오인할 수 있다. - 이를 해결하기 위해 호스트 역할, 관련 서비스, 정상 행위 패턴 등을 구조화해 AI에 제공한다. - 중요한 것은 원본 데이터를 전달하는 것이 아니라, 올바른 판단에 필요한 배경 지식을 함께 설계하는 것이다. ## 개별 이벤트가 아닌 행위 흐름 분석 - `curl`로 파일을 내려받고 `chmod`로 권한을 바꾼 뒤 스크립트를 실행하는 행위는 정상 배포와 공격 모두에서 나타날 수 있다. - 개별 명령어만 보면 정상과 악성을 구별하기 어렵다. - 프로세스 실행 이력, 네트워크 세션, 파일 변경 등을 시간 순서로 연결해 호스트 단위의 전체 행위 흐름으로 분석한다. - 같은 명령어라도 실행 시점, 순서, 주체, 주변 맥락에 따라 위협성이 달라진다는 점을 활용한다. ## 표준화된 이벤트 스키마와 동적 피처 - 원본 이벤트에는 분석과 무관한 정보가 많아 토큰을 낭비하고 정확도를 떨어뜨릴 수 있다. - 통계 기반 이상 탐지와 행위 시퀀스 분석은 필요한 정보가 서로 다르다. - 표준화된 이벤트 스키마로 데이터를 정제하고, 탐지 유형별로 필요한 특징만 동적으로 구성한다. - 분석 관점에 맞는 피처를 선별해 토큰 효율과 판단 정확도를 함께 개선한다. ## WALT 기반 자가 학습 피드백 루프 - 초기에는 AI 분석 결과를 분석가가 수동으로 검토한 뒤 탐지 정책에 반영해야 했다. - 이를 자동화하기 위해 WALT(Whitelist-Assisted Learning and Tuning)를 구축했다. - AI가 반복적으로 정상이라고 판정하고 검증된 패턴은 자동으로 예외 정책에 등록된다. - 이후 동일한 이벤트는 AI 분석 전에 필터링되어 불필요한 분석과 오탐을 줄인다. - 수천 건의 탐지 정책이 자동 생성되어 운영 중이며, 시간이 지날수록 정상 패턴 학습이 축적된다. - 다만 필터링을 강화하면 비용과 속도는 개선되지만 실제 위협을 놓칠 위험이 있고, 멀티모델 검증은 신뢰성을 높이는 대신 비용을 증가시킨다. ## 비용·속도·정확도의 균형 - 모든 이벤트를 AI로 분석하면 수억 건 규모에서 비용과 지연 시간이 급증한다. - 따라서 사전 필터링으로 AI 투입량을 줄이고, 필요한 이벤트에만 고비용 분석을 적용해야 한다. - 시스템 설계에서는 탐지 누락 위험, 모델 호출 비용, 실시간 대응 속도, 모델 장애 대응력을 함께 조율해야 한다. - 글의 제공된 본문은 이 과제를 설명하는 도중 끝나므로, 이후의 구체적인 구현 방식과 최종 성과는 확인할 수 없다. 실무에서는 규칙을 AI로 전면 대체하기보다, 규칙으로 대량의 노이즈를 제거하고 AI에는 충분한 내부 맥락과 행위 흐름을 제공하는 방식이 현실적이다. 또한 멀티모델 불일치와 자동 생성 정책을 반드시 검증 대상으로 두어, 비용 절감이 탐지 누락으로 이어지지 않도록 운영해야 한다.

원문 읽기(새 탭에서 열림)
cloudflare원문

위험한 조합: 작은 신 (새 탭에서 열림)

보안 사고는 종종 단일한 대규모 공격이 아니라, 미세한 설정 오류와 비정상 신호들이 결합된 '독성 조합(Toxic Combinations)'을 통해 발생합니다. 개별적으로는 무해해 보이는 디버그 플래그 노출이나 관리자 페이지 접근 시도가 봇 트래픽 및 비정상적인 맥락과 결합될 때 시스템 침해나 데이터 유출의 결정적인 징후가 됩니다. 클라우드플레어는 이러한 개별 신호들을 통합 분석하여 단순한 요청 차단을 넘어 공격자의 의도와 잠재적 위협을 식별하는 새로운 보안 프레임워크를 제시합니다. ### 독성 조합의 정의와 식별 맥락 기본적인 보안 장비(WAF, API 보호 등)가 개별 요청의 위험도를 평가한다면, 독성 조합 탐지는 여러 신호 사이의 관계와 맥락을 분석합니다. * **봇 신호 분석:** 공격의 자동화 여부를 판단하기 위해 봇 점수(Bot Score)를 활용하며, 낮은 점수의 트래픽이 민감한 경로를 탐색하는지 확인합니다. * **민감 경로 결합:** `/admin`, `/debug`, `/metrics`, `/wp-admin` 등 관리자 권한이나 내부 정보가 노출될 수 있는 경로에 대한 요청을 집중 감시합니다. * **통계적 이상 징후:** 평소와 다른 지리적 접속(Geo jump), 동일한 행위를 반복하는 분산 IP(Rate-limit evasion), 예상치 못한 HTTP 상태 코드 발생 등을 분석합니다. * **설정 오류 식별:** 인증 헤더가 누락되었거나 세션 쿠키가 없는 상태에서 민감한 데이터에 접근하는 시도를 탐지합니다. ### 공격 단계별 분석 및 데이터 현황 클라우드플레어는 24시간 동안의 데이터를 분석하여 실제 공격이 이루어지는 과정을 세 단계로 구분했습니다. * **광범위한 탐색(Probing):** 분석 대상 호스트의 약 11%에서 관리자 페이지 접근 시도가 관찰되었으며, 이는 주로 워드프레스(WordPress) 환경에 집중되었습니다. * **독성 조합 필터링:** 탐색 시도 중 봇 신호와 특정 경로 접근이 결합된 사례를 추출한 결과, 워드프레스 제외 시 약 0.25%의 호스트가 실제 위험에 노출된 것으로 나타났습니다. * **도달 가능성 검증(Reachable):** 단순한 `200 OK` 응답이 실제 성공인지 확인하기 위해 리다이렉션이나 오설정으로 인한 허위 양성(False Positive)을 제거하여 실제 취약한 호스트를 선별합니다. ### 주요 위협 시나리오와 취약점 작은 신호들이 모여 형성되는 대표적인 보안 위협은 다음과 같습니다. * **관리자 엔드포인트 노출:** `/wp-admin`이나 서버 대시보드 스캔을 통해 무차별 대입 공격을 수행하거나, 특정 소프트웨어 버전의 CVE 취약점을 노린 타겟팅 공격으로 이어집니다. * **디버그 플래그 오용:** URL에 `?debug=true`와 같은 파라미터를 추가하여 기술 스택 정보, 환경 변수, 데이터베이스 쿼리 세부 내용을 탈취하려는 시도입니다. * **권한 및 접근 제어 위협:** 인증 헤더가 없는 상태에서 높은 ID 변동성(High ID churn)을 보이는 요청은 IDOR(부적절한 직접 객체 참조)를 통한 데이터 유출 가능성을 시사합니다. ### 보안 강화를 위한 실무 권장사항 * **통합 모니터링:** Cloudflare WAF와 봇 관리 기능을 결합하여 자동화된 스캐닝을 차단하고, Log Explorer를 통해 민감한 경로에 대한 비정상적인 성공 응답을 주기적으로 쿼리해야 합니다. * **디버그 모드 관리:** 운영 환경에서 불필요한 디버그 플래그가 활성화되어 있지 않은지 점검하고, 노출된 관리자 페이지에는 Zero Trust 인증이나 IP 화이트리스팅을 적용하십시오. * **맥락 기반 대응:** 단일 요청 차단에 그치지 않고, 특정 IP나 봇이 수행하는 일련의 행위 패턴을 분석하여 공격의 '의도'를 파악하는 방어 전략을 수립해야 합니다.

meta원문

DrP: 대규모 환경을 (새 탭에서 열림)

Meta가 개발한 **DrP(Root Cause Analysis platform)**는 대규모 시스템에서 발생하는 장애 조사 과정을 프로그래밍 방식으로 자동화하여 평균 복구 시간(MTTR)을 혁신적으로 단축하는 플랫폼입니다. 기존의 수동 조사와 노후화된 플레이북이 유발하는 온콜(On-call) 엔지니어의 피로도 문제를 해결하기 위해, 분석 로직을 코드로 작성하고 실행할 수 있는 통합 환경을 제공합니다. 현재 Meta 내 300개 이상의 팀에서 매일 5만 건 이상의 분석을 수행하며, 장애 복구 시간을 20%에서 최대 80%까지 줄이는 성과를 내고 있습니다. ### DrP의 핵심 구성 요소 * **표현력이 풍부한 SDK**: 엔지니어가 조사 워크플로우를 '분석기(Analyzer)'라는 코드로 구현할 수 있게 돕습니다. 이상 탐지, 시계열 상관관계 분석, 차원 분석 등 복잡한 데이터 분석을 위한 머신러닝 알고리즘과 헬퍼 라이브러리를 포함합니다. * **확장 가능한 백엔드**: 수만 건의 분석을 동시에 처리할 수 있는 멀티 테넌트 실행 환경을 제공하며, 각 분석 작업이 안전하게 격리되어 실행되도록 보장합니다. * **워크플로우 통합 및 후처리**: 알림(Alert) 시스템 및 장애 관리 도구와 긴밀하게 통합되어 장애 발생 시 자동으로 분석을 시작합니다. 분석 후에는 티켓 생성이나 코드 수정 요청(PR)과 같은 후속 조치를 자동으로 수행하는 기능도 갖추고 있습니다. ### 분석기(Analyzer)의 작성 및 실행 흐름 * **코드 기반 플레이북 작성**: 엔지니어는 SDK를 사용하여 장애 조사의 의사결정 트리를 코드로 작성합니다. 이 과정에서 종속된 서비스들의 분석기를 서로 연결(Chaining)하여 복합적인 장애 원인을 추적할 수 있습니다. * **자동화된 검증**: 작성된 분석기는 배포 전 코드 리뷰 도구와 통합된 백테스트(Backtesting) 과정을 거쳐 품질과 신뢰성을 검증받습니다. * **즉각적인 통찰력 제공**: 장애가 감지되면 DrP 백엔드가 즉시 분석기를 가동합니다. 온콜 엔지니어는 장애 알림을 받는 동시에 시스템이 이미 분석해 놓은 근본 원인과 권장 조치 사항을 확인할 수 있습니다. ### 도입 효과 및 운영 가치 * **MTTR의 획기적 단축**: 수동으로 몇 시간씩 걸리던 데이터 수집과 분류 작업을 자동화함으로써 장애 복구 속도를 가속화하고 시스템 가용성을 높입니다. * **온콜 생산성 향상**: 반복적이고 소모적인 디버깅 작업을 기계가 대신 처리하게 함으로써 엔지니어가 더 복잡하고 가치 있는 문제 해결에 집중할 수 있게 합니다. * **조사의 일관성 확보**: 개인의 숙련도에 의존하던 조사 방식을 코드화된 워크플로우로 표준화하여, 어떤 엔지니어가 대응하더라도 동일한 수준의 고품질 분석 결과를 얻을 수 있습니다. **결론적으로**, DrP는 대규모 마이크로서비스 환경에서 발생하는 복잡한 장애를 해결하기 위해 '운영의 코드화'를 실현한 사례입니다. 시스템 규모가 커짐에 따라 수동 대응의 한계를 느끼는 조직이라면, DrP와 같은 자동화된 RCA 플랫폼을 도입하여 인프라의 안정성과 엔지니어의 생산성을 동시에 확보하는 전략이 권장됩니다.

woowahan원문

우아한형제들이 장애를 놓치지 않고 탐지하는 방법 | 우아한형제들 기술블로그 (새 탭에서 열림)

우아한형제들은 시스템 장애로 인한 고객 불편을 최소화하기 위해 서비스 지표 중심의 '서비스 이상 탐지 시스템'을 구축했습니다. 전통적인 인프라 모니터링의 사각지대를 보완하고자 실시간 데이터 예측과 임계치 관리 메커니즘을 도입했으며, 이를 통해 장애 탐지 속도와 대응 효율성을 동시에 확보했습니다. **서비스 지표 중심의 이상 탐지 필요성** * CPU, 메모리 사용률 등 전통적인 시스템 지표 모니터링만으로는 모든 장애 구간을 완벽하게 커버하기 어렵고 사각지대가 발생할 수밖에 없습니다. * 반면 주문 수, 결제 성공률 등 서비스 지표는 사용자 경험을 직접적으로 반영하며, 지표의 종류가 한정적이라 최소한의 관리로도 높은 탐지 효율을 낼 수 있습니다. * 서비스 이상 탐지 시스템은 장애가 발생했을 때 사용자 영향이 지표 변화로 나타나는 즉시 이를 포착하는 것을 목표로 합니다. **중앙값(Median) 기반의 탐지 기법 설계** * 배달 서비스 특성상 점심과 저녁 시간에 주문이 집중되는 선명한 패턴이 존재하므로, 과거 데이터를 통해 정상 범위를 비교적 쉽게 예측할 수 있습니다. * 분석의 용이성과 이상치(Outlier)에 대한 강건함을 확보하기 위해 IQR이나 2-sigma 대신 직관적인 중앙값(Median) 방식을 채택했습니다. * 복잡한 AI 모델을 사용하기보다 빠르게 구현하고 개선할 수 있는 구조를 선택하여 원인 분석과 시스템 업데이트의 속도를 높였습니다. **정확도 향상을 위한 임계 도달 횟수 관리** * 실시간으로 수집되는 실제값(Actual)이 예측된 임계값(Warning, Critical)에 도달할 때 장애를 판단합니다. * 일시적인 지표 튀기 현상으로 인한 오탐(False Positive)을 방지하기 위해, 임계값에 특정 횟수 이상 연속으로 도달했을 때만 경보를 발생시키는 '임계 도달 횟수'를 관리합니다. * 탐지 속도(낮은 횟수 설정)와 정확도(높은 횟수 설정) 사이의 트레이드오프를 고려하여 각 지표의 성격에 맞는 최적의 안정화 기간을 거칩니다. **신속한 대응을 위한 경보 및 프로세스 연계** * 장애 탐지 시 슬랙(Slack) 채널로 지표 현황, 긴급도, 그래프가 포함된 경보를 즉시 발송하여 상황 파악을 돕습니다. * 단순히 알림을 보내는 데 그치지 않고, 장애 숙련도와 관계없이 누구나 표준화된 절차에 따라 대응할 수 있도록 후속 프로세스 가이드를 함께 제공합니다. 장애는 완벽히 막을 수 없지만 탐지 시간은 단축할 수 있습니다. 복잡한 알고리즘에 매몰되기보다 서비스의 비즈니스 패턴을 명확히 분석하고, 가장 직관적인 지표와 통계 모델을 적용하는 것이 실무적인 관점에서는 훨씬 강력한 장애 대응 체계를 만드는 방법입니다.

naver원문

네이버 TV (새 탭에서 열림)

네이버 통합검색은 서비스 복잡도가 급증함에 따라 발생하는 장애 대응의 한계를 극복하기 위해 LLM 기반의 DevOps 에이전트를 도입했습니다. 이 에이전트는 단순히 장애 알람을 전달하는 수준을 넘어, 시스템 메트릭과 로그를 스스로 분석하고 최적의 조치 방안을 추천하며 경험을 통해 지속적으로 진화합니다. 결과적으로 복잡한 검색 인프라 운영의 효율성을 극대화하고 장애 복구 시간(MTTR)을 단축하는 것을 목표로 합니다. **기존 장애 대응 프로세스의 한계** * 네이버 검색은 수많은 마이크로서비스가 복잡하게 얽혀 있어, 장애 발생 시 원인을 파악하기 위해 확인해야 할 메트릭과 로그의 양이 방대합니다. * 기존의 룰 기반(Rule-based) 시스템은 정해진 규칙 외의 변칙적인 장애 상황에 유연하게 대응하기 어렵고, 운영자의 숙련도에 따라 대응 속도 차이가 크게 발생했습니다. * 장애 상황마다 산재한 데이터를 수동으로 취합하고 분석하는 과정에서 발생하는 인지적 부하와 시간 지연이 주요 해결 과제로 대두되었습니다. **Devops Agent의 구조적 진화 (v1에서 v2로)** * **v1 설계 및 한계:** 초기 버전은 기본적인 데이터 수집과 리포팅 자동화에 집중했으나, 다양한 인프라 환경에서 발생하는 복합적인 컨텍스트를 LLM이 완벽히 이해하고 추론하기에는 한계가 있었습니다. * **v2 구조 개선:** v1의 한계를 극복하기 위해 Agentic Workflow를 강화하여, 에이전트가 상황에 따라 필요한 도구(Tools)를 스스로 선택하고 분석 단계를 세분화하여 실행하도록 재설계했습니다. * **SW Stack 고도화:** 최신 LLM 프레임워크와 네이버의 인프라 데이터를 효율적으로 결합하여, 실시간으로 변화하는 시스템 상태를 에이전트가 즉각적으로 파악할 수 있는 기반을 마련했습니다. **시스템 동작과 이상 탐지 메커니즘** * **Trigger Queue:** 모든 장애 징후와 알람을 큐(Queue) 시스템으로 관리하여 분석의 우선순위를 정하고, 누락 없는 대응이 가능하도록 설계했습니다. * **이상 탐지(Anomaly Detection):** 단순 임계치 기반 알람이 아니라, 통계적 모델과 AI를 활용해 평상시 패턴에서 벗어나는 이상 현상을 정교하게 포착합니다. * **평가 체계:** 에이전트가 내놓은 분석 결과와 추천 액션의 정확도를 지속적으로 평가하며, 실제 엔지니어의 피드백을 학습 데이터로 환류시켜 분석 품질을 높입니다. **지속 가능한 DevOps를 위한 향후 과제** * **컨텍스트 확대:** 장애 당시의 로그뿐만 아니라 배포 이력, 설정 변경 내역 등 더 넓은 범위의 데이터를 연동하여 분석의 정확도를 높이고 있습니다. * **액션 추천 및 자동화:** 장애 원인 분석을 넘어 "특정 서버 그룹의 트래픽을 차단하라"와 같이 구체적인 실행 코드를 생성하거나 직접 조치하는 단계로 확장 중입니다. * **지속 가능한 학습:** 새로운 유형의 장애가 발생할 때마다 이를 지식화하여 에이전트가 다음번 유사 사례에서 더 똑똑하게 대응할 수 있는 선순환 구조를 구축하고 있습니다. 이 시스템은 인프라 운영자가 반복적인 데이터 취합 업무에서 벗어나 의사결정과 문제 해결에만 집중할 수 있는 환경을 제공합니다. LLM 에이전트의 도입은 단순한 도구 활용을 넘어, 대규모 시스템 운영 노하우를 데이터화하고 지능화된 자동화로 전환하는 중요한 기술적 이정표가 될 것입니다.

dropbox원문

미래를 구축하다: Dropbox (새 탭에서 열림)

드롭박스는 2025년 여름 인턴십 프로그램을 통해 43명의 인턴과 함께 AI 기반 통합 검색 도구인 '드롭박스 대시(Dropbox Dash)'를 비롯한 핵심 서비스의 성능과 인프라를 혁신했습니다. 엔지니어링 중심의 이번 기수들은 12주간 멘토링과 실무 프로젝트에 참여하며, 특히 AI 모델의 신뢰성 강화와 다국어 검색 지원 등 드롭박스의 차세대 기술 역량을 끌어올리는 데 기여했습니다. 결과적으로 이번 프로그램은 인턴들에게는 실질적인 기술적 성장을, 기업에는 레거시 시스템 현대화와 운영 효율화라는 실용적 성과를 동시에 안겨주었습니다. ### 드롭박스 대시와 AI 기술 고도화 * **다국어 검색 지원 확대**: 통합 검색 플랫폼(USP)에 언어 감지 파이프라인을 통합하여 리플레이(Replay) 등 드롭박스 제품 전반에 걸쳐 20개 이상의 언어를 지원하는 네이티브 검색 환경을 구축했습니다. * **ML 모델 모니터링 시스템(AI Sentinel)**: 머신러닝 엔지니어가 수동으로 확인하던 모델 배포 상태를 실시간으로 가시화하는 시스템을 개발하여 배포의 신뢰성을 높이고 반복 주기를 단축했습니다. * **커넥터 플랫폼 최적화**: 대시의 데이터 저장소에서 최신 정보에 직접 접근할 수 있는 도구를 빌드하여, 외부 시스템의 데이터를 매번 다시 다운로드하지 않고도 최신 메타데이터 기반으로 모델을 학습시킬 수 있게 했습니다. * **문서 미리보기 및 웹 자동화**: 대시 내에서 문서를 즉시 미리 볼 수 있는 UI와 대화형 AI 기능을 통합하고, 폼 채우기나 교정 등의 반복 업무를 자동화하는 모듈형 AI 에이전트를 개발했습니다. ### 인프라 성능 및 데이터 효율화 * **스토리지 코어(Magic Pocket) 지연 시간 단축**: 디스크 재시작 시 발생하는 쓰기 지연 문제를 해결하기 위해 스토리지 상태를 추적하는 캐시와 성능이 저하된 볼륨을 제외하는 필터링 옵션을 추가하여 검색 결과의 정확도를 높였습니다. * **파일 시스템 메타데이터 리팩토링**: 레거시 파일 이력 추적 시스템을 현대화하여 메타데이터 인프라를 단순화하고 운영 비용을 대폭 절감했습니다. * **대규모 데이터 분석 최적화**: Databricks 쿼리와 ETL 파이프라인의 고비용 패턴을 식별하는 추천 시스템을 구축하고, 500TB 규모의 모바일 이벤트 로그를 최신 데이터 레이아웃 기술인 '리퀴드 클러스터링(Liquid Clustering)'으로 마이그레이션했습니다. ### 개발자 경험 및 운영 도구 개선 * **AI 기반 코드 마이그레이션**: 특정 폴더나 유형에 대해 코드 마이그레이션을 자동화하고 결과가 성공적일 경우 자동으로 Pull Request를 생성하는 도구를 제작하여 대규모 마이그레이션 작업을 효율화했습니다. * **지능형 지표 감지 시스템(Vortex2)**: 고정된 임계값 대신 데이터의 계절성과 변화 패턴을 학습하는 적응형 이상 탐지 기법을 도입하여 알림 피로도를 줄이고 장애 대응 속도를 개선했습니다. 이러한 인턴들의 성과는 드롭박스가 단순한 파일 저장소를 넘어 AI 중심의 워크플로우 플랫폼으로 진화하고 있음을 보여줍니다. 특히 대규모 마이그레이션 자동화나 인프라 수준의 지연 시간 최적화와 같은 실무적인 기술 해결책은 엔지니어링 팀의 생산성을 직접적으로 높이는 실용적인 결론을 도출했습니다.

slack4분 읽기큐레이션 요약

슬랙의 이상 이벤트 대응 체

Slack은 탐지에 그치지 않고 의심스러운 사용자 행동이 발생한 즉시 세션을 종료하는 **Anomaly Event Response(AER)**를 구축했다. AER는 실시간 분석과 자동 대응을 결합해 침해 탐지부터 대응까지의 시간을 며칠 또는 몇 시간에서 수분으로 줄이고, 데이터 유출이나 공격 체인의 진행을 조기에 차단한다. Enterprise Grid 고객은 별도 보안 도구나 인력 없이 기본 기능으로 사용할 수 있으며, 필요하면 기존 보안 시스템과 함께 운영할 수 있다. ## 탐지와 대응 사이의 공백 - Slack은 매주 수천만 명이 사용하고 매일 수십억 건의 상호작용이 발생하는 협업 플랫폼이다. - Enterprise 고객에게는 사용자의 플랫폼 활동을 기록하는 감사 로그를 제공한다. - `anomaly` 감사 로그는 다음과 같은 비정상 행위를 고급 분석으로 식별한다. - 비정상적인 로그인 - 악성 코드 업로드 - 예상치 못한 데이터 전송 - 기타 워크스페이스별 이상 활동 - 기존 감사 로그는 위협을 알려주는 조기 경보 역할을 하지만, 실제 대응을 위해서는 보안 담당자의 검토나 제3자 보안 솔루션 연동이 필요하다. - AER는 이 탐지-대응 간극을 자동화해, 고객이 이상 징후를 확인하기 전에 관련 사용자 세션을 종료한다. ## AER의 설계 철학 AER는 모든 유형의 위협을 다루기보다 여러 조직에서 공통적으로 발생할 가능성이 높은 이상 행위에 우선순위를 두었다. - Tor 출구 노드를 통한 Slack 접속 - 데이터 유출을 암시할 수 있는 과도한 다운로드 - Slack 기본 기능이 아닌 자동화 도구를 이용한 데이터 스크래핑 - 세션 지문(session fingerprint) 불일치 - 비정상적인 API 호출량 또는 호출 패턴 - 표준적이지 않거나 가상 환경을 나타내는 예상 밖의 사용자 에이전트 조직마다 정상적인 사용 패턴과 위험 수준이 다르므로, 고객은 탐지 유형별로 대응 방식을 선택할 수 있다. - 특정 이상 이벤트가 발생하면 사용자 세션을 종료 - 이벤트는 기록하되 자동 대응은 하지 않음 - 알림 수신 여부와 수신 대상 설정 - 조직 기본 소유자 - 보안 관리자 - 이메일 및 Slack 알림 설정은 **Tools and Settings → Organization settings → Security → Security Settings → Anomaly Event Response Settings**에서 변경한다. ## AER의 전체 아키텍처 AER는 실시간 탐지, 비동기 작업 처리, 알림 전달을 분리한 다중 계층 구조로 설계됐다. - **탐지 엔진** - Slack에서 발생하는 하루 수십억 건의 이벤트를 감시한다. - 규칙 기반 휴리스틱과 동적 임계값을 함께 사용한다. - **의사결정 프레임워크** - 의심스러운 행동이 감지될 때 생성된 감사 이벤트의 페이로드를 검증한다. - 해당 이벤트가 지원 대상 이상 유형인지, 고객 설정상 자동 대응해야 하는지 판단한다. - **응답 오케스트레이터** - 조건을 충족한 사용자 세션을 종료한다. - 대응 결과를 감사 로그에 남긴다. - 고객이 설정한 경우 조직 담당자에게 알림을 보낸다. 전체 흐름은 다음과 같다. 1. 의심스러운 사용자 활동 발생 2. 활동 분석 3. 이상 이벤트 생성 4. AER 컨트롤러가 지원 대상 여부와 대응 조건 확인 5. 조건 충족 시 사용자 세션 종료 6. 항상 감사 로그 기록 7. 설정된 경우 고객에게 알림 ## 조직별 기준을 적용하는 탐지 엔진 - 동일한 활동이라도 조직의 업무 특성에 따라 정상 또는 비정상일 수 있다. - 예를 들어 한 조직에서 대량 다운로드가 일상적이라면, 고정된 전역 기준을 적용할 경우 오탐이 많이 발생할 수 있다. - AER는 각 Enterprise 조직의 과거 사용 데이터를 기반으로 임계값을 계산한다. - 조직별 기준선을 사용하면 다음 효과가 있다. - 오탐 감소 - 탐지 민감도 조정 - 탐지 효과의 지속적인 검증과 개선 - 즉, 단순히 “특정 횟수 이상이면 공격”으로 판단하지 않고, 각 조직의 평소 사용 패턴에서 벗어났는지를 기준으로 판단한다. ## 자동 세션 종료를 통한 즉각 대응 - 이상 행위가 높은 신뢰도로 식별되면 관련 사용자 세션을 자동으로 종료한다. - 이를 통해 공격자가 계정을 계속 사용하거나 데이터를 추가로 추출하는 시간을 줄인다. - 기존의 사후 대응처럼 피해 규모를 조사한 뒤 조치하는 대신, 공격 체인이 완전히 실행되기 전에 개입한다. - 자동 대응 결과는 감사 로그에 남아 사후 조사와 보안 검토에 활용된다. - 고객은 조직의 위험 허용 수준에 따라 특정 탐지 항목만 세션 종료 대상으로 지정할 수 있다. ## 고객 보안 체계와의 역할 분담 - Slack은 플랫폼 자체의 탐지와 기본 대응 기능을 제공한다. - 고객은 감사 로그와 AER 설정을 활용해 조직별 보안 정책을 구성할 수 있다. - 보안 역량과 인력이 제한적인 고객은 AER를 별도 연동 없이 사용할 수 있다. - 고급 보안 조직은 AER를 SIEM, SOAR 또는 자체 탐지 체계와 결합해 더 세밀한 대응 정책을 추가할 수 있다. - 이는 Slack과 고객이 함께 보안을 책임지는 **공동 책임(shared responsibility)** 모델에 해당한다. 조직별 정상 패턴을 반영할 수 있는 자동 탐지와 즉시 세션 종료를 결합한 AER는, 감사 로그를 사람이 확인한 뒤 대응하는 방식보다 빠르고 실용적이다. 다만 자동 종료는 업무 중단을 일으킬 수 있으므로 처음에는 이벤트를 기록만 하며 오탐을 검증한 뒤, 위험도가 높은 탐지부터 단계적으로 자동 대응을 활성화하는 것이 바람직하다.

원문 읽기(새 탭에서 열림)
datadog원문

AI 기반 알림을 위한 UX 재고찰 (새 탭에서 열림)

이 글은 인프라의 변화에 발맞춰 알러팅(Alerting) UX가 정적 임계값 기반에서 고도화된 통계 및 알고리즘 기반으로 진화하고 있음을 설명합니다. 저자는 기존 알러트 시스템의 수동적 한계를 지적하며, 예측, 이상 징후 탐지, 자동화된 피드(Feed) 형식이 어떻게 운영 효율성을 높이는지 분석합니다. 결론적으로 미래의 모니터링은 사용자가 일일이 설정하지 않아도 시스템이 스스로 문제를 찾아내고 학습하는 방향으로 나아갈 것이라고 주장합니다. ### 기존 알러트 UX의 구성과 한계 * **4가지 핵심 차원:** 현재의 알러트는 감시 대상(Scope), 측정 지표(Metric), 임계값(Threshold), 지속 시간(Time)이라는 네 가지 요소로 정의됩니다. * **정적 임계값의 경직성:** 데이터독(Datadog) 알러트의 상당수가 정적 임계값을 사용하지만, 이는 시스템의 성장이나 일시적인 이벤트(예: 쇼핑 시즌) 등 변화하는 환경에 적응하지 못해 지속적인 수동 업데이트가 필요합니다. * **경고(Warning) 임계값의 피로도:** 심각(Critical) 단계 전의 경고 알러트는 대개 시간을 벌기 위한 임시방편으로 활용되나, 이는 수많은 오탐(False Positive)과 알람 피로도를 유발하는 원인이 됩니다. * **수동 설정의 한계:** 감시해야 할 대상을 사용자가 미리 정의해야 하는 '옵트인(Opt-in)' 방식은 인프라가 복잡해질수록 관리의 중복과 누락을 발생시킵니다. ### 알고리즘 기반 알러팅의 세 가지 유형 * **예측(Forecasting):** 과거 데이터를 분석해 특정 임계값에 도달할 시점을 미리 계산합니다. 예를 들어 "현재 디스크 잔량이 0인가?"가 아닌 "24시간 내에 0이 될 것인가?"를 판단하여 대응 시간을 확보해 주며, 불필요한 경고 임계값 설정을 없애줍니다. * **이상 징후 탐지(Anomaly Detection):** 과거의 행동 패턴과 계절성(일간/주간 트렌드)을 고려해 '정상 범위'를 설정하고, 여기서 벗어나는 편차를 감지합니다. * **이상점 탐지(Outlier Detection):** 과거 데이터 없이 동일한 역할을 하는 그룹(예: 로드밸런서 아래의 웹 서버들) 내에서 다른 개체들과 다르게 행동하는 특정 대상을 실시간으로 찾아냅니다. ### 알고리즘 피드와 모니터링의 미래 * **사전 설정 없는 감시:** 알고리즘 피드는 사용자가 감시 대상을 일일이 지정하지 않아도 시스템이 스스로 전체 인프라를 훑으며 특이 사항을 발견하여 사용자에게 제시합니다. * **알러트에서 피드로의 전환:** 소셜 미디어의 타임라인처럼 데이터독의 'Watchdog' 같은 서비스는 예측 불가능한 이슈를 먼저 찾아내어 보여주는 방식으로 UX의 대전환을 꾀하고 있습니다. * **지도 학습형 피드(Supervised Feeds):** 생성된 이벤트 피드에 대해 사용자가 '좋아요'나 피드백을 주어 시스템을 학습시킴으로써, 개별 사용자나 팀에 가장 가치 있는 정보만 상단에 노출되도록 최적화할 수 있습니다. 실무적으로는 단순히 수치 기반의 알러트를 늘리기보다, **예측(Forecasting)**을 통해 디스크 잔량 같은 자원 고갈 문제를 해결하고 **이상 징후 탐지**를 통해 복잡한 트렌드 변화를 자동 감시하는 방향으로 전환할 것을 추천합니다. 이는 알람 피로도를 줄이고 더 중요한 인프라 전략에 집중할 수 있는 환경을 만들어 줄 것입니다.

datadog원문

머신러닝을 위한 강건한 통계적 거리 측정법 (새 탭에서 열림)

통계적 거리(Statistical Distance)는 두 데이터 분포 간의 유사성을 정량화하는 도구로, 이상 탐지 및 머신러닝 모델의 성능 평가에서 핵심적인 역할을 합니다. 이 글은 Kolmogorov-Smirnov, Earth Mover's Distance, Cramér-von Mises 거리의 정의와 작동 방식을 비교하며, 데이터의 특성에 따라 적절한 거리 측정법을 선택해야 한다고 강조합니다. 단순히 통계적 가설을 검정하는 것을 넘어 분포 간의 물리적·수학적 거리를 측정함으로써 데이터 세트 간의 미묘한 차이를 효과적으로 포착할 수 있습니다. **시각적 분석과 Q-Q 플롯을 통한 분포 비교** * 히스토그램을 통해 데이터의 평균, 분산, 최소/최대값 등 경험적 분포의 특징을 직관적으로 파악할 수 있습니다. * Q-Q(Quantile-Quantile) 플롯은 두 데이터를 정렬하여 서로 대응시킨 뒤 평면에 표시하는 방식으로, 점들이 직선에 가까울수록 두 분포가 유사함을 의미합니다. * 시각적 분석은 훌륭한 휴리스틱(Heuristic) 도구이지만, 정밀한 비교를 위해서는 정량적인 '거리' 개념이 필요합니다. **국소적 변화에 민감한 Kolmogorov-Smirnov(KS) 거리** * 두 데이터 세트의 경험적 누적 분포 함수(CDF) 사이에서 발생하는 '최대 절대 편차'를 거리로 정의합니다. * 값이 0과 1 사이로 제한되어 있어, 두 분포가 이미 충분히 멀리 떨어져 있는 경우에는 평균 차이가 더 벌어져도 거리 값이 크게 변하지 않는 한계가 있습니다. * 거리의 4대 공리(비음수성, 동일성, 대칭성, 삼각 부등식)를 만족하는 엄밀한 메트릭(Metric)입니다. * 분포의 전체적인 이동보다는 특정 지점에서의 급격한 차이(국소적 변형)에 매우 민감하게 반응합니다. **데이터의 이동량을 측정하는 Earth Mover's Distance(EMD)** * 제1 와서스타인(Wasserstein) 거리로도 알려져 있으며, 하나의 분포를 다른 분포로 옮기기 위해 필요한 최소 작업량(데이터의 양 × 이동 거리)으로 정의됩니다. * 시각적으로는 두 CDF 곡선 사이의 전체 면적과 같으며, 데이터의 꼬리(tail) 부분에 있는 정보까지 효과적으로 반영합니다. * KS 거리와 달리 값의 범위에 제한이 없으므로, 두 분포의 평균이 멀어질수록 거리가 선형적으로 증가하여 차이를 명확히 드러냅니다. **균형 잡힌 지표로서의 Cramér-von Mises(CM) 거리** * 두 CDF 간 차이의 제곱을 합산(적분)하여 계산하며, EMD가 L1 노름(Norm)과 유사하다면 CM은 L2 노름과 유사한 성격을 가집니다. * 두 분포의 평균이 멀어질 때 거리가 제곱근 함수 형태로 증가하여, KS와 EMD 사이의 중간적인 특성을 보입니다. * 국소적 변형을 감지하는 능력(KS의 장점)과 전체적인 분포 흐름을 반영하는 능력(EMD의 장점) 사이에서 적절한 절충안을 제공합니다. **실무적 권장 사항** 분포의 미세한 국소 변형이나 특정 구간의 이탈을 감지해야 하는 이상 탐지 작업에는 **KS 거리**가 유리합니다. 반면, 분포가 전반적으로 얼마나 이동했는지 또는 데이터의 꼬리 영역이 얼마나 다른지 파악해야 한다면 **EMD**가 더 적합합니다. **CM 거리**는 국소적 변화에 너무 예민하지 않으면서도 전반적인 차이를 측정하고 싶을 때 유용한 대안이 됩니다.