서버리스

25 개의 포스트

aws원문

AWS Lambda Durable Functions를 사용하여 다단계 (새 탭에서 열림)

AWS Lambda Durable Functions의 출시로 개발자들은 별도의 상태 관리 인프라를 구축하지 않고도 복잡한 다단계 애플리케이션과 AI 워크플로우를 익숙한 Lambda 환경에서 구현할 수 있게 되었습니다. 이 기능은 '체크포인트 및 재실행(Checkpoint and Replay)' 메커니즘을 통해 실행 상태를 자동으로 추적하며, 실행 도중 실패가 발생하더라도 마지막 완료 지점부터 작업을 재개합니다. 특히 대기 상태에서는 컴퓨팅 비용이 발생하지 않으면서도 최대 1년까지 실행을 일시 중단할 수 있어, 결제 처리나 사용자 승인이 필요한 장기 프로세스에 최적화된 솔루션을 제공합니다. ### 지속성 실행(Durable Execution)의 핵심 메커니즘 * **체크포인트 및 재실행:** Durable execution SDK를 사용하면 함수가 실행될 때마다 진행 상황이 자동으로 기록됩니다. 예기치 않은 오류로 실행이 중단되더라도 Lambda는 처음부터 핸들러를 다시 실행하되, 이미 완료된 단계는 스킵하고 마지막 체크포인트부터 비즈니스 로직을 이어갑니다. * **비용 효율적인 대기:** 실행 중 특정 지점에서 실행을 일시 중단하면 컴퓨팅 자원 할당이 해제되어 유휴 비용이 발생하지 않습니다. 이후 정의된 조건이 충족되면 자동으로 실행이 재개됩니다. ### 워크플로우 제어를 위한 주요 프리미티브(Primitives) * **context.step():** 비즈니스 로직에 자동 재시도 및 체크포인트 기능을 추가합니다. 해당 단계가 성공적으로 완료되면 이후 재실행 시 다시 수행되지 않도록 보장합니다. * **context.wait():** 지정된 기간 동안 함수의 실행을 중단합니다. 최대 1년까지 대기가 가능하며, 대기 기간 동안에는 비용이 청구되지 않습니다. * **create_callback():** 외부 API 응답이나 사람의 직접적인 승인과 같은 외부 이벤트를 기다릴 수 있는 콜백을 생성합니다. * **wait_for_condition():** REST API 폴링 등을 통해 특정 조건이 충족될 때까지 실행을 일시 정지합니다. * **parallel() 및 map():** 복잡한 병렬 처리 및 동시성 유스케이스를 지원하여 효율적인 리소스 활용을 돕습니다. ### 서비스 도입 시 고려사항 * **설정 방식:** Durable Functions 기능은 Lambda 함수를 처음 생성하는 단계에서만 활성화할 수 있으며, 기존에 이미 생성된 함수에는 소급 적용이 불가능합니다. * **개발 환경:** 함수 생성 시 'Durable execution' 옵션을 활성화한 후, 코드 내에 오픈 소스로 제공되는 Durable Execution SDK를 포함하여 비즈니스 로직을 작성해야 합니다. * **활용 사례:** 주문 처리 프로세스, AI 에이전트의 다단계 추론 오케스트레이션, 인적 승인이 필요한 결재 시스템 등 상태 유지가 필수적인 워크로드에 강력한 이점을 제공합니다. AWS Lambda Durable Functions는 Step Functions와 같은 외부 오케스트레이션 도구 없이도 코드 수준에서 상태ful한 워크플로우를 관리할 수 있게 해줍니다. 단순한 이벤트 처리를 넘어 긴 호흡의 비즈니스 로직을 관리해야 하는 백엔드 개발자나 AI 엔지니어에게 매우 실용적인 도구가 될 것입니다.

aws원문

AWS 데이터베이스용 Database Savings Plans를 (새 탭에서 열림)

AWS는 관리형 데이터베이스 서비스의 비용을 최대 35%까지 절감할 수 있는 새로운 요금 모델인 'Database Savings Plans'를 출시했습니다. 사용자는 1년 동안 일정 금액의 시간당 지출($/hour)을 약정함으로써, 특정 리전이나 엔진에 국한되지 않고 다양한 데이터베이스 리소스에 대해 자동적인 할인 혜택을 받을 수 있습니다. 이 플랜은 클라우드 현대화나 글로벌 확장 과정에서 데이터베이스 환경이 변하더라도 유연하게 비용 최적화를 유지할 수 있도록 설계되었습니다. **Database Savings Plans의 핵심 가치와 유연성** * **시간당 약정 모델:** 1년 기간 동안 일정액의 시간당 사용량을 약정하며, 약정 금액을 초과하는 사용분은 일반 온디맨드 요금으로 청구됩니다. * **광범위한 유연성:** 특정 리전, 인스턴스 제품군, 크기에 얽매이지 않고 지원되는 모든 데이터베이스 서비스에 할인이 자동 적용됩니다. * **현대화 지원:** 프로비저닝 방식에서 서버리스로 전환하거나, 데이터베이스 엔진을 변경(예: 상용 DB에서 오픈소스 기반 Aurora로 전환)하더라도 할인 혜택이 중단 없이 유지됩니다. **서비스별 지원 범위 및 할인율 상세** * **지원 서비스:** Amazon Aurora, RDS, DynamoDB, ElastiCache, DocumentDB, Neptune, Keyspaces, Timestream, AWS DMS 등 주요 관리형 데이터베이스를 모두 포함합니다. * **배포 모델별 혜택:** 서버리스 배포의 경우 온디맨드 대비 최대 35%, 프로비저닝된 인스턴스는 최대 20%의 할인율이 적용됩니다. * **처리량 기반 할인:** DynamoDB 및 Keyspaces의 온디맨드 처리량은 최대 18%, 프로비저닝된 용량은 최대 12%의 비용 절감이 가능합니다. **구매 및 운영 관리** * **통합 관리:** AWS Billing 및 비용 관리 콘솔을 통해 구매 프로세스를 진행할 수 있으며, 기존의 비용 관리 도구로 활용률(Utilization)과 커버리지를 분석할 수 있습니다. * **자동 업데이트:** 향후 새로운 데이터베이스 엔진, 인스턴스 유형 또는 신규 리전이 출시될 경우에도 별도의 조치 없이 Savings Plans 혜택이 자동으로 확장 적용됩니다. **실용적인 권장 사항** 1년 이상의 장기적인 워크로드를 운영하거나, 마이크로서비스 아키텍처 도입으로 인해 여러 종류의 데이터베이스를 혼용하는 기업에게 매우 유리합니다. 특히 서버리스로의 전환이나 리전 확장을 계획 중이라면, 기존의 예약 인스턴스(RI)보다 훨씬 유연한 이 플랜을 통해 관리 부담을 줄이면서 비용 효율을 극대화할 수 있습니다.

aws원문

확장성과 성능이 향상 (새 탭에서 열림)

Amazon S3 Vectors가 정식 출시(GA)되어 클라우드 객체 스토리지에서 기본적으로 벡터 데이터를 저장하고 검색할 수 있는 길이 열렸습니다. 기존 전용 벡터 데이터베이스 대비 비용을 최대 90% 절감할 수 있으며, 서버리스 아키텍처를 통해 인프라 관리 부담 없이 대규모 AI 애플리케이션을 구축할 수 있습니다. 이번 정식 버전은 프리뷰 대비 확장성과 성능이 대폭 강화되어, 대규모 RAG(검색 증강 생성) 및 AI 에이전트 워크로드를 안정적으로 지원합니다. **비약적인 확장성 및 성능 향상** * **인덱스 규모 확장:** 단일 인덱스에서 최대 20억 개의 벡터를 지원하며, 벡터 버킷당 총 20조 개의 벡터를 저장할 수 있어 프리뷰 대비 확장성이 40배 향상되었습니다. * **검색 속도 최적화:** 빈번한 쿼리의 경우 응답 속도를 100ms 이하로 단축했으며, 간헐적인 쿼리도 1초 미만의 지연 시간을 유지하여 실시간 대화형 AI에 적합합니다. * **검색 결과 확대:** 쿼리당 반환 가능한 검색 결과 수를 기존 30개에서 100개로 늘려 RAG 애플리케이션에 더 풍부한 컨텍스트를 제공합니다. * **쓰기 처리량 강화:** 초당 최대 1,000건의 PUT 트랜잭션을 지원하여 실시간 데이터 스트리밍 및 대량의 동시 쓰기 작업을 원활하게 처리합니다. **서버리스 아키텍처를 통한 운영 및 비용 효율화** * **완전 관리형 서비스:** 별도의 인프라 설정이나 프로비저닝이 필요 없는 서버리스 구조로, 사용한 만큼만 비용을 지불하는 종량제 모델을 채택했습니다. * **비용 절감:** 전용 벡터 데이터베이스 솔루션과 비교했을 때 벡터 저장 및 쿼리 비용을 최대 90%까지 낮출 수 있어 경제적입니다. * **개발 수명 주기 지원:** 초기 프로토타이핑부터 대규모 프로덕션 배포까지 동일한 스토리지 환경에서 유연하게 대응할 수 있습니다. **에코시스템 통합 및 가용성 확대** * **Amazon Bedrock 연동:** Amazon Bedrock 지식 기반(Knowledge Base)의 벡터 스토리지 엔진으로 정식 지원되어 고성능 RAG 어플리케이션 구축이 용이해졌습니다. * **Amazon OpenSearch 통합:** S3 Vectors를 스토리지 계층으로 사용하면서 OpenSearch의 강력한 검색 및 분석 기능을 결합하여 사용할 수 있습니다. * **지역 확장:** 프리뷰 당시 5개였던 지원 리전을 서울을 포함한 전 세계 14개 AWS 리전으로 확대하여 접근성을 높였습니다. 전용 벡터 DB 도입에 따른 비용과 운영 복잡성이 부담스러웠던 기업이라면, S3의 높은 가용성과 보안을 그대로 누리면서 대규모 벡터 검색을 구현할 수 있는 S3 Vectors 도입을 적극 검토해 보시기 바랍니다. 특히 Amazon Bedrock과의 유연한 통합을 통해 생산성 높은 AI 서비스를 빠르게 시장에 출시할 수 있습니다.

aws원문

Amazon Bedrock, 새로운 (새 탭에서 열림)

Amazon Bedrock이 Mistral Large 3와 Ministral 3를 포함한 18개의 새로운 오픈 웨이트(Open weight) 모델을 추가하며, 총 100여 개의 서버리스 모델 라인업을 구축하게 되었습니다. 개발자들은 인프라를 변경하거나 코드를 재작성할 필요 없이 단일 API를 통해 구글, 엔비디아, 오픈AI 등 선도적인 AI 기업들의 최신 모델을 자유롭게 선택하고 평가할 수 있습니다. 이번 확장을 통해 기업들은 비용 효율성과 성능 사이의 최적점을 찾아 비즈니스 특성에 맞는 생성형 AI 애플리케이션을 더욱 신속하게 구축할 수 있는 환경을 갖추게 되었습니다. **Mistral AI의 최신 모델 라인업** * **Mistral Large 3**: 긴 문맥(Long-context) 이해와 멀티모달 추론, 코딩 능력에 최적화된 모델로, 복잡한 엔터프라이즈 지식 작업과 에이전트 워크플로우에 강력한 성능을 발휘합니다. * **Ministral 3 3B**: 에지(Edge) 환경에 최적화된 소형 모델로, 단일 GPU에서 효율적으로 구동되며 실시간 번역, 데이터 추출, 이미지 캡셔닝 등 저지연 애플리케이션에 적합합니다. * **Ministral 3 8B/14B**: 텍스트와 시각 정보 처리에 있어 동급 최강의 성능을 제공하며, 하드웨어 제약이 있는 온디바이스 환경이나 프라이빗 AI 배포 시 고급 에이전트 기능을 구현하는 데 사용됩니다. **다양한 산업군을 위한 오픈 웨이트 모델 확장** * **Google Gemma 3 4B**: 노트북이나 모바일 기기에서 로컬로 실행할 수 있는 효율적인 다국어 모델로, 개인화된 온디바이스 AI 경험을 제공하는 데 유리합니다. * **광범위한 파트너십**: 구글, MiniMax AI, Moonshot AI, NVIDIA, OpenAI, Qwen 등의 최신 모델이 포함되어, 특정 언어나 산업 도메인에 특화된 선택지가 대폭 늘어났습니다. * **서버리스 및 통합 관리**: 모든 모델은 AWS가 완전히 관리하는 서버리스 방식으로 제공되므로, 사용자들은 별도의 GPU 서버 관리 부담 없이 API 호출만으로 최첨단 모델을 즉시 활용할 수 있습니다. **Bedrock 플랫폼의 유연성과 편의성** * **통합 API 아키텍처**: 서로 다른 제조사의 모델이라도 동일한 API 구조를 사용하므로, 성능 평가 결과에 따라 애플리케이션의 모델을 손쉽게 교체하거나 업그레이드할 수 있습니다. * **지속적인 큐레이션**: AWS는 고객의 요구사항과 기술적 발전을 모니터링하여 유망한 신규 모델과 검증된 업계 표준 모델을 지속적으로 업데이트하고 있습니다. 개발자는 Amazon Bedrock의 통합 인터페이스를 활용해 각 모델의 벤치마크와 비용 효율성을 비교 분석한 후, 서비스 규모와 하드웨어 환경(에지 컴퓨팅 vs 클라우드)에 가장 적합한 모델을 선별하여 도입하는 전략이 필요합니다. 특히 Ministral 시리즈와 같은 에지 최적화 모델은 클라우드 비용 절감과 데이터 보안이 중요한 프로젝트에서 훌륭한 대안이 될 것입니다.

airbnb원문

Viaduct, 5년 후: (새 탭에서 열림)

에어비앤비는 자사의 데이터 중심 서비스 메시인 'Viaduct'의 5년간의 운영 성과를 공유하며, 이를 오픈소스로 공개하고 차세대 아키텍처인 'Viaduct Modern'으로의 전환을 발표했습니다. Viaduct는 중앙 집중식 스키마와 서버리스 비즈니스 로직 호스팅, 재진입(Re-entrancy) 구조를 통해 트래픽이 8배 성장하는 과정에서도 운영 효율성과 비용 선형성을 유지해 왔습니다. 이번 개편은 파편화되었던 API를 단순화하고 실행 엔진과 비즈니스 로직 사이의 추상화 경계를 강화하여, 거대해진 코드베이스의 유지보수성과 개발 생산성을 높이는 데 중점을 두었습니다. ### Viaduct의 핵심 설계 원칙 * **중앙 스키마(Central Schema):** 전사의 모든 도메인을 하나의 통합된 그래프로 연결합니다. 개발은 팀별로 분산되어 진행되지만, 사용자는 단일한 접점을 통해 모든 데이터와 기능에 접근할 수 있어 내부 요청의 75%가 Viaduct 내에서 처리됩니다. * **호스팅된 비즈니스 로직(Hosted Business Logic):** GraphQL 서버를 단순한 게이트웨이로 사용하는 대신, 비즈니스 로직을 직접 실행하는 서버리스 플랫폼으로 운영합니다. 이를 통해 개별 마이크로서비스 운영 부담을 줄이고 개발자가 로직에만 집중할 수 있는 환경을 제공합니다. * **재진입성(Re-entrancy):** Viaduct에 호스팅된 로직이 다른 로직을 호출할 때 GraphQL 프래그먼트와 쿼리를 사용하도록 설계되었습니다. 이는 대규모 코드베이스에서 직접적인 코드 의존성을 방지하고 모듈성을 유지하는 핵심 장치입니다. ### Viaduct Modern의 API 단순화 * **Tenant API의 통합:** 과거에는 기능 구현 방식이 복잡하고 파편화되어 있었으나, 이를 '노드 리졸버(Node Resolver)'와 '필드 리졸버(Field Resolver)' 두 가지 메커니즘으로 대폭 통합하여 개발자 경험을 개선했습니다. * **결정 트리 제거:** 구현 방식을 고민해야 했던 복잡한 결정 과정을 없애고, 스키마 자체의 정의에 따라 리졸버 유형이 자연스럽게 결정되도록 설계하여 학습 곡선을 낮췄습니다. ### 테넌트 모듈성과 협업 구조 * **테넌트 모듈(Tenant Module):** 스키마와 구현 코드를 팀별 소유권 단위로 묶어 관리합니다. 팀 간의 직접적인 코드 참조는 지양하고 GraphQL 인터페이스를 통해서만 소통합니다. * **선언적 데이터 의존성:** 예를 들어 '메시징 팀'이 '사용자 팀'의 타입에 새로운 필드를 추가할 때, `@Resolver` 어노테이션에 필요한 데이터 필드(예: 성, 이름)를 선언하기만 하면 됩니다. * **코드 의존성 해소:** 데이터 수요를 선언적으로 명시함으로써, 다른 팀의 내부 로직이나 데이터 소스가 무엇인지 알 필요 없이 독립적으로 기능을 확장할 수 있습니다. ### 프레임워크 계층화 및 유지보수성 * **강력한 추상화 경계:** GraphQL 실행 엔진, 테넌트 API, 애플리케이션 코드 사이의 인터페이스를 명확히 분리했습니다. 과거의 느슨했던 경계를 강화하여 서비스 로직의 중단 없이 엔진 성능을 개선하거나 라이브러리를 업데이트할 수 있는 구조를 갖췄습니다. * **운영 안정성:** 이러한 구조적 개선을 통해 개발자 수와 코드 라인 수가 급격히 증가함에도 불구하고 장애 시간을 절반으로 줄이는 성과를 거두었습니다. Viaduct는 대규모 조직에서 데이터 접근 방식을 통합하고 비즈니스 로직을 효율적으로 관리하려는 팀에게 강력한 모델을 제시합니다. 특히 마이크로서비스의 복잡도를 낮추고 싶은 조직이라면, Viaduct의 재진입 구조와 서버리스 호스팅 개념을 도입하여 개발 민첩성과 시스템 안정성을 동시에 확보하는 방향을 고려해 볼 만합니다.

datadog원문

밀리초 하나하나까지 단축하기: Datadog Lambda Extension을 Rust로 재구축한 방법 (새 탭에서 열림)

Datadog은 기존 Go 기반의 AWS Lambda 확장이 가진 높은 오버헤드를 해결하기 위해, 이를 Rust 언어로 완전히 재작성한 'Project Bottlecap'을 진행했습니다. 이를 통해 콜드 스타트 시간을 82% 단축하고 메모리 사용량을 40% 절감했으며, 바이너리 크기를 55MB에서 7MB로 줄이는 획기적인 성능 개선을 달성했습니다. 결과적으로 리소스가 제한된 서버리스 환경에서도 사용자 애플리케이션에 영향을 주지 않고 고정밀 텔레메트리 데이터를 수집할 수 있게 되었습니다. ### 기존 범용 에이전트 기반 설계의 한계 - 초기 Datadog Lambda 확장은 다중 호스트나 클러스터 환경에 최적화된 기존 Datadog 에이전트 코드를 기반으로 구축되었습니다. - 범용 에이전트는 대규모 처리량과 캐싱, 버퍼링에 초점이 맞춰져 있어 리소스가 극도로 제한된 람다의 단기 실행 환경에는 부적합했습니다. - 종속성 제거, 바이너리 압축(UPX), 지연 로딩 등 모든 최적화 수단을 동원했음에도 불구하고 콜드 스타트 지연 시간이 450~500ms 이하로 내려가지 않는 성능 한계에 직면했습니다. - 결국 범용 도구와 서버리스 전용 도구의 스케일 차이를 인정하고, 밑바닥부터 다시 작성하는 결정을 내렸습니다. ### Lambda 환경에서 Rust 언어의 전략적 이점 - **안정성 및 메모리 안전성:** 람다 확장이 충돌하면 함수 전체가 종료되고 샌드박스가 초기화되어 다시 콜드 스타트가 발생하는데, Rust는 컴파일 타임에 메모리 안전성을 보장하여 이러한 위험을 최소화합니다. - **바이너리 경량화:** 가비지 컬렉터와 대규모 런타임이 포함된 Go와 달리, Rust는 킬로바이트 또는 낮은 메가바이트 단위의 매우 작은 바이너리를 생성하여 초기 로딩 시간을 줄입니다. - **제한된 환경의 이점:** 람다는 아마존 리눅스와 x86/Arm 아키텍처라는 고정된 환경만 고려하면 되므로, 다양한 환경을 지원해야 하는 시스템 프로그래밍에서 Rust가 가질 수 있는 복잡성 문제가 크게 완화되었습니다. ### Project Bottlecap의 핵심 설계 원칙 - **철저한 성능 오버헤드 통제:** 모든 풀 리퀘스트(PR)마다 벤치마크를 수행하여 성능 저하를 감시했으며, 성능 향상을 위해 공식 AWS SDK 사용을 포기하고 직접 AWS API 호출과 서명 로직을 작성하는 트레이드오프를 감수했습니다. - **핸들러 영향 최소화:** 람다 확장 API를 활용하여 함수 핸들러가 결과를 반환한 후에 텔레메트리를 처리함으로써, 사용자 API 응답 속도에 미치는 영향을 제거했습니다. - **다양한 플러시(Flush) 전략:** 리소스 사용량이 적은 API 함수부터 대규모 배치 작업까지 대응할 수 있도록 데이터 전송 시점을 유연하게 설정할 수 있는 구조를 갖추었습니다. 범용 소프트웨어를 특정 환경에 맞춰 최적화하는 것에는 한계가 있습니다. 특히 실행 시간과 리소스 사용량이 곧 비용과 직결되는 서버리스 환경에서는, 해당 환경의 제약 조건을 반영한 전용 도구를 구축하는 것이 초기 개발 비용이 높더라도 장기적으로 성능과 안정성 측면에서 압도적인 이점을 제공합니다.

datadog3분 읽기큐레이션 요약

밀리초 단위까지 아끼

제공된 내용에는 본문이 아니라 Datadog 웹사이트의 제품 메뉴와 “Gartner® Observability Platforms Magic Quadrant™에서 Leader로 선정”되었다는 홍보 문구가 대부분 포함되어 있습니다. 따라서 Datadog Lambda Extension을 Rust로 구현한 기술적 배경이나 설계·성능 관련 결론은 확인할 수 없습니다. 현재 확인 가능한 범위에서는 Datadog이 인프라부터 애플리케이션, 로그, 보안, 사용자 경험, 소프트웨어 공급망, AI까지 통합 관측성 플랫폼으로 제공한다는 점이 중심입니다. ### Gartner 관측성 플랫폼 리더 선정 - Datadog은 Gartner의 Observability Platforms Magic Quadrant에서 Leader로 선정되었다고 소개합니다. - 이는 인프라 모니터링, 애플리케이션 성능 모니터링(APM), 로그 관리 등 여러 관측성 기능을 하나의 플랫폼에서 제공한다는 맥락으로 제시됩니다. - 다만 Gartner 평가의 세부 기준이나 Datadog의 강점·약점에 대한 본문 내용은 제공된 자료에 포함되어 있지 않습니다. ### 인프라 및 애플리케이션 모니터링 - 인프라 영역에는 다음 기능이 포함됩니다. - 메트릭 및 인프라 모니터링 - 컨테이너와 Kubernetes 오토스케일링 - 네트워크, 서버리스, GPU, 스토리지 모니터링 - 클라우드 비용 관리 - 애플리케이션 영역에는 다음 기능이 제공됩니다. - APM과 서비스 모니터링 - 연속 프로파일링 및 동적 계측 - 에이전트 관측성 ### 로그·데이터 관측성 - 로그 관리와 민감 데이터 탐지 기능을 제공합니다. - 데이터베이스, 데이터 스트림, 데이터 품질, 작업 실행 상태를 관찰할 수 있습니다. - Observability Pipelines를 통해 로그와 관측 데이터를 수집·처리하는 기능도 포함됩니다. ### 보안과 사용자 경험 - 코드 보안, SAST, IAST, 소프트웨어 구성 분석, IaC 보안 등 개발 단계의 보안 기능을 제공합니다. - 클라우드 보안, 취약점 관리, Cloud SIEM, 워크로드 보호, 애플리케이션·API 보호 기능도 포함됩니다. - 브라우저·모바일 RUM, 세션 리플레이, 합성 모니터링, 오류 추적을 통해 실제 사용자 경험을 분석할 수 있습니다. ### 소프트웨어 전달과 서비스 관리 - CI Visibility, 테스트 최적화, 지속적 테스트, 코드 커버리지, 기능 플래그 등의 기능이 나열되어 있습니다. - 서비스 카탈로그, SLO, 인시던트 대응, 케이스 관리, 워크플로 자동화 등 운영 관리 기능도 제공합니다. - 이를 통해 개발·배포·운영 과정의 데이터를 하나의 플랫폼에서 연결하려는 방향을 보여줍니다. ### AI 기반 기능 - Datadog은 AI 에이전트 관측성, GPU 모니터링, AI 통합 기능을 별도 영역으로 제공합니다. - Bits AI Agents, Bits Chat, Bits Investigation, Bits Security Analyst, MCP Server 등 AI 기반 조사·자동화 도구가 포함됩니다. - 그러나 제공된 내용만으로는 각 AI 기능의 동작 방식이나 실제 성능을 평가할 수 없습니다. 제공된 자료만으로는 링크된 기술 블로그의 본문을 요약하기 어렵습니다. Rust 기반 Datadog Lambda Extension의 구현 방식이나 성능 개선을 요약하려면 해당 글의 본문 내용이 추가로 필요합니다.

원문 읽기(새 탭에서 열림)
airbnb원문

데이터 지향 서비스 메시를 (새 탭에서 열림)

에어비앤비가 도입한 '바이아덕트(Viaduct)'는 거대해진 마이크로서비스 아키텍처(SOA)의 복잡성을 해결하기 위해 제안된 데이터 지향 서비스 메시입니다. 기존의 서비스 메시가 단순히 서비스 간의 원격 프로시저 호출(RPC)을 라우팅하는 데 집중했다면, 바이아덕트는 GraphQL 스키마를 중심에 두어 데이터 소비자가 하위 서비스의 구조를 몰라도 필요한 데이터를 효율적으로 가져올 수 있게 합니다. 이를 통해 서비스 간 의존성 그래프를 단순화하고 시스템 전반의 모듈성과 데이터 민첩성을 획기적으로 향상시켰습니다. **기존 SOA의 복잡성과 데이터 지향 설계의 필요성** - 마이크로서비스의 수가 수천 개로 늘어나면서 서비스 간 의존 관계가 '스파게티 코드'처럼 얽히는 문제가 발생했습니다. - 현재의 SOA는 1970년대 스타일의 프로시저 지향 설계에 머물러 있어, 각 서비스가 단순한 엔드포인트의 집합으로 취급됩니다. - 에어비앤비는 1980년대 객체 지향 언어들이 데이터를 중심으로 로직을 캡슐화했던 것처럼, SOA도 데이터 중심으로 진화해야 한다고 판단했습니다. **GraphQL 기반의 데이터 지향 서비스 메시, Viaduct** - 바이아덕트는 서비스 메시의 핵심을 데이터 중심의 GraphQL 스키마(Type, Query, Mutation)로 정의합니다. - 데이터 소비자(Consumer)는 특정 서비스의 엔드포인트를 직접 호출하는 대신, 필요한 데이터 필드를 쿼리하기만 하면 됩니다. - 서비스 메시는 어떤 서비스가 특정 데이터 요소를 제공하는지 알고 있으며, 소비자를 대신해 이를 결합(Orchestration)하여 전달함으로써 서비스 간 직접적인 의존성을 제거합니다. **중앙 집중형 스키마를 통한 데이터 민첩성 확보** - 바이아덕트는 단일화된 '중앙 스키마(Central Schema)'를 통해 여러 팀이 협업할 수 있는 구조를 제공합니다. - 데이터베이스 스키마 변경이 여러 계층의 마이크로서비스 API에 수동으로 반영되어야 했던 과거와 달리, 중앙 스키마 업데이트만으로 클라이언트까지 변경 사항을 즉시 전파할 수 있습니다. - 이는 대규모 SOA 환경에서 데이터 구조 변경에 소요되는 수 주간의 조율 과정을 획기적으로 단축합니다. **서버리스 기능을 활용한 서비스 단순화** - 클라이언트 요구에 맞춰 데이터를 가공하는 'BFF(Backend-for-Frontend)'나 상태 없는 변환 서비스들을 서버리스 클라우드 함수로 대체합니다. - 바이아덕트 내에서 '파생 필드(Derived fields)' 계산 로직을 서버리스로 실행함으로써, 복잡한 서비스 계층을 줄이고 그래프 구조를 깔끔하게 유지합니다. - 이를 통해 서비스의 개수와 복잡도를 낮추면서도 클라이언트에게 최적화된 데이터를 제공할 수 있습니다. **기술적 특징 및 관찰 가능성** - 바이아덕트는 `graphql-java`를 기반으로 구축되었으며, 세밀한 필드 선택 기능을 지원합니다. - 시스템 안정성을 위해 서킷 브레이킹(Short-circuiting), 소프트 의존성(Soft dependencies), 요청 내 캐싱(Intra-request cache) 등의 기술을 적용했습니다. - 필드 단위의 데이터 관찰 가능성(Data observability)을 제공하여, 어떤 서비스가 어떤 데이터를 소비하는지 정확하게 파악하고 관리할 수 있습니다. 이처럼 거대해진 마이크로서비스 환경에서 운영 효율을 높이려면, 개별 서비스의 엔드포인트 관리에서 벗어나 데이터 중심의 추상화 계층을 구축하는 것이 중요합니다. 에어비앤비의 사례는 GraphQL을 단순한 API 게이트웨이를 넘어 시스템 전체의 의존성을 관리하는 서비스 메시로 확장함으로써 복잡성을 제어할 수 있음을 보여줍니다.

datadog원문

Datadog 로그 관리로 신뢰도 향상 (새 탭에서 열림)

Datadog은 비밀번호 재설정과 같은 중요 이메일의 전송 신뢰성과 가시성을 확보하기 위해 Amazon SES와 자사의 로그 관리 솔루션을 결합한 서버less 모니터링 시스템을 구축했습니다. 기존 Amazon SES와 CloudWatch만으로는 특정 수신자의 이메일 수신 여부 등을 실시간으로 파악하고 대응하기에 한계가 있었으나, 이 파이프라인을 통해 지원팀이 즉각적으로 문제를 진단할 수 있게 되었습니다. 결과적으로 최소한의 유지보수로 운영 효율성을 높이면서도 전송 프로세스 전반에 대한 높은 수준의 관측성을 확보했습니다. **Amazon SES 이벤트 추출 및 파이프라인 구성** * **이벤트 트리거 설정**: Amazon SES의 'Configuration Sets'를 사용하여 이메일 전송 과정에서 발생하는 bounce, click, complaint, delivery, open, reject, send 등 모든 주요 이벤트를 추적합니다. * **서버리스 아키텍처**: SES에서 발생한 이벤트는 Amazon SNS(Simple Notification Service)로 게시되며, 이는 다시 AWS Lambda 함수를 실행시키는 트리거가 됩니다. * **데이터 전달**: Lambda 함수는 수신된 이메일 이벤트를 Datadog Log Management로 전달합니다. 이 과정에서 Terraform을 사용하여 SNS 토픽 생성, SES 이벤트 대상 지정, IAM 역할 및 Lambda 함수 구성을 코드 기반(IaC)으로 관리합니다. * **안전한 인증**: 프로덕션 환경에서는 Datadog API Key를 암호화하여 보안을 강화할 것을 권장합니다. **Datadog에서의 데이터 가시성 및 인덱싱** * **자동 파싱**: AWS에서 Datadog으로 전송된 로그는 JSON 형식으로 전달되어 Datadog의 기존 통합 파이프라인을 통해 자동으로 처리됩니다. * **패싯(Facet) 활용**: 이메일 이벤트 유형(event type)이나 제목(subject)과 같은 주요 파라미터를 '패싯'으로 변환하여, 지원팀이 특정 이메일 로그를 단 한 번의 클릭으로 쉽게 검색하고 필터링할 수 있게 구성합니다. * **로그 기반 모니터링**: 인덱싱된 데이터를 바탕으로 대시보드를 구성하거나, 특정 이벤트(예: 높은 바운스율) 발생 시 알림을 받을 수 있도록 모니터를 설정할 수 있습니다. **실용적인 결론 및 제언** Amazon SES와 같은 관리형 서비스와 중앙 집중식 로그 분석 도구를 연동하면 이메일 인프라를 직접 운영하는 부담을 줄이면서도 운영 복잡성을 해결할 수 있습니다. 특히 비밀번호 재설정과 같이 성공률이 중요한 서비스의 경우, 단순히 '전송됨' 상태를 확인하는 것을 넘어 전체 파이프라인에 대한 실시간 알림 시스템을 구축하는 것이 고객 지원의 품질을 높이는 핵심적인 방법입니다.

datadog3분 읽기큐레이션 요약

ChatOps로 클라우

Datadog은 Gartner의 2026년 Observability Platforms Magic Quadrant에서 ‘Leader’로 선정되었다고 소개한다. 제공된 내용은 이 평가의 세부 근거보다는 Datadog의 제품군과 기능 범위를 보여주는 웹사이트 메뉴 중심으로 구성되어 있어, 리더 선정의 구체적인 점수나 비교 분석은 확인할 수 없다. ## Gartner Magic Quadrant 리더 선정 - Datadog이 **Gartner® Magic Quadrant™ for Observability Platforms 2026**에서 Leader로 평가받았다는 소식을 전한다. - 상세 보고서와 평가 기준은 별도 Gartner 자료 링크로 연결된다. - 제공된 본문에는 다음과 같은 내용은 포함되어 있지 않다. - Gartner의 평가 점수 - 경쟁 업체와의 비교 - 리더로 선정된 구체적인 기술적 근거 - Gartner의 장단점 분석 ## 인프라 및 애플리케이션 모니터링 - 인프라 영역에서는 다음 기능을 제공한다. - 호스트 및 인프라 모니터링 - 메트릭 수집·분석 - 컨테이너와 Kubernetes 모니터링 - 네트워크, 서버리스, 스토리지 모니터링 - 클라우드 비용 및 GPU 모니터링 - Cloudcraft를 통한 클라우드 아키텍처 시각화 - 애플리케이션 영역에는 다음 제품이 포함된다. - APM(Application Performance Monitoring) - Universal Service Monitoring - 지속적 프로파일링 - Dynamic Instrumentation - AI 에이전트 관측성 ## 로그·데이터 관측성 - 로그 관리와 보안 분석을 위한 기능을 제공한다. - Log Management - Sensitive Data Scanner - Audit Trail - Observability Pipelines - 데이터 플랫폼 영역에서는 다음을 다룬다. - 데이터베이스 모니터링 - 데이터 스트림 모니터링 - 데이터 품질 모니터링 - 데이터 작업 및 잡 모니터링 ## 보안 통합 - Datadog은 관측성뿐 아니라 애플리케이션과 클라우드 보안 기능도 함께 제공한다. - 주요 보안 기능은 다음과 같다. - SAST, IAST, 소프트웨어 구성 분석(SCA) - IaC 보안 - CSPM과 CIEM - 취약점 관리 및 컴플라이언스 - Cloud SIEM - 워크로드 보호 - 애플리케이션·API 보호 - 시크릿 스캐닝 ## 사용자 경험과 소프트웨어 전달 - 디지털 경험 관측성 기능으로 실제 사용자 행동과 애플리케이션 품질을 분석한다. - 브라우저·모바일 RUM - 세션 리플레이 - Synthetic Monitoring - 오류 추적 - 제품 분석 및 실험 - 소프트웨어 개발·배포 과정도 관측 대상으로 포함한다. - CI Visibility - 테스트 최적화와 지속적 테스트 - 코드 커버리지 - Feature Flags - IDE 플러그인 - 내부 개발자 포털 ## 서비스 관리와 AI 기능 - 운영팀의 대응과 자동화를 지원하는 기능을 제공한다. - 이벤트 관리 - 서비스 카탈로그 - SLO 관리 - 인시던트 대응 - 워크플로 자동화 - 케이스 관리 - AI 관련 기능으로는 다음이 소개된다. - AI 에이전트 관측성 - Bits AI Agents와 Bits Chat - AI 기반 조사 및 보안 분석 - MCP Server와 Agent Builder - GPU 모니터링 및 AI 통합 ## 실용적인 결론 이 자료는 Datadog이 인프라·애플리케이션·로그·보안·디지털 경험·개발·AI를 하나의 플랫폼에서 통합하려는 전략을 보여준다. 다만 실제 도입을 검토할 때는 Gartner 보고서의 원문뿐 아니라 수집 비용, 데이터 보존 정책, 기존 도구와의 연동성, 팀별 사용성 및 벤더 종속성까지 별도로 비교해야 한다.

원문 읽기(새 탭에서 열림)