머신러닝

149 개의 포스트

stripe4분 읽기큐레이션 요약

Stripe Radar를 확장해 비즈니스를 더 안전하게 보호하기

Stripe는 AI 기반 사기 방지 도구인 Radar를 모든 지원 결제 수단과 외부 결제 프로세서까지 확장했다. 새로운 기능은 결제 사기뿐 아니라 다중 계정 악용, 종량제 미납, 악성 봇 결제, 플랫폼 입점 사업자 사기까지 실시간으로 탐지·예방하는 데 초점을 둔다. 또한 기업별 맞춤 사기 모델과 분쟁 대응 기능을 제공해, 사기 차단과 오탐 감소를 동시에 추구한다. ## 모든 결제 수단을 아우르는 사기 탐지 - Radar는 은행 자동이체, BNPL, 암호화폐, 디지털 지갑, 실시간 결제, 현금 바우처 등 Stripe가 지원하는 전 세계 결제 수단에 적용된다. - 한 결제 수단에서 탐지된 사기 정보가 네트워크 전체에 공유된다. - 예를 들어 도난 카드에 사용된 IP 주소와 기기 지문이 탐지되면, 은행 결제·지갑·BNPL 거래에서도 해당 정보가 위험 신호로 활용된다. - Affirm, Cash App, Klarna, PayPal을 사용하는 기업에서 5개월 동안 의심 사기가 71% 감소했다. ## 멀티프로세서 거래를 위한 위험 신호 - Stripe 외부에서 처리되는 결제에도 활용할 수 있는 추가 위험 신호를 제공한다. - 카드 네트워크에서 조기 사기 경고가 발생할 가능성을 예측한다. - 기업은 거래를 선제적으로 환불해 분쟁률 상승을 막을 수 있다. - 사기성 차지백으로 이어질 가능성도 예측한다. - 환불, 증거 수집, 분쟁 대응 전략 조정 등에 활용할 수 있다. - 향후 전체 결제 스택에서 사용할 수 있는 신호를 추가할 예정이다. ## 기업별 맞춤 사기 모델 - 기업은 상품 카탈로그, 고객 충성도, 행동 데이터, 구조화된 메타데이터 등 자체적인 위험 신호를 Stripe에 전달할 수 있다. - Stripe의 글로벌 네트워크 데이터와 기업별 데이터를 결합해 맞춤형 모델을 구축한다. - 초기 도입 기업에서는 오탐 증가 없이 기존보다 최소 15% 더 많은 사기를 탐지했다. ## 다중 계정 악용 차단 - 사기 사용자가 여러 계정을 만들어 무료 체험, 프로모션 쿠폰, 도난 카드 사용을 반복하는 행위를 탐지한다. - 가입 시점에 계정을 실시간 평가해 악용이 시작되기 전에 차단할 수 있다. - 과거 사기 사례에서 얻은 기기 지문, IP 주소, 이메일 도메인 등의 네트워크 정보를 활용한다. - AI 기업 가입자의 6분의 1 이상이 다중 계정 악용과 연관된 것으로 나타났으며, ElevenLabs는 하루 약 2,000명의 무료 요금제 악용 사용자를 차단했다. ## 종량제 서비스의 미납 위험 예측 - 종량제 고객이 서비스를 먼저 사용한 뒤 청구 시점에 비용을 지불하지 않는 행위를 탐지한다. - 사용량이 누적되는 동안 미납 가능성을 예측해 청구 전에 개입할 수 있다. - 기업은 위험도에 따라 다음과 같은 조치를 취할 수 있다. - 선불 충전 또는 추가 결제 요구 - 서비스 이용 중단 - 사용 한도 설정 - 수동 검토 ## 악성 봇 결제 탐지 - 자동화된 구매 봇과 고객을 대신해 정상적으로 작동하는 에이전트를 구분하는 기능이다. - Stripe Checkout 결제에 악성 봇일 가능성을 나타내는 0~100점의 봇 점수를 부여한다. - 기업은 이를 활용해 다음과 같은 정책을 적용할 수 있다. - 한정 상품의 자동 구매 차단 - 짧은 시간에 반복되는 고속 주문 검토 - 프로모션 악용 및 구매 한도 우회 방지 ## 플랫폼의 입점 사업자 위험 관리 - 생성형 AI로 위조 신분증, 문서, 웹사이트를 제작하는 사기가 늘면서 플랫폼은 가입 절차의 편의성과 위험 관리 사이에서 균형을 맞춰야 한다. - Radar는 사업자와 거래별 0~100점 사기 점수, AI 기반 위험 사유 설명, 계정 메모와 이력, 분쟁·환불·거절·결제 지표를 제공한다. - 플랫폼은 Stripe 내부뿐 아니라 외부 거래와 사업자 정보까지 종합해 입점 심사와 사후 관리를 할 수 있다. ### 사기성 웹사이트 신호 - 사업자 웹사이트를 실제 사기 분석가처럼 평가한다. - 비정상적으로 저렴한 명품, AI가 생성한 듯한 문구, 철자가 틀린 브랜드 URL 등을 위험 요소로 분석한다. - 온보딩 자동 검증, 수동 심사 대상 선별, 자체 위험 점수 계산에 활용할 수 있다. ### 사기성 사업자 신호 - 은행 계좌, 사업자 정보, 거래 활동, 분쟁 기록 등 Stripe 네트워크의 패턴을 분석해 사업자의 사기 위험을 판단한다. - 플랫폼은 위험 사업자에 대해 지급 보류, 결제 중단, 계정 거부, 지급 준비금 설정, 신원 확인 요청 등을 실행할 수 있다. ### 사업자 채무불이행 위험 신호 - 사업자가 마이너스 잔액을 장기간 유지할 가능성을 예측한다. - 특히 잔액이 60일 이상 마이너스 상태로 남을 위험을 평가한다. - 플랫폼은 고위험 사업자에 대해 지급 일정 조정, 준비금 요구, 추가 심사를 선제적으로 적용할 수 있다. ## 분쟁 대응 기능 확대 - 글의 마지막 부분에서는 더 정교한 증거 자료와 자동화된 증거 라이브러리를 활용해 결제 분쟁에 대응하는 기능을 소개하려 했으나, 제공된 원문은 해당 섹션 제목에서 끝난다. - 따라서 구체적인 분쟁 대응 기능과 성과는 제시된 내용만으로는 확인할 수 없다. ## 실용적인 적용 방향 - 결제 수단이 다양하거나 여러 프로세서를 사용하는 기업은 네트워크 기반 위험 신호를 통합하는 것이 유리하다. - AI·SaaS 기업은 가입 단계의 다중 계정 악용과 사용량 누적 후 미납을 별도로 관리해야 한다. - 플랫폼은 사업자 온보딩 시 웹사이트·계좌·거래·분쟁 데이터를 함께 평가하고, 위험 점수에 따라 지급 보류나 준비금 설정 같은 단계적 조치를 적용하는 것이 효과적이다.

원문 읽기(새 탭에서 열림)
google4분 읽기큐레이션 요약

경험적 연구 지원(ERA): Nature 게재에서 계산적 발견 촉진까지

ERA는 Gemini를 활용해 과학 문헌을 탐색하고, 실험 코드를 작성·개선하며, 수천 가지 해결책을 비교하는 과학 연구 지원 도구다. Nature 논문에서 유전체학, 공중보건, 위성영상, 신경과학, 시계열 예측, 수학 등 다양한 벤치마크에서 전문가 수준의 성능을 보였다. Google은 ERA를 활용한 여러 과학 연구 결과를 공개하고, AlphaEvolve와 결합한 Computational Discovery를 Google Labs의 신뢰할 수 있는 테스터 프로그램으로 제공하기 시작했다. ## 과학 코드를 자동으로 탐색하고 최적화하는 ERA - 사용자가 과학적 문제와 성공 기준을 제시하면 ERA가 다음 작업을 수행한다. - 관련 과학 문헌 검색 - 분석 및 예측 코드 작성 - 여러 알고리즘과 기법 조합 - 실행 결과 평가 - 성능이 낮은 접근법 수정 및 반복 실험 - 트리 탐색(tree search) 방식으로 수천 가지 후보를 검토하고, 주어진 목표에 맞춰 코드를 최적화한다. - 단순한 코드 생성이 아니라, 가설과 구현 방법을 실험적으로 비교해 가장 성능이 좋은 계산 모델을 찾는 데 초점을 둔다. ## 다양한 과학 분야에서의 전문가 수준 성능 - Nature 논문에서는 다음 분야의 문제를 대상으로 ERA를 평가했다. - 유전체학 - 공중보건 - 위성영상 분석 - 신경과학 예측 - 일반 시계열 예측 - 수학 - 여러 벤치마크에서 전문가 수준의 결과를 달성했다. - 이 결과는 고급 계산 모델링 기술에 대한 접근성을 넓히고, 기존 전문가의 연구 역량도 확장할 가능성을 보여준다. ## 감염병 입원 환자 예측 - 미국 각 주의 독감, 코로나19, RSV 병원 입원 건수를 최대 4주 앞서 예측했다. - ERA 기반 예측은 세 감염병 모두에서 미국 질병통제예방센터(CDC) 예측 리더보드의 최상위권 또는 1위를 기록했다. - 다른 국가나 질병에도 비교적 쉽게 적용할 수 있는 기법을 사용했다는 점이 강조됐다. ## 캘리포니아 물 공급과 적설 유출량 예측 - 눈으로 물이 공급되는 캘리포니아 강 유역의 계절성 유출량을 예측하는 모델을 개발했다. - ERA 모델은 봄철 유출량을 조기에 예측하는 데 기존 공식 전망인 Bulletin 120(B120)보다 높은 정확도를 보였다. - 예측 정확도가 향상되면 농업과 주민 생활에 중요한 수자원 관리와 배분을 개선할 수 있다. ## 위성 데이터를 활용한 대기 CO₂ 지도 작성 - 정지궤도 기상위성 데이터와 추가 정보를 결합해 대기 중 CO₂ 농도를 추정했다. - 기존 위성인 Orbiting Carbon Observatory-2가 약 16일마다 특정 지점을 측정하는 것과 달리, ERA 모델은 넓은 지역의 CO₂ 농도를 약 10분 간격으로 추정할 수 있다. - 로스앤젤레스 분지의 도시 배출 증가를 식별하고, 식물이 낮 동안 CO₂를 흡수하면서 농도가 감소하는 현상도 포착했다. - 이러한 고해상도 추정치는 온실가스의 공간적·시간적 변화를 모니터링하고 모델링하는 데 활용될 수 있다. ## 태양에너지 장치 설계 최적화 - ERA와 Google Antigravity를 함께 사용해 3차원 태양에너지 포집 구조를 탐색했다. - ERA는 500개의 삼각형으로 구성된 입체 팬(volumetric fan) 형태가 산란된 태양광을 가두면서 후방 음영을 만들지 않아 에너지 포집을 극대화할 수 있다고 제안했다. - 이는 AI 시스템들이 서로 다른 설계·최적화 작업을 결합할 수 있음을 보여주는 사례다. ## 소매 판매 예측 - 미국 경제지표, Google Trends, 과거 판매 패턴, 소비자 심리 등을 입력으로 사용했다. - ERA가 설계한 모델은 상용 컨센서스 전망과 Chicago Fed의 CARTS 월간 소매 판매 예측을 충족하거나 넘어섰다. - 정확한 소매 예측은 재고 부족과 폐기물을 줄이고, 기업 운영과 경제 정책 수립을 지원할 수 있다. ## Computational Discovery로의 확장 - Google은 ERA와 AlphaEvolve를 결합한 Computational Discovery를 공개하기 시작했다. - Computational Discovery는 과학 문제를 계산적으로 탐구하는 보다 넓은 실험 도구로 소개됐다. - Gemini for Science의 다른 도구들과 역할이 구분된다. - Computational Discovery: 계산 실험과 모델 탐색 - Hypothesis Generation: AI Co-Scientist 기반의 가설 생성 - Literature Insights: 과학 문헌 분석 - 이 도구들은 과학적 방법의 서로 다른 단계를 지원하도록 설계됐다. ERA는 과학자의 반복적인 코드 작성과 실험 최적화 작업을 자동화해, 복잡한 계산 연구를 더 빠르고 폭넓게 수행하도록 돕는 도구다. 특히 감염병 예측, 수자원 관리, 기후 모니터링처럼 실제 정책과 공공복지에 직접 연결되는 문제에서 활용 가능성이 크며, 연구자는 ERA를 최종 판단을 대신하는 시스템이라기보다 다양한 계산적 가설을 빠르게 검증하는 연구 파트너로 활용하는 것이 적절하다.

원문 읽기(새 탭에서 열림)
spotify4분 읽기큐레이션 요약

LLM은 A/B 테스트에서 언제 인간을 대체할 수 있을까? | Spotify Engineering

LLM 예측은 인간 사용자를 대신한 A/B 테스트에 활용될 수 있지만, 무작위 실험처럼 설계만으로 타당성이 보장되지는 않습니다. Upworthy 헤드라인 데이터에서는 원시 LLM 예측이 인간의 실제 효과를 39%만 포착했지만, 적절한 보정과 반복 예측을 적용하면 인간 실험 결과를 회복할 수 있었습니다. 다만 그 보정이 새로운 유형의 제품·기능에도 유지된다는 보장은 없으며, 혁신적인 개입일수록 인간 대상 실험이 여전히 필요합니다. ## LLM 원시 예측은 단순한 잡음이 아니라 편향을 가진다 - 연구진은 수천 건의 헤드라인 A/B 테스트가 포함된 Upworthy Research Archive를 사용했습니다. - `gpt-4o-mini`에 각 대조군·처리군 헤드라인의 일반적인 사용자 클릭률을 예측하도록 했습니다. - 원시 예측값으로 인간 실험과 같은 분석을 수행하자 실제 인간 치료 효과의 **39%만 회복**했습니다. - 이는 무작위 잡음만의 문제가 아니라, LLM이 처리 효과를 전반적으로 0에 가깝게 축소하는 방향성 편향입니다. - 이런 편향이 누적되면 조직은 기능이나 제품 변경의 사용자 가치를 과소평가하고, 출시 여부를 잘못 결정할 수 있습니다. ## LLM을 인간 결과의 대리변수로 쓰기 위한 두 조건 ### 대리성(Surrogacy) - LLM 예측이 처리군과 대조군의 차이 중 인간 행동에 영향을 주는 모든 요소를 포착해야 합니다. - LLM 예측과 처리 전 특성 등을 고려한 뒤에는, 사용자가 어느 조건에 배정됐는지가 인간의 결과를 추가로 설명하지 않아야 합니다. - 즉, LLM 예측이 “해당 처리가 인간 반응에 미치는 경로”를 완전히 매개해야 합니다. - 이 조건이 성립하지 않으면 LLM은 인간의 효과가 아니라 LLM 자체의 반응을 측정하게 됩니다. ### 비교가능성(Comparability) - 과거 인간 실험에서 추정한 “LLM 예측과 실제 인간 행동의 관계”가 새로운 실험에서도 동일해야 합니다. - 새로운 처리 방식이 등장했을 때 LLM 점수와 실제 사용자 행동의 매핑이 달라지면 기존 보정 함수는 무너집니다. - 더 강한 형태로는 처리 전 사용자 특성과 LLM 예측의 전체 분포가 실험 간 안정적이어야 합니다. - 두 조건이 모두 충족될 때에만 과거 사용자 데이터로 LLM 결과를 보정해 인간 평균 처리 효과를 추정할 수 있습니다. - 데이터나 LLM 샘플을 무한히 늘려도 조건이 깨지면 편향은 사라지지 않습니다. 이는 표본 부족이 아니라 식별 대상 자체가 달라지는 문제이기 때문입니다. ## 보정 방법에 따라 결과가 달라진다 - 단순 선형 보정과 OLS(최소제곱법)는 인간 결과와 LLM 결과 사이의 비선형 관계를 충분히 표현하지 못했습니다. - 검증용으로 남겨둔 실험에서 OLS 보정 효과는 인간 기준값과 **3.8 표준오차**만큼 차이를 보여 신뢰하기 어려웠습니다. - 랜덤 포레스트와 그래디언트 부스팅 트리 같은 머신러닝 모델은 더 유연하게 비선형 관계를 학습했습니다. - 이 방법으로 보정한 효과는 인간 효과의 표본오차 범위 안에 들어갔고, 통계적으로 유의한 차이가 나타나지 않았습니다. - 따라서 LLM 예측을 사용할 경우 단순 선형 보정보다는 과거 인간 데이터에서 검증된 유연한 보정 모델이 필요합니다. ## LLM 생성의 무작위성도 별도로 처리해야 한다 - 같은 입력이라도 샘플링 온도에 따라 LLM은 서로 다른 예측을 낼 수 있습니다. - 이 측정오차를 무시하면 효과가 다시 0으로 축소되고 추정 분산도 커질 수 있습니다. - 각 실험 단위에 대해 LLM 예측을 여러 번 생성한 뒤 평균을 내면 우연한 생성 잡음이 줄어듭니다. - 평균 예측은 개별 출력의 불안정성을 완화하고, 인간 행동과 관련된 신호에 더 가까워지는 효과가 있습니다. ## 가장 큰 한계는 새로운 개입에 있다 - 대리성과 비교가능성은 과거 데이터에서 일부 점검할 수 있지만, 한 번도 실험하지 않은 처리에 대해 성립한다고 증명할 수는 없습니다. - 새로운 UI 패러다임, 가격 정책, 완전히 새로운 기능처럼 기존 실험과 거리가 먼 개입일수록 과거 보정의 근거가 약해집니다. - Upworthy 데이터는 텍스트 기반이고 헤드라인 변형들이 서로 유사하며, LLM이 매력적인 문구에 관한 많은 텍스트를 학습했다는 점에서 대리변수 검증에 유리한 사례입니다. - 반면 레이아웃, 추천 알고리즘, 가격, 사용자 경험 구조처럼 텍스트만으로 표현하기 어려운 처리는 필요한 조건이 더 쉽게 깨질 수 있습니다. - 역설적으로 LLM A/B 테스트가 가장 큰 이익을 주는 “완전히 새로운 시도”에서 인간 결과를 대체할 근거가 가장 약합니다. 새로운 기능이나 제품 혁신을 평가할 때는 인간 대상 A/B 테스트를 기준으로 삼는 것이 안전합니다. LLM 기반 테스트는 과거와 유사한 처리를 빠르게 선별하거나, 충분한 인간 실험 데이터로 보정·검증된 제한적인 영역에서 보조 수단으로 사용하는 것이 적절합니다.

원문 읽기(새 탭에서 열림)
github1분 읽기큐레이션 요약

지연에서 즉시로: GitHub Issues 탐색 성능 현대화

Alexander는 GitHub Issues 팀의 시니어 소프트웨어 엔지니어로, 개발자 업무 흐름을 더 빠르고 즉각적으로 만드는 방법을 찾는 일을 즐긴다. 컴퓨터 그래픽스, 머신러닝, 지리공간 소프트웨어 등 다양한 분야의 경험을 바탕으로 현재 역할을 수행하고 있다. ### 경력과 전문 분야 - GitHub Issues 팀에서 시니어 소프트웨어 엔지니어로 근무한다. - 컴퓨터 그래픽스, 머신러닝, 지리공간 소프트웨어 등 여러 기술 분야를 경험했다. - 한 분야에 국한되지 않은 폭넓은 배경이 현재의 문제 해결 방식에 영향을 준다. ### 개발자 경험 개선 - 일상적인 개발자 업무를 “즉각적으로” 느껴지게 만드는 창의적인 방법을 찾는 것을 중요하게 여긴다. - 기술 자체뿐 아니라 개발자가 도구를 사용하는 과정의 속도와 편의성에 관심이 있다. - GitHub Issues와 같은 개발 협업 도구의 사용자 경험을 개선하는 데 전문성을 발휘한다.

원문 읽기(새 탭에서 열림)
meta2분 읽기큐레이션 요약

릴 프렌즈: 수십억 명까지 확장 가능한 소셜 디스커버리 구축

Friend Bubbles는 친구들이 시청하거나 반응한 릴스를 강조해 보여주는 기능이다. 겉보기에는 단순하지만, 실제 구현에는 머신러닝 모델의 발전과 iOS·Android 사용자 행동 차이 분석 등 복잡한 엔지니어링 작업이 필요했다. Meta Reels 팀은 개발 과정에서 기능의 작동 방식을 결정짓는 중요한 발견을 통해 최종적인 사용자 경험을 완성했다. ### 친구 활동을 활용한 릴스 추천 - 친구들이 시청하거나 반응한 릴스에 친구 정보를 표시해 콘텐츠의 사회적 맥락을 강화한다. - 사용자는 친구들의 활동을 바탕으로 새로운 릴스를 발견할 수 있다. - 단순히 친구의 반응을 수집하는 것이 아니라, 어떤 활동을 어떤 방식으로 노출할지 결정해야 한다. ### 머신러닝 모델의 발전 - Friend Bubbles의 핵심에는 친구 활동과 콘텐츠 노출을 연결하는 머신러닝 모델이 있다. - 모델은 어떤 친구의 어떤 반응이 사용자에게 의미 있을지 판단해야 한다. - 기능 개발 과정에서 모델이 초기 형태에서 발전했으며, 데이터와 실제 사용자 행동을 반영해 개선됐다. - “친구가 반응했다”는 사실만으로는 충분하지 않고, 콘텐츠와 사용자 사이의 관련성까지 고려해야 했다. ### iOS와 Android 사용자의 행동 차이 - iOS와 Android 사용자 사이에는 릴스 소비 방식과 친구 활동에 반응하는 방식에서 차이가 나타났다. - 동일한 기능을 두 플랫폼에 제공하더라도 사용자 행동이 다르기 때문에, 플랫폼별 데이터를 별도로 분석해야 했다. - 이러한 차이는 모델 학습과 기능 설계, 노출 방식 조정에 영향을 미쳤다. ### 예상 밖의 발견과 기능 완성 - 개발팀은 초기 가정만으로는 기능이 기대한 만큼 자연스럽게 작동하지 않는 문제를 겪었다. - 사용자 행동을 분석하는 과정에서 기능의 효과를 결정하는 “놀라운 발견”을 찾아냈다. - 이 발견을 바탕으로 친구 활동과 릴스 추천의 연결 방식을 조정했고, Friend Bubbles가 의도한 사용자 경험을 구현할 수 있었다. ### 단순한 기능에 필요한 깊은 엔지니어링 - Friend Bubbles 사례는 화면에 작은 정보를 추가하는 기능도 대규모 추천 시스템과 사용자 행동 분석을 요구할 수 있음을 보여준다. - 기능 구현에는 모델 설계뿐 아니라 플랫폼별 차이, 데이터 해석, 실험과 반복 개선이 함께 필요했다. - 글의 내용은 Meta Tech Podcast에서 Facebook Reels 팀 엔지니어들이 이러한 개발 과정을 설명한다는 소개에 해당하며, 세부 구현 방식은 팟캐스트 에피소드에서 다뤄진다. 작아 보이는 사용자 기능일수록 실제로는 추천 모델, 행동 데이터, 플랫폼별 최적화가 긴밀하게 결합되어야 한다. 비슷한 기능을 개발할 때는 초기 직관에만 의존하지 말고, 실제 사용자 행동과 플랫폼별 차이를 지속적으로 검증하는 것이 중요하다.

원문 읽기(새 탭에서 열림)
meta4분 읽기큐레이션 요약

메타급 규모에서 데이터 수집 시스템 마이그레이션하기

Meta는 수 페타바이트 규모의 소셜 그래프 데이터를 매일 MySQL에서 데이터 웨어하우스로 수집하는 시스템을 기존 고객 소유 파이프라인에서 단순한 자체 관리형 아키텍처로 전환했다. 이 과정에서 수천 개 작업을 단계적으로 검증하고, 데이터 품질·지연 시간·리소스 사용량을 비교하며 안전하게 마이그레이션했다. 섀도 작업, 리버스 섀도, 자동화된 데이터 품질 분석, 신속한 롤백 체계를 통해 전체 워크로드를 성공적으로 이전하고 레거시 시스템을 폐기했다. ## 대규모 데이터 수집 시스템 개편 배경 - Meta의 소셜 그래프는 세계 최대 규모의 MySQL 환경 중 하나에서 운영된다. - 데이터 수집 시스템은 매일 수 페타바이트의 데이터를 증분 방식으로 데이터 웨어하우스에 적재한다. - 적재된 데이터는 다음과 같은 용도로 활용된다. - 분석 및 리포팅 - 머신러닝 모델 학습 - 제품 개발 - 사내 의사결정 및 데이터 기반 서비스 - 기존 시스템은 소규모에서는 효과적이었지만, 규모가 커지면서 엄격해진 데이터 적재 시간 요구사항을 안정적으로 충족하기 어려워졌다. - 이에 따라 고객 팀이 직접 운영하던 파이프라인을 단순한 자체 관리형 데이터 웨어하우스 서비스로 대체했다. ## 마이그레이션 성공 기준 각 작업은 다음 조건을 충족해야 다음 단계로 진행됐다. - **데이터 품질 일치** - 기존 시스템과 신규 시스템의 행 개수를 비교했다. - 데이터 체크섬을 비교해 두 시스템의 결과가 완전히 일치하는지 검증했다. - **적재 지연 시간 개선** - 신규 시스템의 데이터 적재 지연 시간이 기존보다 개선되거나 최소한 동등해야 했다. - **리소스 사용량 개선** - 컴퓨팅 및 스토리지 사용량이 기존보다 줄어들거나 최소한 비슷해야 했다. - **핵심 테이블 추가 기준** - 중요 테이블은 해당 데이터를 사용하는 팀들과 별도의 마이그레이션 조건을 합의했다. ## 1단계: 섀도 단계 - 사전 운영 환경에 신규 시스템 기반의 섀도 작업을 생성했다. - 섀도 작업은 운영 작업과 동일한 실제 데이터를 읽지만, 별도의 섀도 테이블에 결과를 기록했다. - 실제 운영 데이터와 동작을 사용하므로 다음과 같은 문제를 사전에 발견할 수 있었다. - 데이터 변환 오류 - 특수한 데이터 패턴에서 발생하는 예외 - 신규 시스템의 리소스 부족 - 운영 테이블과 섀도 테이블의 행 개수 및 체크섬을 지속적으로 비교했다. - 불일치가 발생하면 원인을 조사하고 사전 운영 환경에 수정 사항을 배포한 뒤 재검증했다. - 동시에 섀도 작업의 컴퓨팅·스토리지 사용량을 측정해 운영 환경에 충분한 자원이 있는지 확인했다. - 기준을 통과한 작업은 운영 환경에서도 안정적으로 실행되는지 추가로 검증했다. ## 2단계: 리버스 섀도 단계 - 신규 시스템의 섀도 작업이 운영 테이블에 데이터를 기록하도록 전환했다. - 기존 시스템의 운영 작업은 섀도 테이블에 데이터를 기록하게 했다. - 이로써 신규 시스템이 실제 운영 작업이 되고, 기존 시스템은 비교용 섀도 작업으로 역할이 바뀌었다. - 이 방식의 장점은 다음과 같다. - 전환 이후에도 기존 시스템과 신규 시스템의 결과를 계속 비교할 수 있다. - 데이터 불일치가 발견되면 기존 작업을 다시 구성하지 않고 즉시 되돌릴 수 있다. - 신규 시스템이 실제 운영 환경에서 지속적으로 안정적인지 확인할 수 있다. ## 3단계: 마이그레이션 정리 - 두 시스템의 결과를 계속 비교하면서 불일치 여부를 감시했다. - 문제가 발견되지 않으면 기존 시스템에서 실행 중인 섀도 작업을 제거했다. - 이후 신규 시스템이 운영 작업으로서 데이터 적재를 계속 수행하며 마이그레이션이 완료됐다. ## 자동화된 데이터 품질 분석 도구 - 각 섀도 테이블 파티션과 대응하는 운영 테이블 파티션을 읽어 행 개수와 체크섬을 비교했다. - 불일치 내역은 Meta의 실시간 데이터 분석 시스템인 Scuba에 기록했다. - 매시간 Scuba 로그를 분석해 불일치를 일으킨 실제 예시 행을 찾았다. - 원인 분석에 필요한 상세 디버깅 정보도 다시 Scuba에 기록했다. - 이를 통해 엔지니어는 다음을 빠르게 판단할 수 있었다. - 불일치의 근본 원인 - 이미 알려진 문제인지 여부 - 해당 문제가 수정 진행 중인지 여부 - 이 도구는 마이그레이션 이후에도 릴리스 검증 과정에서 계속 사용되고 있다. ## CDC 기반 구조와 롤백 문제 - 기존 시스템과 신규 시스템 모두 CDC(Change Data Capture)를 사용해 변경분을 대상 테이블에 증분 반영했다. - 각 작업은 다음 테이블을 관리한다. - 소스 데이터베이스의 전체 덤프를 저장하는 내부 테이블 - 소스 변경 사항을 저장하는 델타 테이블 - 데이터 소비자가 사용하는 대상 테이블 - 작업 엔터티, 테이블 이름, 스키마 등의 메타데이터는 중앙 관리 서비스가 관리했다. - CDC에서는 이전에 적재된 데이터가 이후 데이터 생성에 다시 사용된다. - 따라서 과거 데이터에 문제가 있으면 해당 문제가 신규 적재 데이터로 계속 전파될 수 있다. - 마이그레이션 후 문제가 발생하면 잘못된 데이터가 계속 확산되는 것을 막기 위해 신속한 롤백이 필요했다. ## 조기 신호와 신속한 롤백 - 데이터 소비자가 문제를 발견할 때까지 기다리지 않고, 리버스 섀도 단계에서 두 시스템의 결과를 지속적으로 비교했다. - 이를 통해 마이그레이션 성공 여부에 대한 조기 신호를 확보했다. - 문제가 발견되면 기존 시스템이 이미 섀도 작업으로 실행 중이므로 빠르게 이전 상태로 되돌릴 수 있었다. - 마이그레이션 작업을 처음부터 다시 생성하거나 재구성하지 않아도 된다는 점이 롤백 위험을 줄였다. 대규모 데이터 시스템을 이전할 때는 한 번에 전환하기보다, 실제 데이터 기반의 섀도 실행과 양방향 역할 전환을 통해 검증하는 방식이 안전하다. 특히 행 개수·체크섬·지연 시간·리소스 사용량을 자동 비교하고, 문제가 생겼을 때 즉시 롤백할 수 있는 구조를 마이그레이션 설계에 포함하는 것이 중요하다.

원문 읽기(새 탭에서 열림)
netflix4분 읽기큐레이션 요약

넷플릭스에서 머신러닝의 민주화: 모델 수명 주기 그래프 구축

Netflix는 ML 자산이 개인화, 스튜디오, 결제, 광고 등 여러 영역으로 확장되면서 모델과 데이터가 각기 다른 시스템에 고립되는 문제를 겪었다. 이를 해결하기 위해 다양한 ML 메타데이터를 통합하는 Metadata Service(MDS)와 Model Lifecycle Graph를 구축했다. MDS는 모델·피처·파이프라인·실험·데이터셋 등의 관계를 연결해 자산의 발견, 계보 추적, 영향 분석, 재사용을 가능하게 하는 기반이다. ## ML 생태계의 확장과 사일로 문제 - Netflix의 ML 활용 영역은 개인화 중심에서 다음과 같이 확대됐다. - 콘텐츠 추천과 사용자 참여 최적화 - 스튜디오의 제작 전후 작업 - 사기 탐지, 결제 라우팅, 정기 결제 최적화 - 광고 타기팅과 실시간 의사결정 - 각 도메인은 서로 다른 기술 스택, 비즈니스 지표, 조직 구조를 사용한다. - 그 결과 모델이 블랙박스처럼 고립되고, 다른 팀이 기존 모델과 데이터를 발견하거나 재사용하기 어려워졌다. - 예를 들어 스튜디오에서 만든 콘텐츠 임베딩은 장면 전환과 콘텐츠 구조를 분석하지만, 광고의 문맥 매칭이나 개인화 추천에도 활용될 수 있다. - 그러나 모델 레지스트리, 파이프라인 오케스트레이터, 실험 플랫폼이 분리되어 있어 다음 질문에 답하기 어렵다. - 어떤 피처와 데이터 소스가 존재하는가? - 특정 모델은 어떤 파이프라인과 데이터로 생성되는가? - 해당 모델을 사용하는 A/B 테스트는 무엇인가? - 피처를 변경하면 어떤 모델이 영향을 받는가? - 각 자산의 담당자는 누구인가? ## 통합 UI보다 어려운 메타데이터 연결 - 문제의 본질은 화면을 하나로 합치는 것이 아니라, ML 라이프사이클의 서로 다른 구성 요소를 연결하는 것이다. - Netflix에는 다음과 같은 시스템이 각각 메타데이터를 생성한다. - 파이프라인 오케스트레이션: 실행 정보, 단계 의존성, 데이터 변환 - 모델 레지스트리: 모델 버전, 아티팩트, 오래된 모델 여부, 배포 이력 - 실험 플랫폼: A/B 테스트와 설정 - 피처 스토어: 피처 정의와 사용처 - AI Dataset 플랫폼: 데이터셋 생성, 관리, 검색, 로딩 - Identity 플랫폼: 사용자, 팀, 조직 정보 - 시스템마다 데이터 형식, 식별자, 개념 모델이 다르기 때문에 이질적인 메타데이터를 하나의 엔터티 모델로 변환하고 관계 그래프로 만드는 작업이 핵심 기술 과제가 됐다. ## Metadata Service와 Model Lifecycle Graph - MDS는 Netflix 전반의 ML 관련 엔터티를 색인하고 서로 연결하는 서비스다. - 모델, 피처, 파이프라인, 실험, 데이터셋 등의 메타데이터를 실시간으로 수집한다. - 다음과 같은 교차 도메인 질의를 지원하는 것을 목표로 한다. - 특정 모델을 실행 중인 실험은 무엇인가? - 특정 피처를 공유하는 모델은 무엇인가? - 모델에 사용된 데이터와 생성 파이프라인은 무엇인가? - MDS의 역할은 다음과 같다. - 여러 시스템에서 이벤트 수집 - 메타데이터에 조직·소유자 등 추가 맥락 결합 - ML 자산 간 관계 추론 및 구체화 - 연결된 그래프 형태로 탐색 가능하게 제공 - 궁극적인 목표는 모든 ML 자산을 팀과 도메인에 관계없이 발견하고, 이해하고, 재사용할 수 있도록 만드는 것이다. ## URI 기반 핵심 추상화 MDS는 시스템 간 일관된 연결을 위해 AI Platform URI를 사용한다. - **Component** - 고유한 URI로 주소 지정할 수 있는 모든 객체다. - 형식은 다음과 같다. ```text aip://<componentType>/<platformId>/<resourceId> ``` - 예: ```text aip://model/registry/ranking-v5 aip://user/identity/alice aip://pipeline/orchestrator/weekly-training ``` - **Entity** - 이름, 설명, 생성일, 소유자 등 추가 속성을 가진 ML 생태계의 구성 요소다. - 모델, 피처, 파이프라인 등이 이에 해당한다. - **Entity Type** - 동일한 데이터 구조와 속성·관계 제약을 공유하는 엔터티 집합이다. - **Domain** - 관련 엔터티 타입을 묶고 해당 ML 자산 범주의 추상 인터페이스를 정의한다. - 예를 들어 Models 도메인은 Model과 Model Instance를, Pipelines 도메인은 Schedule·Request·Execution을 정의한다. - **Provider** - 도메인을 실제로 구현하는 특정 소스 시스템이다. - 하나의 도메인에 여러 Provider를 연결할 수 있어, 모델 레지스트리가 교체되더라도 도메인 인터페이스를 변경하지 않고 확장할 수 있다. - URI는 서비스 간 ML 자산 참조를 단일 문자열로 통일하고, MDS가 이를 풍부한 메타데이터와 연결된 관계로 해석할 수 있게 한다. ## 이벤트에서 엔터티와 그래프로 - MDS는 Kafka와 AWS SNS/SQS를 통해 소스 시스템의 이벤트를 실시간으로 수집한다. - 소스 시스템은 식별자와 이벤트 유형 중심의 얇은 이벤트를 발행한다. - 예시는 다음과 같다. ```json { "event_type": "model_instance_created", "instance_id": "ranking-model-v5-20XX0101" } ``` - 생산 시스템은 복잡한 그래프 로직을 알 필요 없이 간단한 이벤트만 발행하고, MDS가 이를 엔터티로 변환하고 다른 시스템의 정보와 결합한다. - 이후 모델, 파이프라인, 피처, A/B 테스트 등의 관계를 추론해 질의 가능한 Model Lifecycle Graph로 materialize한다. - 이를 통해 모델 생성 이벤트와 실험 설정을 연결하는 것처럼, 서로 다른 시스템에 존재하는 관계도 하나의 그래프에서 탐색할 수 있다. MDS와 Model Lifecycle Graph는 단순한 모델 카탈로그가 아니라, ML 자산의 생성부터 배포·실험·재사용까지를 연결하는 메타데이터 인프라다. 여러 팀이 공통 URI와 엔터티 모델을 사용하도록 만들면 모델의 검색성, 의존성 파악, 변경 영향 분석, 조직 간 재사용이 크게 향상된다.

원문 읽기(새 탭에서 열림)
netflix원문

모델 서빙의 라우팅 현황 (새 탭에서 열림)

넷플릭스는 대규모 개인화 경험을 제공하기 위해 수백 개의 모델과 초당 100만 건의 요청을 처리하는 중앙 집중식 머신러닝(ML) 모델 서빙 플랫폼을 운영하고 있습니다. 이 플랫폼은 'Switchboard'라는 라우팅 계층을 통해 클라이언트 마이크로서비스와 복잡한 ML 모델 인프라를 분리하여, 클라이언트의 수정 없이도 새로운 모델을 신속하게 실험하고 배포할 수 있는 환경을 구축했습니다. 이를 통해 넷플릭스는 모델 추론뿐만 아니라 데이터 전처리 및 특징 추출을 포함한 전체 워크플로우를 표준화된 API로 추상화하여 혁신의 속도를 높이고 있습니다. ### 넷플릭스의 워크플로우 중심 모델 정의 * 넷플릭스에서 모델은 단순한 추론 함수(`score(features)`)를 넘어, 입력 데이터 변환, 특징(feature) 계산, 추론, 후처리를 모두 포함하는 독립적인 '워크플로우'로 정의됩니다. * 클라이언트는 사용자 ID나 국가와 같은 최소한의 컨텍스트만 제공하며, 모델 서빙 플랫폼이 필요한 데이터를 다른 마이크로서비스에서 가져와 직접 특징을 계산합니다. * 이러한 구조 덕분에 클라이언트는 모델의 내부 로직이나 데이터 의존성을 알 필요가 없으며, 모델의 아키텍처가 변하더라도 클라이언트 코드를 수정할 필요가 없습니다. ### 중앙 집중형 라우팅 엔진, Switchboard * 넷플릭스는 표준 API 게이트웨이나 서비스 메시가 제공하지 못하는 실험 플랫폼과의 통합, gRPC 지원, 도메인 특화 라우팅을 구현하기 위해 자체 프록시 서비스인 'Switchboard'를 개발했습니다. * Switchboard는 클라이언트 요청을 적절한 모델 인스턴스와 클러스터 샤드로 전달하는 역할을 수행하며, 초당 100만 건 이상의 요청을 처리하면서도 높은 가용성을 유지합니다. * 모델 배포 시 섀도 모드(Shadow mode), 카나리 배포(Canary), 롤백 등을 클라이언트 모르게 수행할 수 있어 안전한 운영이 가능합니다. ### 인프라 복잡성을 감추는 모델 샤딩 분리 * 모델은 트래픽 패턴, SLA, CPU/메모리 요구사항에 따라 여러 연산 클러스터 샤드(VIP 주소)에 분산 배치됩니다. * 서빙 플랫폼은 이러한 물리적 배치 상태를 클라이언트로부터 은폐하여, 인프라의 변경이나 모델의 샤드 이동이 클라이언트 서비스에 영향을 주지 않도록 설계되었습니다. * 이를 통해 ML 연구자는 인프라 제약 없이 자유롭게 실험을 설계하고 모델을 배포할 수 있습니다. ### 'Objective' 기반의 추상화 계층 * 플랫폼은 'Objective'라는 열거형(Enum) 단위를 통해 모든 요청을 관리하며, 이는 비즈니스 목적(예: 콘텐츠 추천, 결제 사기 탐지)을 나타냅니다. * Objective는 요청이 전달될 특정 서빙 클러스터와 모델 유형/버전을 결정하는 기준이 됩니다. * 또한, 각 Objective는 고유한 API 규격을 정의하여 서로 다른 도메인의 클라이언트가 동일한 방식으로 플랫폼과 통신할 수 있도록 표준화합니다. 성공적인 대규모 ML 시스템을 구축하려면 모델의 생명주기를 클라이언트 애플리케이션으로부터 완전히 격리해야 합니다. 넷플릭스의 사례처럼 워크플로우 단위의 모델 정의와 'Objective' 중심의 라우팅 추상화를 도입함으로써, 인프라의 복잡성을 관리하면서도 머신러닝 혁신의 속도를 극대화할 수 있습니다.

grammarly원문

올해의 교육자 (새 탭에서 열림)

Grammarly는 학생들의 추천을 통해 교육 현장에서 커뮤니케이션의 가치를 실현하는 교사를 선정하는 ‘올해의 교육자상(Educator of the Year Award)’을 신설하고, 첫 번째 수상자로 센트럴 플로리다 대학교(UCF)의 훔베르토 로페즈 카스티요(Humberto López Castillo) 교수를 선정했습니다. 로페즈 카스티요 교수는 복잡한 학술적 개념을 대중의 언어로 번역하는 법을 가르치며, AI를 도구로서 비판적으로 수용하는 '계산기 원칙'을 통해 미래 지향적인 교육 모델을 제시합니다. 그의 교육 철학은 기술의 발전 속에서도 인간의 판단력과 청중 중심의 소통이 가장 강력한 힘이라는 점을 강조합니다. **학생의 목소리로 증명된 교육의 힘** - 이번 시상식은 학생들이 직접 교수님이 자신의 학업 여정과 글쓰기, 기술에 대한 사고방식을 어떻게 변화시켰는지 공유하는 비디오 제출 방식으로 진행되었습니다. - 첫 수상자인 로페즈 카스티요 교수는 "정교하면서도 접근하기 쉬운 언어"를 구사하도록 이끌어주었다는 제자 바르단 아바라디(Vardhan Avaradi)의 추천을 통해 선정되었습니다. - 소아과 의사이자 4개 국어 구사자, 공중보건 연구자라는 그의 다채로운 배경은 개인과 공동체를 동시에 아우르는 독특한 교육 철학의 기반이 되었습니다. **청중의 눈높이에 맞춘 커뮤니케이션 훈련** - 로페즈 카스티요 교수의 수업에서 학생들은 학술적 동료만을 위한 글쓰기에서 벗어나, 완전히 다른 청중에게 정보를 전달하는 과제를 수행합니다. - 공중보건이라는 복잡한 주제를 유치원생을 위한 그림책, HIV 환자의 삶을 다룬 보드게임, 결핵에 관한 랩 송, 역학을 다룬 팟캐스트 등으로 변주하며 소통 능력을 기릅니다. - 이는 소아과 의사로서 아이, 부모, 학회 전문가에게 각각 다르게 설명해야 했던 실전 경험에서 우러나온 교육 방식으로, 학생들이 졸업 후에도 실질적인 소통 역량을 갖추게 합니다. **비판적 사고를 전제로 한 AI 활용, '계산기 원칙'** - 교수는 AI를 금지하는 대신, 마치 수학 시간의 '계산기'처럼 강력하지만 인간의 비판적 사고가 뒷받침되어야 하는 도구로 정의합니다. - AI가 존재하지 않는 참고문헌을 생성(환각 현상)했을 때, 이를 처벌하기보다 소스를 확인하고 비판적으로 검토하는 '가르침의 순간'으로 활용하여 AI 문해력을 높입니다. - 실제 연구에서도 국립보건원(NIH)의 'All of Us' 데이터셋을 활용해 인구 집단을 분류하고 위험을 예측하는 머신러닝 프로젝트를 학생과 함께 진행하며, 인간이 주도하는 책임감 있는 AI 활용의 본보기를 보여줍니다. 교육의 미래는 단순히 새로운 도구를 채택하는 것에 있지 않습니다. 로페즈 카스티요 교수의 사례처럼, 도구를 현명하게 사용하는 법을 가르치고 목적 중심의 커뮤니케이션을 통해 소통의 대상인 '사람'을 놓치지 않는 태도를 길러주는 것이 AI 시대 교육자가 나아가야 할 방향입니다.

gitlab원문

GitLab과 Anthropic: 엔터프라이즈 개발을 위한 거버넌스 AI (새 탭에서 열림)

GitLab은 Anthropic과의 협력을 강화하여 자사의 지능형 오케스트레이션 플랫폼에 최신 Claude 모델을 통합하고, 엔터프라이즈 환경에 최적화된 관리형 AI 서비스를 제공합니다. 이를 통해 기업은 최신 AI의 강력한 성능을 활용하면서도 GitLab이 제공하는 엄격한 거버넌스, 컴플라이언스 및 감사 기능을 그대로 유지할 수 있습니다. 결과적으로 보안과 규제 준수가 필수적인 공공 및 기업 환경에서 개발 속도를 안전하게 가속화할 수 있는 토대를 마련했습니다. **GitLab Duo와 Anthropic Claude의 통합** * Anthropic의 Claude 모델은 GitLab Duo 에이전트 플랫폼의 기본 모델로서 코드 생성, 코드 리뷰, 취약점 해결 및 에이전트 기반 채팅 등 다양한 유스케이스를 지원합니다. * 개발자들은 GitLab Duo를 통해 소프트웨어 개발 생명주기(SDLC) 전반의 워크플로우를 자동화하고 AI의 고도화된 추론 능력을 직접적으로 경험할 수 있습니다. **통제된 AI(Governed AI)를 통한 차별화** * AI가 제안하는 모든 코드 변경 사항은 별도의 특혜 없이 기존의 병합 요청(Merge Request) 프로세스, 승인 규칙, 보안 스캔 및 감사 추적 시스템을 동일하게 통과해야 합니다. * AI 에이전트가 자율적으로 취약점을 해결하거나 서비스를 리팩토링할 때, 모든 작업은 기록되고 추적 가능하며 인간 개발자와 동일한 정책 강제력을 적용받습니다. * 이는 AI의 자율성이 높아질수록 중요해지는 '책임성'과 '투명성'을 아키텍처 단계에서부터 보장하는 구조입니다. **엔터프라이즈 배포의 유연성 및 효율성** * Google Cloud Vertex AI 및 Amazon Bedrock을 통해 Claude 모델을 활용할 수 있어, 기업은 기존에 구축된 클라우드 거버넌스 프레임워크와 인프라를 그대로 이용할 수 있습니다. * 새로운 벤더 계약이나 데이터 거주성(Data Residency) 문제를 고민할 필요 없이 기존 Google Cloud 또는 AWS 환경 내에서 AI 워크로드를 처리할 수 있습니다. * Claude Marketplace에서 GitLab 크레딧을 구매하여 기존 Anthropic 지출 약정에 포함시킬 수 있는 통합 결제 방식을 통해 구매 절차를 단순화했습니다. **에이전트 중심의 소프트웨어 개발 미래** * GitLab은 AI 에이전트가 계획, 코딩, 테스트, 보안, 배포에 이르는 정의된 작업을 자율적으로 수행하는 미래를 지향하며, 이를 위해 Claude의 강력한 추론 능력과 신뢰성을 결합했습니다. * 거버넌스 프레임워크를 통해 AI 에이전트의 작업 시점과 내용에 대한 완전한 가시성을 제공함으로써, 기업이 통제권을 잃지 않고도 고도화된 자동화 단계로 진입할 수 있도록 돕습니다. 고급 AI 역량과 기업 수준의 강력한 통제권 사이에서 고민하는 기업이라면, GitLab Duo 플랫폼을 통해 보안이 담보된 지능형 DevSecOps 환경을 구축하는 것이 효과적인 전략이 될 것입니다. 현재 GitLab Duo를 사용 중인 고객은 기존의 거버넌스 틀 안에서 더 깊이 있는 AI 지원을 즉시 경험할 수 있습니다.

gitlab원문

glab CLI로 AI 에이전트에 GitLab 직접 액세스 권한 부여하기 (새 탭에서 열림)

GitLab CLI(`glab`)를 MCP(Model Context Protocol)와 결합하면 AI 에이전트가 프로젝트 데이터에 직접적이고 구조적으로 접근할 수 있게 되어 개발 워크플로우의 효율성이 극대화됩니다. 이를 통해 개발자는 수동으로 정보를 복사하여 붙여넣는 번거로움을 없애고, 할루시네이션(환각) 없이 실시간 데이터에 기반한 정확한 코드 리뷰와 이슈 관리가 가능해집니다. 결과적으로 AI 에이전트는 단순한 조력자를 넘어 프로젝트의 상태를 직접 파악하고 작업을 수행하는 강력한 도구로 진화합니다. ### MCP를 통한 AI와 GitLab의 연결 * **개방형 표준 활용:** MCP는 AI 도구가 런타임에 외부 기능을 발견하고 사용할 수 있게 해주는 표준 프로토콜로, 이를 통해 AI 어시스턴트가 GitLab 이슈 읽기, MR 댓글 작성, 파이프라인 상태 확인 등을 직접 수행할 수 있습니다. * **간편한 서버 실행:** `glab mcp serve` 명령어를 실행하는 것만으로 MCP 서버를 구동하여 Claude Code, Cursor 등 다양한 AI 클라이언트와 연결할 수 있습니다. * **구조화된 JSON 데이터:** MCP를 통해 호출되는 모든 `glab` 명령은 자동으로 `--output json` 형식을 사용하여, AI 에이전트가 파싱하기 쉬운 깨끗하고 정제된 데이터를 제공합니다. * **안정성 확보:** 터미널의 대화형 입력이 필요한 명령은 제외하고 에이전트 환경에서 신뢰할 수 있게 작동하는 명령 위주로 노출하여 작업 중단 오류를 방지합니다. ### AI 기반 코드 리뷰 자동화 * **전체 컨텍스트 파악:** `glab mr view --comments --unresolved` 명령을 사용하면 MR의 메타데이터, 설명, 해결되지 않은 모든 토론 내용을 단일 JSON 페이로드로 가져와 AI에게 전달할 수 있습니다. * **효율적인 피드백 요약:** 사용자는 여러 탭을 오가는 대신 AI에게 "MR에서 해결해야 할 사항이 무엇인가?"라고 질문하여 우선순위가 지정된 요약과 제안된 변경 사항을 즉시 받을 수 있습니다. * **프로그래밍 방식의 처리:** AI가 피드백을 반영한 후 `glab mr note resolve` 명령을 직접 실행하여 토론을 해결 상태로 변경하는 등 코드 리뷰의 전 과정을 자동화된 루프 내에서 처리할 수 있습니다. ### 실시간 데이터 기반의 이슈 분석 및 디버깅 * **정확한 정보 제공:** 웹 UI에서 텍스트를 복사해 붙여넣는 방식은 정보가 누락되거나 왜곡될 위험이 크지만, `glab`은 이슈 번호, 마일스톤, 라벨 등의 속성을 정확한 구조로 제공합니다. * **훈련 데이터 한계 극복:** AI가 과거의 학습 데이터나 웹 스크래핑에 의존하지 않고, API를 통해 실시간 프로젝트 상태를 조회하므로 파이프라인 실패 원인 분석이나 이슈 분류 시 정확도가 비약적으로 향상됩니다. * **워크플로우 마찰 감소:** 에이전트가 직접 GitLab 데이터를 가져오고 보고하기 때문에 개발자는 정보 전달자 역할에서 벗어나 실제 문제 해결에 더 집중할 수 있습니다. 반복적인 코드 리뷰 분석이나 이슈 트리이징(Triage) 시간을 줄이고 싶다면 `glab` CLI를 MCP 서버로 활용해 보세요. 특히 Claude나 Cursor와 같은 최신 AI 도구를 사용 중이라면, `glab mcp serve`를 통해 AI 에이전트에게 GitLab 프로젝트에 대한 직접적인 실행력을 부여함으로써 진정한 자율 개발 환경을 구축할 수 있습니다.

toss원문

토스플레이스 데이터봇 ‘판다(PANDA)’를 소개합니다 : 모든 팀원이 데이터 전문가처럼 일하는 방법 (새 탭에서 열림)

토스플레이스는 데이터 분석가에게 집중된 단순 추출 요청을 해결하고 전사적인 데이터 민주주의를 실현하기 위해 AI 데이터 분석 어시스턴트 ‘판다(PANDA)’를 개발했습니다. 판다는 단순한 챗봇을 넘어 표준 데이터 마트 정비와 에이전트 기반의 자율 루프 시스템을 통해 데이터 조회부터 실무 인사이트 제공까지 수행하며, 출시 후 전사 구성원의 70%가 활용하는 필수적인 도구로 자리 잡았습니다. 기술적 복잡함보다 비즈니스 맥락과 데이터 거버넌스에 집중함으로써, 누구나 데이터 분석가의 도움 없이도 정확한 의사결정을 내릴 수 있는 환경을 구축했다는 데 큰 의의가 있습니다. ### 데이터 신뢰성을 위한 표준 데이터 마트(SSOT) 구축 * AI가 일관된 답을 낼 수 있도록 Data Analysis와 Platform 팀이 협업하여 핵심 데이터를 단일화된 테이블로 정비했습니다. * **표준 네이밍 컨벤션:** 테이블명은 `{역할}_{도메인}_{주제}`(예: fact_device_error_log)로, 컬럼명은 `{접두어}_{대상}_{속성}_{접미어}`(예: is_merchant_active)로 규칙화하여 AI가 이름만으로도 데이터의 목적을 이해하게 했습니다. * 모든 테이블과 컬럼에 상세 설명을 추가하여 AI가 데이터를 정확하게 탐색할 수 있는 기반 정보를 제공했습니다. ### 데이터 선택의 정확도를 높이는 Scoring & Ranking 시스템 * 질문에 대해 매번 다른 테이블을 선택하는 문제를 방지하기 위해 유사도와 신뢰도를 결합한 점수 체계를 도입했습니다. * **최종 점수 산출:** `(질문-테이블 유사도) × (데이터 계층 가중치)` 공식을 적용합니다. * **계층별 가중치:** 전사 주요 지표(SSOT)는 4배, 검증된 표준 마트는 3배, 도메인 마트는 2배, 원시 로그 데이터는 1배의 가중치를 부여하여 가장 신뢰할 수 있는 소스를 우선 선택하게 합니다. * dbt tags를 활용해 관리되는 테이블만 Manifest 파일로 가져와 탐색 범위를 최적화했습니다. ### 비즈니스 맥락 연결과 에이전틱 루프(Agentic Loop) * ‘설치 매장’이나 ‘업종 분류’와 같은 비즈니스 용어 정의를 데이터 구조와 연결하여 AI가 단순 수치 이상의 맥락을 파악하도록 설계했습니다. * AI가 스스로 상황에 맞는 도구를 선택하고, 결과가 부정확할 경우 스키마를 다시 확인하여 쿼리를 수정 및 재실행하는 자율적 재시도 과정을 거칩니다. * '테이블 탐색 → 쿼리 실행 → 결과 검증 → 수정 → 최종 결과 도출'의 과정을 반복하며 정답률을 높이는 구조를 갖췄습니다. ### 실무 활용성을 고려한 답변 구조 및 성과 * 단순 숫자 나열이 아니라 **결과, 조회 기준, 실무 인사이트**라는 3단계 구조로 답변을 제공하여 사용자의 해석 시간을 단축했습니다. * 출시 직후 전체 팀원의 절반 이상이 사용했으며, 현재는 70%의 사용률을 기록하며 데이터 요청에 대한 심리적 문턱을 낮추고 실질적인 업무 방식의 변화를 이끌어냈습니다. * 개발자, 기획자 등 비데이터 직군에서도 활발히 사용하며 데이터 분석가의 리소스를 고부가가치 분석 업무에 집중할 수 있도록 지원합니다. 성질 급한 AI 모델의 성능에만 의존하기보다, **데이터의 표준화와 비즈니스 로직의 명확한 정의(Governance)**가 선행될 때 비로소 실효성 있는 AI 서비스가 완성된다는 점을 시사합니다. 사내 데이터 민주화를 고민한다면, 기술적 기교 이전에 AI가 읽기 좋은 데이터 환경을 만드는 것부터 시작할 것을 추천합니다.

gitlab원문

GitLab AI 해커톤 2026: 수상자를 만나보세요 (새 탭에서 열림)

GitLab AI 해커톤 2026은 단순한 코드 생성을 넘어 보안, 컴플라이언스, 배포 등 소프트웨어 개발 전 과정을 자율적으로 수행하는 600개 이상의 AI 에이전트 생태계를 확인한 자리였습니다. 구글 클라우드 및 앤스로픽(Anthropic)과 협업한 이번 행사에는 약 7,000명의 개발자가 참여하여, 실질적인 워크플로우에 통합되어 팀을 대신해 행동하는 혁신적인 솔루션들을 대거 선보였습니다. 이는 AI가 챗봇 형태를 벗어나 복잡한 엔지니어링 문제를 해결하는 능동적인 에이전트로 진화했음을 입증하는 결과입니다. ### 조직 지식 보존과 시스템 이해: LORE 및 GraphDev * **대상(Grand Prize) 수상작 'LORE'**: 8개의 에이전트와 라우터를 활용해 엔지니어의 머릿속에만 있던 '암묵적 지식'을 기록하고 관리합니다. 지식 그래프의 순환 루프 방지 로직과 탄소 추적 기능을 갖췄으며, 해커톤 프로젝트임에도 43개의 테스트 코드를 포함할 정도로 완성도가 높습니다. * **Anthropic 부문 우승작 'GraphDev'**: 코드 간의 연결 고리를 매핑하여 시스템이 시간에 따라 어떻게 변하는지 보여줍니다. 코드 변경 시 미칠 영향을 사전에 시각화하여 복잡한 시스템의 진화 과정을 쉽게 파악할 수 있도록 돕습니다. * **RepoWarden**: 코드의 기능뿐만 아니라 '왜' 그렇게 작성되었는지를 캡처하는 '리빙 스펙 엔진(Living Specification Engine)' 역할을 수행합니다. ### 보안 및 컴플라이언스 자동화 * **보안 자동화 솔루션**: 구글 클라우드 부문 우승작 'Gitdefender'는 코드 리뷰 중 보안 문제를 발견하면 즉시 수정 코드를 작성하고 리뷰를 생성합니다. 'RedAgent'는 AI가 생성한 보안 보고서를 재검증하여 AI 진단 결과에 대한 신뢰 격차를 해소합니다. * **컴플라이언스 관리**: 'Compliance Sentinel'은 머지 요청(MR)의 리스크를 점검해 위반 사항이 있으면 차단하며, 'MR Compliance Auditor'는 증거 자료를 수집해 SOC 2 통제 항목과 매핑한 후 실시간 대시보드로 송출합니다. * **SecurityMonkey**: 테스트 브랜치에 알려진 취약점을 주입하여 현재 보안 스캐너가 이를 얼마나 잘 잡아내는지 점검하는 독특한 접근 방식을 선보였습니다. ### 기술적 완성도와 운영 효율화 * **안전한 마이그레이션**: 'Time-Traveler'는 운영 환경의 복제본을 생성하여 데이터베이스 마이그레이션을 선제적으로 실행해 봄으로써 배포 실패를 방지합니다. 5개의 에이전트가 브릿지로 연결되어 실제 PostgreSQL 환경에서 작동합니다. * **모바일 기반 워크플로우**: 'stregent'는 개발자가 노트북 없이도 WhatsApp을 통해 CI/CD 파이프라인을 모니터링하고 수정 사항을 머지할 수 있는 모바일 우선 경험을 제공합니다. * **문서화 에이전트 'DocSync'**: 감지(Detector), 작성(Writer), 검토(Reviewer)라는 세 단계 에이전트 체계를 통해 문서화 작업을 자동화하며, 신뢰도가 낮을 경우 사람에게 이슈를 생성해 검토를 요청합니다. ### 지속가능성을 고려한 그린 에이전트(Green Agent) * **탄소 배출 최적화**: 'GreenPipe'와 'CarbonLint' 등은 CI/CD 파이프라인과 LLM 실행에 따른 탄소 발자국을 측정하고 보고서를 생성합니다. * **운영 비용 절감**: 일부 프로젝트는 모델 최적화와 에너지 효율적인 아키텍처 설계를 통해 운영 비용을 월 $556에서 $18로 약 96% 절감하는 성과를 거두었습니다. * **실시간 최적화 팁**: 'Carbon Tracker'는 각 파이프라인 작업의 탄소 배출량을 계산하여 머지 요청 시 최적화 팁을 자동으로 댓글로 남겨줍니다. 이제 AI 에이전트는 단순한 도구를 넘어 로컬 지식 그래프와 결합하여 코드의 맥락과 역사를 이해하는 방향으로 발전하고 있습니다. 기업들은 GitLab Duo Agent Platform과 같은 환경을 통해 보안 점검, 데이터베이스 마이그레이션, 컴플라이언스 준수와 같은 고난도 수동 작업을 자동화함으로써 엔지니어링 생산성을 획기적으로 높일 수 있을 것입니다.

spotify4분 읽기큐레이션 요약

LLM 평가로 더 나은 실험하기 — 포크가 아닌 퍼널 | Spotify Engineering

LLM 평가(evals)는 실험을 대체하는 도구가 아니라, 실험 전에 유망한 후보를 걸러내고 실험 후 판단 기준을 보정하는 퍼널의 일부다. Evals는 출력의 품질과 의도 부합 여부를 검증하지만, 실제 사용자의 행동과 사업 성과까지 검증하지는 못한다. 따라서 오프라인 평가와 온라인 A/B 테스트를 반복적으로 연결해야 실험 성공률과 평가 모델의 신뢰도를 함께 높일 수 있다. ## Evals와 실험의 역할 차이 - **Evals는 검증(verification)**을 담당한다. - 출력이 관련성, 일관성, 어조, 의도 부합성 등 정해진 품질 기준을 만족하는지 평가한다. - 대규모 데이터에서 사람의 수작업 평가보다 빠르고 저렴하게 후보를 비교할 수 있다. - **실험은 검증(validation)**을 담당한다. - 실제 사용자가 변경된 결과에 어떻게 반응하는지 확인한다. - 개선된 출력이 참여도, 유지율, 매출 등 실제 사업 성과로 이어지는지 측정한다. - 따라서 관계는 “eval 또는 실험”이라는 분기가 아니라, **eval로 후보를 좁힌 뒤 실험으로 사업 효과를 확인하는 퍼널**이어야 한다. - Spotify의 사례에서도 A/B 테스트 중 긍정적인 결과로 출시되는 비율은 약 12%지만, 약 64%는 회귀를 발견하거나 가설을 수정하는 등 유효한 학습을 제공한다. ## Evals가 제공하지만 제공하지 못하는 것 - LLM judge는 다음과 같은 품질 문제를 대규모로 탐지할 수 있다. - 사용자 의도와 맞지 않는 추천 - 신뢰를 훼손하는 콘텐츠 - 응답의 관련성, coherence, 어조 문제 - 평가 과정에서 팀이 예상하지 못한 문제 패턴을 발견할 수 있다. - 예를 들어 부적절한 추천이 특정 사용자군이나 상황에서 반복된다는 사실을 찾아낼 수 있다. - 발견된 패턴은 제품 개선 가설이 된다. - 같은 judge를 수정 후에도 사용하면 문제가 실제로 줄었는지 확인할 수 있다. - 문제가 되는 평가 항목의 발생 빈도가 감소하면 구현 품질이 개선된 것으로 볼 수 있다. - 그러나 eval만으로는 다음을 알 수 없다. - 사용자의 장기 참여도가 높아졌는지 - 이탈이나 churn이 줄었는지 - 시스템 전체에서 예상치 못한 부작용이 발생했는지 - Spotify에서는 출시된 실험의 약 42%가 세션 길이, 충돌률, 유지율 등 **최적화 대상이 아니었던 보조 지표의 회귀** 때문에 되돌려졌다. 이런 문제는 오프라인 eval에서 포착되지 않을 수 있으므로 온라인 실험과 가드레일 지표가 필요하다. ## 두 단계의 보정과 평가 드리프트 - Evals는 실제 성과를 직접 측정하는 것이 아니라, 성과를 대신하는 **프록시 점수**다. - 기존의 정량 지표(랭킹 점수, precision, recall) 위에 LLM judge라는 또 하나의 보정 계층이 추가된다. - 두 계층 모두 실제 온라인 결과와 비교해 보정해야 한다. - judge가 더 높은 점수를 준 변형이 실제로 더 나은 사용자 경험을 제공하는가? - judge가 실질적 가치가 아닌 표면적 문체나 특정 패턴을 보상하고 있지는 않은가? - 평가 기준은 시간이 지나면서 드리프트할 수 있다. - 모델, 사용자 행동, 콘텐츠 유형, 제품 목표가 바뀌면 기존 judge의 점수와 실제 성과의 관계가 약해질 수 있다. - Qodo의 코딩 eval에서는 Anthropic의 Opus 4.5가 개선되지 않은 것처럼 보였지만, 실제로는 긴 작업에서 성능이 크게 향상된 사례가 있었다. - 반대로 eval 점수는 좋아졌지만 실제 사용자 성과가 개선되지 않는 경우도 가능하다. - 따라서 오프라인 점수와 온라인 결과를 지속적으로 비교해야 eval이 단순한 의견이 아니라 신뢰할 수 있는 증거가 된다. ## 실험 전후를 연결하는 피드백 루프 - **실험 전** - 여러 후보를 LLM eval로 평가한다. - 품질 기준을 충족하지 못하는 후보를 제거한다. - 남은 후보에 실험 리소스를 집중해 실험의 적중률을 높인다. - **실험 중** - 주요 사업 지표뿐 아니라 최적화하지 않은 가드레일 지표도 관찰한다. - 세션 길이, 오류율, 충돌률, 유지율처럼 회귀 가능성이 있는 지표를 함께 확인한다. - **실험 후** - A/B 테스트에 사용된 실제 데이터에 eval을 다시 적용한다. - judge가 선호한 변형이 실제 사용자 성과도 개선했는지 비교한다. - eval 점수와 실험 결과 사이의 차이를 다음 평가 기준을 개선하는 신호로 활용한다. - 결과가 어느 쪽이든 학습이 발생한다. - eval과 사용자 성과가 함께 개선되면 judge가 가치 있는 품질 요소를 측정하고 있다는 뜻이다. - eval만 개선되고 사용자 성과가 그대로라면 judge가 사업 성과와 무관한 요소를 측정하고 있다는 뜻이다. ## 상황에 따른 실험 강도 - 모든 변경에 동일한 수준의 증거를 요구할 필요는 없다. - 빠른 반복 단계에서는 방향성을 파악하기 위한 간단한 테스트를 사용할 수 있다. - 출시 결정이나 영향 범위가 큰 변경에는 충분한 표본, 장기 지표, 가드레일을 포함한 엄격한 실험이 필요하다. - 시스템이 복잡할수록 실험을 생략해 발생하는 대규모 회귀 위험이 커진다. 실무적으로는 LLM eval을 **후보 선별과 품질 진단**에 사용하고, 최종 출시는 반드시 사용자 대상 실험과 가드레일 지표로 판단하는 방식이 권장된다. 실험 결과를 다시 eval 보정에 반영하면 시간이 지날수록 더 정확한 평가 체계를 구축할 수 있다.

원문 읽기(새 탭에서 열림)
google원문

핵심은 각도: 사진의 재구성 (새 탭에서 열림)

구글은 기존 사진의 구도와 카메라 각도를 촬영 후에 자유롭게 재구성할 수 있는 '오토 프레임(Auto frame)' 기능을 구글 포토에 도입했습니다. 이 기술은 단순한 크롭(자르기)이나 줌을 넘어, 2D 사진을 3D 장면으로 해석하고 생성형 AI를 활용해 가상의 카메라 위치에서 바라본 새로운 시점의 이미지를 구현합니다. 이를 통해 사용자는 인물의 왜곡을 바로잡거나 촬영 당시 놓쳤던 배경까지 포함된 완벽한 구도의 사진을 얻을 수 있습니다. **기존 편집 방식의 한계와 새로운 접근법** * 전통적인 크롭이나 줌 방식은 이미 고정된 시점 내에서만 작동하므로 시차(Parallax)를 변경하거나 프레임 밖의 영역을 보여줄 수 없다는 근본적인 한계가 있었습니다. * 구글의 새로운 방식은 사진을 단순한 평면이 아닌 '시간 속에 얼어붙은 3D 장면'으로 취급하여, 가상 공간 안에서 카메라의 위치와 각도를 자유롭게 이동시키는 방식을 취합니다. * 이 과정은 원래 보였던 부분을 유지하면서도 이전에 가려졌던 콘텐츠를 지능적으로 생성하여 실제와 같은 새로운 원근감을 형성합니다. **3D 장면 추정과 카메라 파라미터 최적화** * 내부적인 3D 포인트 맵(3D point map) 추정 모델을 통해 사진 속 모든 픽셀의 깊이와 표면 정보를 파악하며, 특히 인물의 정체성을 보존하기 위해 신체와 얼굴 재구성에 특화된 모델을 사용합니다. * 원래 사진 촬영 당시의 초점 거리(Focal length)를 근사치로 계산하여 가상 카메라의 위치(Pose)와 내부 파라미터(Intrinsics)를 정교하게 조정할 수 있게 합니다. * 이러한 3D 추정 단계와 이미지 생성 단계를 분리함으로써, 단순한 픽셀 변형이 아닌 물리적으로 타당한 카메라 조작이 가능해졌습니다. **생성형 잠재 확산 모델을 통한 공백 보완** * 가상 카메라를 이동시키면 원래 렌즈에 포착되지 않았던 배경 영역에 '구멍(Holes)'이 생기는데, 이를 해결하기 위해 생성형 잠재 확산 모델(Latent Diffusion Model)을 사용하여 자연스럽게 채워 넣습니다. * 이 모델은 카메라 파라미터 데이터셋을 기반으로 훈련되었으며, 렌더링된 추정치를 보정하고 보충하여 최종 이미지를 완성합니다. * 추론 시에는 특정 지역 스케일링(Regional scaling) 기법이 포함된 분류기 가이드 방식을 사용하여 원본의 핵심 콘텐츠를 충실히 유지하면서도 생성형 AI의 창의성을 발휘해 빈 공간을 메웁니다. **지능형 자동 프레이밍 및 왜곡 수정** * 머신러닝 모델이 주요 피사체의 얼굴 위치와 3D 방향을 감지하여 포트레이트 사진에 최적화된 구도를 자동으로 계산하고 제안합니다. * 특히 광각 전면 카메라로 촬영 시 발생하는 원근 왜곡(가까운 피사체가 비정상적으로 크게 보이는 현상)을 자동으로 감지합니다. * 가상 카메라의 특성을 조정해 피사체에서 물리적으로 한 발짝 뒤로 물러나 찍은 듯한 효과를 주어, 훨씬 더 자연스럽고 보기 좋은 비율을 복원합니다. 현재 이 기술은 구글 포토의 '오토 프레임' 기능 내에서 자동 편집 옵션으로 제공되고 있습니다. 사용자는 별도의 복잡한 작업 없이 클릭 한 번으로 3D 인지 기술이 적용된 최적의 구도를 추천받을 수 있으므로, 구도가 아쉬운 인물 사진이나 왜곡이 심한 셀피를 개선하는 데 유용하게 활용할 수 있습니다.