agentic-workflow

2 개의 포스트

netflix4분 읽기큐레이션 요약

인과 추론을 위한 인간 증강 에이전틱 워크플로우

소프트웨어 에이전트가 관찰자료의 인과효과를 분석하더라도, 결과를 자동으로 신뢰해서는 안 된다. 이 글은 인간이 분석 계획과 가정을 제시하고, 에이전트가 분석·진단을 수행하며, 별도의 비평 에이전트가 결함과 신뢰도를 검토하는 인간 증강형 OCI(관찰적 인과추론) 워크플로를 소개한다. 핵심은 정답이 없는 관찰연구에서 분석 산출물을 투명하게 남기고 사람이 재현·감사할 수 있도록 하는 것이다. ## 관찰적 인과추론에서 에이전트 감독이 필요한 이유 - 에이전트는 데이터 조회, 회귀분석, 결과 보고를 자동화할 수 있지만, 숨은 교란이나 표본 선택 편향을 놓칠 수 있다. - 예를 들어 인기 Netflix 프로그램 시청자와 장기 회원 유지율을 비교할 때, 열성 팬을 일반 시청자처럼 취급하면 잘못된 인과효과가 나온다. - OCI는 도메인 지식과 가정에 대한 판단이 필요하므로, 반복적인 분석 작업은 자동화하되 질문 설정과 가정 검토는 사람이 담당해야 한다. - 저자들은 OCI 에이전트를 오픈소스로 공개하고, ACIC 2016 데이터셋 평가에서 단일 실행 방식보다 여러 데이터 생성 과정에서 우수한 성능을 보였다고 설명한다. ## 타깃 실험을 모방하는 분석 철학 - 실제로 수행하기 어렵거나 불가능한 이상적 A/B 테스트를 먼저 상상하고, 그 실험을 관찰자료로 얼마나 충실히 모방할 수 있는지 검토한다. - 이 사고방식은 처리(treatment), 결과(outcome), 분석 시점, 통제해야 할 사전 공변량을 명확히 하는 데 도움을 준다. - 특히 “비교 가능한 처리군과 통제군을 만들 수 있는가”와 “처리 배정이 관측된 공변량으로 충분히 설명되는가”가 중요하다. - 워크플로는 기본적으로 비관측 교란이 없다는 가정(unconfoundedness) 아래 설계되었지만, 평행추세를 사용하는 패널 분석 등 다른 OCI 방법에도 원칙을 확장할 수 있다. ## 네 가지 설계 진단 - **공변량 균형** - 가중치 적용 후 처리군과 통제군의 사전 공변량 표준화 평균 차이(Standardized Mean Difference)가 0.2 미만이어야 한다. - **겹침(Overlap)** - 처리받을 확률인 성향점수(propensity score)가 0.1~0.9 범위에 있어야 한다. - 특정 집단에서 처리 확률이 거의 0 또는 1이면 두 집단을 공정하게 비교하기 어렵다. - **플라시보 결과** - 처리 이전에 측정된 변수에 유의한 처리효과가 나타나지 않아야 한다. - 사전 결과에 효과가 나타나면 기존 집단 차이나 분석 설계 오류를 의심해야 한다. - **숨은 교란 민감도** - 관측되지 않은 변수가 처리와 결과를 동시에 설명한다고 가정했을 때 결론이 얼마나 흔들리는지 평가한다. - 효과의 크기뿐 아니라 결과가 어떤 수준의 숨은 교란에 견디는지도 함께 보고한다. ## Actor–Critic 구조와 역할 분담 - **Principal(인간 사용자)** - 분석 목적과 맥락을 담은 초기 계획을 작성한다. - 주요 위협 요인과 통제해야 할 교란변수를 제시한다. - 사용할 수 있는 도구, 데이터 모델, 데이터셋을 지정한다. - 실행된 노트북과 비평 보고서를 검토한다. - **Actor(분석 에이전트)** - 인간의 계획을 구체적인 데이터 분석 명세로 정제한다. - 허용된 도구만 사용해 분석한다. - 계획, 명세, 코드, 도표, 노트북 등 사람이 읽고 기계적으로도 점검할 수 있는 산출물을 만든다. - 네 가지 설계 진단을 수행하고, 진단 실패 시 어떤 보정 조치를 취했는지 기록한다. - **Critic(비평 에이전트)** - 계획에서 빠진 교란변수나 맹점을 찾는다. - 계획·분석 명세·실제 실행 결과가 일치하는지 확인한다. - 진단 결과를 바탕으로 결과의 신뢰도 수준을 제시한다. - 성향점수 절단(trimmed propensity score) 등으로 인해 추정 대상이 ATE(평균처리효과)와 어떻게 달라졌는지 설명한다. - 실행된 분석을 이상적인 무작위대조시험(RCT)과 비교한다. - 권장 RCT나 장려(encouragement) 실험 등 최소 하나의 대안적 측정 전략을 제안한다. ## 정답 대신 과정 감사를 활용하는 평가 - 실제 관찰자료에는 참된 인과효과라는 명확한 ground truth가 없으므로, 출력값만 정답과 비교하는 방식에는 한계가 있다. - 따라서 에이전트는 분석 계획, 명세, 시각화, 실행 노트북, 보고서 같은 중간 산출물을 남긴다. - 인간 사용자는 이 자료를 직접 읽거나 다운로드해 다시 실행하면서 각 분석 단계와 가정을 감사할 수 있다. - 보고서는 버전 관리하고 실행된 노트북은 파일 저장소에 업로드해 재현성을 높인다. - Netflix의 검증된 비에이전트 OCI 도구는 이 과정을 지원하며, 인과효과 추정에는 이중강건 학습(doubly robust learning)을 사용한다. ## 실용적인 결론 에이전트에게 인과분석 전체를 맡기기보다, 인간이 질문·가정·데이터 사용 범위를 정하고 에이전트가 반복 계산과 진단을 수행하도록 역할을 분리하는 것이 안전하다. 특히 공변량 균형, 겹침, 플라시보, 민감도 분석 결과와 재실행 가능한 노트북을 함께 검토해야 하며, 관찰연구의 결론을 이상적인 RCT와 비교해 신뢰도와 한계를 명시하는 것이 바람직하다.

원문 읽기(새 탭에서 열림)
toss5분 읽기큐레이션 요약

토스팀이 AI 파도를 마주하는 방법: AI Surf Day

토스는 빠르게 변하는 AI를 따라잡기 위해 개인의 학습에만 의존하지 않고, 업무 시간과 조직 문화를 재설계하는 ‘AI Surf Day’를 운영했다. 매주 금요일을 AI 실험과 공유의 시간으로 정해 직군과 숙련도에 관계없이 누구나 AI를 업무에 적용하도록 지원했다. 이 경험은 특정 프로그램보다 자유롭게 시도하고 실패와 성과를 공유하는 문화, 그리고 이를 이끄는 사람들이 AI 전환의 핵심임을 보여준다. ## AI Surf Day의 배경과 목적 - AI 기술이 빠르게 발전하면서 개발자뿐 아니라 PO, 디자이너, 스태프 등 모든 직군에서 AI 활용에 대한 관심이 커졌다. - 반면 비개발 직군을 중심으로 다음과 같은 어려움도 나타났다. - 수많은 AI 정보 중 실제 업무에 유용한 것을 선별하기 어려움 - 새로운 기술을 학습할 별도 시간을 내기 어려움 - AI를 잘 활용하는 사람과 그렇지 못한 사람 사이의 격차와 불안 - 토스는 월요일부터 목요일까지 본업에 집중하고, 매주 금요일은 AI를 실험하고 업무에 적용하는 ‘AI Surf Day’로 운영했다. - 목표는 단순히 AI 도구 사용법을 익히는 것이 아니라, 토스 전체가 AI 기반으로 일하는 문화를 만드는 것이었다. - “파도를 멈출 수는 없지만 서핑하는 방법은 배울 수 있다”는 비유처럼, 예측하기 어려운 AI 변화에 조직적으로 대응하려는 취지를 담았다. ## AI Surf Club: 자율적인 실험과 학습 - 팀원 누구나 AI 관련 주제로 모임을 만들고 참여할 수 있는 핵심 프로그램이다. - 시작과 함께 약 200개의 클럽이 만들어질 만큼 높은 참여가 나타났다. - 대표적인 사례는 다음과 같다. - **AI 안티패턴 스터디** - AI 활용이 잘되지 않았던 시행착오와 실패 사례를 공유했다. - 프로젝트 방향을 잡고 실수를 줄이는 데 도움이 되는 ‘시행착오 방지 가이드’로 내용을 정리했다. - **LLM Wiki 활용법** - 업무 지식이 여러 곳에 흩어진 문제를 해결하기 위해 조직 공동의 지식 자산 구축을 논의했다. - 데이터 엔지니어, 머신러닝 엔지니어, 비즈니스 담당자 등 다양한 직군이 참여해 관점을 넓혔다. - **터미널 초보자를 위한 0단계 모임** - 에이전트 도구 설치나 터미널 사용처럼 기본적인 기술 장벽을 해결했다. - 초보적인 질문도 부담 없이 할 수 있는 안전한 학습 공간을 제공했다. - **금융소비자보호 업무의 AI 전환** - “상담 과정에서 미리 민원을 발견하고 싶다”는 요구에서 출발해 한 달 만에 대외민원 모니터링 포털을 개발했다. - 민원 회신문 초안 작성과 민원 분류 자동화 등 추가 결과물도 만들어냈다. - 가장 큰 성과는 구성원들이 “우리도 AI로 해볼 수 있다”는 자신감을 얻은 점이었다. - **비즈니스 마케팅 팀의 AI 워크숍** - Builder, Curator, Operator, Scouter로 역할을 나누어 AI 도구, 사례, 자동화 결과물을 만들고 공유했다. - 개인의 실험을 다른 팀원이 복제하거나 업무에 적용할 수 있는 자산으로 남기는 데 초점을 맞췄다. ## AI Surf Weekly: 사례와 아이디어의 확산 - 사내 AI 활용 우수 사례, 레슨런, 최신 AI 인사이트를 공유하는 시간이다. - 구체적인 도구 사용법을 일방적으로 교육하기보다, 실제 사례를 보여주고 새로운 아이디어를 떠올리게 하는 방식을 택했다. - 서로 다른 조직의 유사한 문제를 가진 구성원을 연결해 단시간에 결과물을 만들도록 돕기도 했다. - 영업팀의 요구와 유사한 도구를 만든 인사팀 구성원을 연결해 빠르게 업무 도구를 개발했다. - 디자인 자동화에 어려움을 겪던 마케팅 담당자를 디자인 조직의 경험자와 연결해 하루 만에 문제를 해결했다. - 잘 쓰는 사람과 실제 결과물을 공유하면, 구성원들이 자신의 업무에 맞게 응용하면서 새로운 활용 사례가 파생된다는 점을 확인했다. ## AI Surf Evangelist: 현업 중심의 전파 체계 - 조직에서 AI를 잘 활용한다는 것은 개인이 도구를 능숙하게 쓰는 것이 아니라, 기존 업무 흐름을 AI 기반으로 재설계하는 것이다. - 이를 가장 잘 이끌 사람은 실제 업무와 팀의 문제를 잘 아는 현업 구성원이라고 판단했다. - 토스는 AI 기술 전문가보다 다음과 같은 구성원을 에반젤리스트로 선발했다. - 유용한 정보를 발견하면 팀에 공유하는 사람 - 동료가 AI 활용 중 막혔을 때 함께 해결하는 사람 - AI 도입과 전파에 적극적인 사람 - 공개 추천을 통해 이미 비공식적으로 이런 역할을 수행하던 사람을 발굴했고, 총 142명이 선정됐다. - 주요 미션은 다음과 같다. - 3개월 동안 조직 내 AI 활용 사례를 공유 채널에 제보 - 팀 대상 밋업이나 워크숍을 최소 1회 개최 - 유용한 사례와 인사이트를 조직에 전파 - 문화팀은 워크숍 템플릿과 퍼실리테이션을 지원해 각 팀이 ‘업무를 AI 기반으로 재설계한다면?’을 주제로 실험하도록 도왔다. ## OpenAI 협업과 에이전틱 워크플로우 - 5월에는 OpenAI와 협업해 개발자용 Codex 세션, 비개발자용 ChatGPT Agent 자동화 세션, 미니 해커톤을 진행했다. - **iOS Simulator 자동 검증 에이전트** - Codex가 기능 구현, 빌드, 로그인, 입력, 테스트, 수정 과정을 직접 수행했다. - 계획부터 검증 영상 생성까지의 전체 루프를 자동화했다. - **토스플레이스 메뉴 분류 어드민** - AI 에이전트가 매일 상품 데이터를 조회하고 사전 정의된 기준에 따라 1차 분류한다. - 담당자는 알림 링크를 통해 결과를 확인하고 확정 또는 반려한다. - 단순 반복 업무를 재사용 가능한 Agentic Workflow로 전환한 사례다. ## 프로그램보다 중요한 문화와 사람 - AI Surf Day는 6월까지 운영될 예정이지만, 이후 동일한 형식으로 지속될지는 정해지지 않았다. - 글에서 중요하게 본 성과는 특정 프로그램 자체가 아니라 다음과 같은 변화다. - AI를 실험할 수 있도록 공식적인 시간대를 마련함 - 성공뿐 아니라 실패와 시행착오도 공유함 - 서로 다른 팀의 사례와 사람을 연결함 - 워크숍과 결과물이 실제 업무 방식의 변화로 이어짐 - AI 전환을 추진하는 조직이라면 별도 학습 시간을 보장하고, 현업의 자발적 실험을 지원하며, 결과물을 조직 자산으로 공유하는 구조부터 만드는 것이 효과적이다.

원문 읽기(새 탭에서 열림)