GitHub Copilot CLI, 세컨드 오피니언을 위해 여러 모델 제품군 결합 (새 탭에서 열림)
GitHub Copilot CLI가 주 모델과 다른 AI 계열의 모델을 활용해 작업을 검토하는 실험 기능 Rubber Duck을 공개했습니다. Rubber Duck은 계획 수립, 복잡한 구현, 테스트 작성 후처럼 오류를 조기에 발견하기 좋은 시점에 독립적인 피드백을 제공합니다. 평가 결과 Claude Sonnet과 GPT-5.4 기반 Rubber Duck 조합은 Sonnet과 Opus 단독 실행 성능 차이의 74.7%를 줄였습니다.
자신감 있는 실수가 누적되는 문제
- 코딩 에이전트는 일반적으로 다음 순서로 작업합니다.
- 요구사항 분석
- 계획 수립
- 구현
- 테스트
- 문제 발생 시 반복 수정
- 초기 계획의 잘못된 가정이나 비효율은 이후 구현의 기반이 되어 오류를 연쇄적으로 키울 수 있습니다.
- 에이전트가 자신의 결과를 스스로 검토하는 방식도 도움이 되지만, 동일한 모델은 같은 학습 데이터와 편향, 맹점을 공유합니다.
- 따라서 자기 검토만으로는 발견하기 어려운 문제를 찾기 위해 다른 모델 계열의 관점이 필요합니다.
다른 모델 계열을 활용하는 Rubber Duck
- Rubber Duck은 주 에이전트의 계획과 작업을 검토하는 전문 리뷰 에이전트입니다.
- 현재 Claude 모델을 주 오케스트레이터로 선택하면 Rubber Duck은 GPT-5.4를 사용합니다.
- 검토 결과는 다음과 같은 고가치 우려 사항을 짧고 집중적으로 제시합니다.
- 주 에이전트가 놓친 세부 사항
- 다시 검토해야 할 가정
- 잠재적인 엣지 케이스
- 현재 Claude Opus, Sonnet, Haiku를 주 모델로 사용할 때 활성화할 수 있으며, 향후 다른 모델 조합도 실험할 예정입니다.
복잡한 작업에서의 효과
- SWE-Bench Pro의 실제 오픈소스 프로젝트 기반 대형 코딩 문제로 평가했습니다.
- Claude Sonnet 4.6과 GPT-5.4 Rubber Duck 조합은 Claude Opus 4.6 단독 실행과 유사한 해결률을 기록했습니다.
- Sonnet과 Opus의 성능 차이 중 74.7%를 줄였습니다.
- 특히 다음 조건의 작업에서 효과가 컸습니다.
- 3개 이상의 파일을 수정하는 작업
- 70단계 이상이 필요한 장기 작업
- 복잡한 리팩터링과 아키텍처 변경
- 성능 개선 폭은 일반적으로 Sonnet 기준 3.8%, 가장 어려운 문제에서는 4.8%였습니다.
Rubber Duck이 발견한 오류 사례
- 스케줄러의 구조적 오류
- 스케줄러가 시작 직후 종료되어 작업을 하나도 실행하지 못하는 문제를 발견했습니다.
- 수정하더라도 내부 작업 중 하나가 무한 루프라는 추가 문제도 확인했습니다.
- 반복문으로 인한 데이터 손실
- 반복문이 매번 같은
dict키를 덮어쓰는 버그를 찾았습니다. - 그 결과 Solr 검색 요청에서 네 개의 facet 범주 중 세 개가 조용히 사라졌습니다.
- 반복문이 매번 같은
- 파일 간 데이터 흐름 단절
- 여러 파일이 Redis 키를 읽지만 새 코드가 해당 키를 더 이상 기록하지 않는 문제를 발견했습니다.
- 배포 후 이메일 확인 UI와 정리 작업이 조용히 고장 날 수 있는 상황이었습니다.
검토가 실행되는 시점
Rubber Duck은 필요성이 높은 체크포인트에서 자동으로 호출되거나 사용자가 직접 요청할 수 있습니다.
- 계획 작성 후
- 잘못된 설계 결정을 구현 전에 발견해 후속 오류의 누적을 막습니다.
- 복잡한 구현 후
- 여러 파일에 걸친 코드의 엣지 케이스와 구조적 문제를 점검합니다.
- 테스트 작성 후, 실행 전
- 테스트 커버리지의 공백이나 잘못된 단정을 찾아냅니다.
- 에이전트가 작업 루프에 빠졌을 때
- 진전이 없는 상황에서 새로운 관점을 제공해 막힌 지점을 해결합니다.
- 사용자 요청 시
- 사용자가 언제든 작업을 비판적으로 검토하도록 요청할 수 있습니다.
- Copilot은 피드백을 반영한 뒤 무엇이 어떻게 바뀌었는지 보여줍니다.
사용 방법과 적합한 활용 사례
- GitHub Copilot CLI를 설치한 뒤
/experimental명령으로 실험 기능을 활성화합니다. - 모델 선택기에서 Claude 모델을 선택하고 GPT-5.4 사용 권한이 있어야 합니다.
- Rubber Duck은 자동으로 호출되거나 “작업을 검토해 달라”고 요청해 수동 실행할 수 있습니다.
- 특히 다음 작업에 적합합니다.
- 복잡한 리팩터링
- 아키텍처 변경
- 실패 비용이 큰 고위험 작업
- 테스트 커버리지 검증
- 구현 전 계획에 대한 독립적인 의견 확인
Rubber Duck은 코딩 에이전트를 단순히 더 오래 실행하는 대신, 서로 다른 모델 계열의 관점으로 중요한 의사결정을 교차 검증하려는 접근입니다. 복잡하거나 영향 범위가 큰 작업에서는 계획 단계와 테스트 실행 전에 검토를 요청하는 것이 실용적인 활용법입니다.