큐레이션 요약
Amazon Bedrock, 새로운 고급 프롬프트 최적화 및 마이그레이션 도구 출시 | Amazon Web Services
Amazon Bedrock의 Advanced Prompt Optimization은 여러 모델에서 프롬프트를 자동으로 개선하고, 기존 프롬프트와 최적화된 프롬프트의 성능을 비교하는 도구입니다. 사용자는 예시 입력, 정답 데이터, 평가 기준을 제공하면 되며, 모델 마이그레이션이나 현재 모델의 성능 개선에 활용할 수 있습니다. 최적화 결과로 프롬프트, 평가 점수, 비용 추정치, 지연 시간이 함께 제공됩니다.
여러 모델을 동시에 비교하는 프롬프트 최적화
- 최대 5개의 Amazon Bedrock 추론 모델을 선택할 수 있습니다.
- 새 모델로 마이그레이션하는 경우:
- 현재 모델을 기준선으로 선택
- 최대 4개의 후보 모델과 성능 비교
- 모델을 변경하지 않는 경우에도 현재 모델의 최적화 전후 결과를 비교할 수 있습니다.
- 알려진 사용 사례에서 성능 저하가 없는지 확인하거나, 성능이 낮은 작업을 개선하는 데 사용할 수 있습니다.
입력 데이터와 JSONL 템플릿
- 프롬프트 템플릿은 JSONL 형식으로 준비해야 합니다.
- 각 JSON 객체는 한 줄에 작성해야 합니다.
- 주요 필드는 다음과 같습니다.
version: 고정값bedrock-2026-05-14templateId: 프롬프트 템플릿 식별자promptTemplate: 최적화할 프롬프트evaluationSamples: 입력 변수와 선택적 기준 응답steeringCriteria: 자연어 기반 최적화 기준customLLMJConfig: 사용자 정의 LLM 평가 설정evaluationMetricLambdaArn: Lambda 기반 평가 함수
- 파일은 직접 업로드하거나 Amazon S3에서 가져올 수 있습니다.
- 최적화 결과와 평가 데이터가 저장될 S3 출력 위치도 지정할 수 있습니다.
멀티모달 프롬프트 지원
- 텍스트 입력뿐 아니라 이미지와 문서가 포함된 프롬프트도 최적화할 수 있습니다.
- 지원 파일 형식:
- PNG
- JPG
inputVariablesMultimodal필드에 파일 유형과 S3 URI를 지정합니다.- 문서 분석, 이미지 분석과 같은 멀티모달 작업의 프롬프트 개선에 적합합니다.
평가 방식 세 가지
Lambda 기반 사용자 정의 평가
- 정확도, F1 점수, 실행 정확도, 구조화된 JSON 일치 여부처럼 명확한 수치 평가에 적합합니다.
- Python으로 작성한 Lambda 함수에서 모델 응답과 기준 응답을 비교합니다.
evaluationMetricLambdaArn을 통해 평가 Lambda를 연결합니다.- 핵심 로직은 모델 출력과 정답을 비교해 점수를 계산하는
compute_score구현입니다.
LLM-as-a-Judge 평가
- 요약, 생성, 추론 설명처럼 정답이 하나로 정해지지 않은 작업에 적합합니다.
- 사용자 정의 평가 프롬프트와 평가 기준, 점수 척도를 설정할 수 있습니다.
- Bedrock의 평가 모델이 각 프롬프트와 응답을 평가하고 점수와 판단 근거를 반환합니다.
- 기본 평가 모델은 Claude Sonnet 4.6이며, 지원되는 다른 평가 모델을 선택할 수도 있습니다.
- 설정은
customLLMJConfig에 지정합니다.
자연어 기반 Steering Criteria
- 브랜드 문체, 출력 형식, 안전 제약 등 원하는 품질을 자연어로 설명할 때 사용합니다.
- 직접 복잡한 평가 프롬프트나 점수 체계를 작성하지 않아도 됩니다.
steeringCriteria배열에 원하는 기준을 입력합니다.- 기본 LLM 평가 프롬프트가 해당 기준을 반영해 응답을 종합적으로 평가합니다.
- 이 방식에서도 Claude Sonnet 4.6이 평가 모델로 사용됩니다.
피드백 루프와 결과 확인
- Bedrock은 프롬프트와 예시 데이터를 선택한 모델에 전달합니다.
- 모델 응답을 지정한 평가 방식으로 채점합니다.
- 평가 결과를 바탕으로 프롬프트를 다시 작성합니다.
- 이 과정을 반복해 평가 지표에 맞는 프롬프트를 탐색합니다.
- 최종적으로 다음 정보를 확인할 수 있습니다.
- 원본 및 최적화된 프롬프트 템플릿
- 모델별 평가 점수
- 예상 비용
- 응답 지연 시간
- 평가 데이터와 결과
사용 방법과 제공 지역
- Amazon Bedrock 콘솔의 Advanced Prompt Optimization 페이지에서
Create prompt optimization을 선택합니다. - API를 사용하려면
CreateAdvancedPromptOptimizationJob을 호출합니다. - 미국, 아시아 태평양, 캐나다, 유럽, 남미의 여러 리전에서 제공됩니다.
- 최적화 과정에서 사용된 Bedrock 모델 추론 토큰에 대해 일반 추론과 동일한 토큰 요금이 부과됩니다.
실무에서는 먼저 정확도나 JSON 일치처럼 측정 가능한 작업은 Lambda 평가로 시작하고, 요약·문체·안전성처럼 정성적인 작업은 LLM-as-a-Judge 또는 Steering Criteria를 사용하는 것이 적합합니다. 모델을 교체할 때는 기존 모델을 기준선으로 포함해 품질뿐 아니라 비용과 지연 시간까지 함께 비교하는 것이 좋습니다.
관련 글
큐레이션 요약을 이어서 읽어보세요.
AWS 주간 정리: 원클릭 Lambda 설정 프롬프트, Bedrock의 OpenAI GPT-5.6 모델 등 (2026년 7월 20일) | Amazon Web Services
원문 읽기AWS 주간 요약: AWS Heroes Summit, Amazon Bedrock의 웹 검색, Dogwood, Kiro Crew 등 (2026년 8월 10일) | Amazon Web Services
원문 읽기AWS 주간 요약: 아테네 로컬 영역, AWS의 Claude Opus 5, .NET용 Lambda 내구성 실행 및 기타 소식 (2026년 7월 27일) | Amazon Web Services
원문 읽기2026 뉴욕 AWS 서밋의 주요 발표 | Amazon Web Services
원문 읽기