aws4분 읽기

큐레이션 요약

Amazon Bedrock에서 OpenAI GPT-5.5, GPT-5.4 모델 및 Codex 시작하기 | Amazon Web Services

원문 읽기(새 탭에서 열림)

OpenAI GPT-5.5·GPT-5.4와 Codex가 Amazon Bedrock에서 정식 제공되어, Responses API를 통해 추론·코딩·에이전트 작업을 수행할 수 있게 되었습니다. GPT-5.5는 최고 난도의 작업에, GPT-5.4는 가격 대비 성능이 중요한 작업에 적합합니다. 모든 처리는 선택한 Bedrock 리전 내에서 수행되며, 좌석 라이선스 없이 토큰 사용량 기준으로 과금됩니다.

Amazon Bedrock에서 제공되는 모델과 Codex

  • GPT-5.5와 GPT-5.4는 코딩, 추론, 에이전트 워크플로, 복잡한 전문 업무에 최적화되어 있습니다.
  • GPT-5.5는 가장 어려운 고객 업무를 위한 고성능 모델입니다.
  • GPT-5.4는 성능과 비용의 균형을 중시하는 용도에 적합합니다.
  • OpenAI의 코딩 에이전트인 Codex도 Bedrock에서 사용할 수 있습니다.
    • 대규모 코드베이스 작성, 리팩터링, 디버깅, 테스트, 검증 지원
    • Codex App, CLI, Visual Studio Code·JetBrains·Xcode 통합 제공
    • 모든 모델 추론은 Amazon Bedrock의 Responses API를 통해 처리

Responses API를 통한 모델 호출

  • OpenAI SDK, curl 등으로 Bedrock의 bedrock-mantle 엔드포인트를 호출할 수 있습니다.
  • Python SDK 설치:
pip install -U openai
  • 인증 및 엔드포인트 환경 변수 설정:
export OPENAI_BASE_URL="https://bedrock-mantle.us-east-2.api.aws/openai/v1"
export OPENAI_API_KEY="<BEDROCK_API_KEY>"
export BEDROCK_OPENAI_MODEL_ID="openai.gpt-5.5"
  • Python에서는 client.responses.create()를 사용합니다.
  • 요청에 다음과 같은 설정을 지정할 수 있습니다.
    • reasoning.effort: 추론 수준
    • text.verbosity: 응답의 상세도
    • developer 메시지: 모델의 역할과 응답 지침
  • 예시에서는 AWS 지식이 풍부한 소프트웨어 엔지니어 역할을 부여하고, 여러 리전에 걸친 초당 10만 요청 규모의 AWS 아키텍처를 생성하도록 요청합니다.
  • curl을 사용하면 /responses 엔드포인트에 JSON 요청을 직접 전송할 수 있습니다.

Responses API가 적합한 경우

  • 모델이 여러 턴의 대화 상태를 관리해야 할 때
  • 호스팅 도구나 함수 도구를 사용해야 할 때
  • 여러 도구를 조합하는 복잡한 오케스트레이션이 필요할 때
  • 백그라운드 작업이나 장시간 실행되는 작업을 처리할 때

Codex를 Bedrock에 연결하는 방법

  • Codex CLI, Codex App 또는 VS Code 확장을 설치해 Bedrock을 모델 추론 경로로 사용할 수 있습니다.
  • 두 가지 인증 방식을 지원합니다.
    • AWS_BEARER_TOKEN_BEDROCK에 Bedrock API 키 설정
    • AWS SDK 자격 증명 체인 사용
  • AWS_BEARER_TOKEN_BEDROCK가 설정되어 있으면 Codex가 이를 우선 사용하고, 없으면 AWS SDK 자격 증명 체인으로 전환합니다.
export AWS_BEARER_TOKEN_BEDROCK=<your-bedrock-api-key>
  • ~/.codex/config.toml에서 리전과 모델 제공자를 설정합니다.
model = "openai.gpt-5.5"
model_provider = "amazon-bedrock"

[model_providers.amazon-bedrock.aws]
region = "us-east-2"
  • 사용할 수 있는 모델 ID에는 다음이 포함됩니다.
    • openai.gpt-5.5
    • openai.gpt-5.4
    • openai.gpt-oss-120b
    • openai.gpt-oss-20b
  • 데스크톱 앱이나 VS Code 확장에서 사용할 환경 변수는 ~/.codex/.env에 저장할 수 있습니다.
  • 설정 파일을 변경한 뒤에는 앱이나 확장을 재시작해야 합니다.
  • Codex CLI에서는 /status 명령으로 현재 모델과 연결 상태를 확인할 수 있습니다.

지연 시간과 확장성

  • 실제 사용자가 느끼는 지연 시간은 모델의 기본 속도뿐 아니라 다음 요소의 영향을 받습니다.
    • 추론 수준
    • 출력 길이
    • 도구 호출 횟수
    • 백그라운드 실행 여부
    • 리전 및 할당량
    • 요청 제한(throttling)
    • 프롬프트 크기
    • 캐시 적중 여부
  • GPT-5.5는 우선 reasoning.effort="medium"으로 시작하는 것이 권장됩니다.
  • GPT-5.4는 기본값인 none에 의존하기보다 애플리케이션 요구사항에 맞춰 추론 수준을 명시하는 것이 좋습니다.
  • Bedrock의 차세대 추론 엔진은 수요 변화에 맞춰 용량을 빠르게 확보하도록 설계되었습니다.
  • 수요가 급증하면 요청을 즉시 거부하기보다 큐에 넣어 처리하는 방식으로 안정적인 워크로드 운영을 지원합니다.

리전, 데이터 보존, 과금

  • 고객이 선택한 Bedrock 리전 내에서 모든 처리가 이루어지므로 데이터 레지던시 요구사항을 충족할 수 있습니다.
  • 제공 리전은 다음과 같습니다.
    • GPT-5.5: 미국 동부(오하이오)
    • GPT-5.4: 미국 동부(오하이오), 미국 서부(오리건)
  • 향후 지원 리전은 AWS의 전체 리전 목록에서 확인할 수 있습니다.
  • 개발자 좌석 라이선스나 인원별 약정 없이 토큰 사용량 기준으로 과금됩니다.

실무에서는 먼저 GPT-5.5를 중간 추론 수준으로 테스트하고, 비용과 성능의 균형이 중요하면 GPT-5.4와 명시적인 추론 설정을 비교하는 것이 좋습니다. Codex를 사용할 때는 리전, 인증 방식, 모델 ID를 설정 파일에 고정하고 /status로 연결 상태를 확인하면 운영 중 문제를 줄일 수 있습니다.

큐레이션 요약을 이어서 읽어보세요.