AWS의 벤치마크 데이터는 팀이 품질, 턴 수, 재작업을 측정할 때 Amazon Bedrock의 OpenAI 모델이 정답 비용을 낮출 수 있음을 시사한다.

Amazon Web Services는 Amazon Bedrock에서 OpenAI 모델을 선택하는 방식을 다시 생각해 보라고 팀에 요청하고 있다. 회사는 백만 토큰당 최저 가격이 반드시 가장 낮은 운영 비용을 의미하지는 않는다고 주장한다. AWS Machine Learning Blog의 새 게시물에서 회사는 모델 정확도, 에이전트 턴 수, 수용 가능한 작업의 비용을 비교하는 오픈소스 벤치마킹 하네스를 공개했다.
이 분석은 Amazon Bedrock을 통해 제공되는 세 가지 OpenAI 모델—gpt-5.6-luna, gpt-5.6-terra, gpt-5.6-sol—을 다루며, OpenAI API를 통한 gpt-5.4-mini와 gpt-5.4-nano와 비교한다. AWS는 토큰 가격을 주요 구매 지표로 보지 않고, 정답, 통과한 연구 결과, 또는 수용 가능한 전문 산출물의 비용을 계산하는 것이 목표라고 말한다.
이 결과는 벤더가 제공한 것이며 AWS 자체 테스트 하네스에서 나온 것이다. 또한 완전히 통제된 비교도 아니다. AWS는 Bedrock 모델은 추론을 비활성화한 상태로 실행되었고, API 기준선은 기본 설정을 사용했다고 밝혔다. 회사는 모델 결정을 내리기 전에 고객이 자신의 워크로드에서 테스트를 재현해 볼 것을 권고한다.
AWS의 논리는 단순하다. 프로덕션 애플리케이션은 토큰이 아니라 결과에 대해 비용을 지불한다. 요청당 더 저렴한 모델도 오답을 내거나 재시도가 필요하거나 사람이 출력을 수정해야 한다면 더 비싸질 수 있다.
이 아이디어를 시험하기 위해 AWS는 평가 로직은 고정한 채 다섯 개 모델에 동일한 OpenAI Responses API 코드 경로를 적용했다. 벤치마크에는 AIME 수학, 대학원 수준 과학 문제인 GPQA Diamond, MMLU-Pro가 포함됐다. AWS는 실패한 시도를 포함한 총 모델 비용을 정답 수로 나눠 관측된 정답당 비용을 추정했다.
회사 샘플에서 gpt-5.6-sol은 AIME에서 75% 정확도를 기록해 gpt-5.4-mini의 37%를 앞섰다. 또한 GPQA Diamond와 MMLU-Pro 결과에서도 선두를 차지했다. AWS는 이것이 표본 결과일 뿐 보편적인 순위가 아니며, 불확실성 추정치가 없다면 작은 차이는 방향성 정도로 봐야 한다고 경고한다.
AWS가 Amazon Bedrock의 GPT-5.6 Luna와 Terra에 대해 2026년 7월 30일 가격 인하를 언급한 뒤 가격 결론은 달라졌다. AWS는 결과 파일의 가정 하에서 gpt-5.6-luna의 AIME 정답당 비용을 0.0021달러, gpt-5.4-mini는 0.0139달러라고 보고했다. 게시물은 Luna의 관측된 정답당 비용이 gpt-5.4-nano를 포함한 테스트 대안들보다 낮았다고 말한다.
이 수치를 현재의 보편적 가격으로 읽어서는 안 된다. AWS는 적용되는 Amazon Bedrock 리전과 추론 티어를 실시간 가격 페이지와 대조해 확인하라고 명시적으로 안내한다. 또한 가격 페이지 업데이트가 발표와 즉시 일치하지 않을 수 있다고 덧붙인다.
분석의 더 중요한 부분은 AI 에이전트에 관한 것으로, 여기서는 각 모델 호출이 점점 늘어나는 대화 이력을 동반할 수 있다. AWS는 실제 web_search와 fetch_page 도구를 사용해 DeepSearchQA의 50문항 샘플을 테스트했다. 에이전트는 저장 기능을 끈 상태에서 자체 이력을 관리했는데, 이는 시스템 프롬프트, 이전 도구 결과, 대화 맥락이 매 턴 다시 전송되었음을 의미한다.
이 설계는 턴 수를 직접적인 비용과 지연 요인으로 만든다. AWS는 에이전트가 맥락을 계속 추가할수록 누적 입력이 대략 이차적으로 증가할 수 있다고 말한다. 샘플에서 gpt-5.4-mini는 질문당 평균 7.6턴을 기록했으며, 주로 반복 검색 루프 때문이었다. 입력량은 질문당 114,000토큰에 이르러 gpt-5.6-terra의 50,000토큰을 크게 웃돌았다.
AWS는 Terra가 테스트에서 통과 답변당 0.31달러로, mini의 0.40달러보다 낮았으며 평균 F1 점수도 더 높았다고 보고했다. gpt-5.6-luna의 경우 통과 답변당 비용이 0.05달러로, mini의 0.40달러보다 훨씬 낮았다. Nano는 명목 토큰 가격은 더 낮았지만 질문의 18%만 통과해, 관측된 통과 답변당 비용이 0.07달러였다.
샘플은 50문항에 불과하므로 비교는 결론적이지 않다. 그럼에도 결과는 표준 가격 페이지에는 나타나지 않는 비용 변수, 즉 모델이 도구 사용 워크플로를 얼마나 효율적으로 완료하는가를 보여준다.
AWS는 짧은 답변 질문이 아니라 직무 산출물을 중심으로 설계된 벤치마크인 GDPval도 테스트했다. 48개 작업 샘플에는 컴플라이언스 브리프, 재무 계획, 케어 프로토콜 같은 문서가 포함됐으며, 각 출력은 전문가가 작성한 루브릭에 따라 평가됐다.
회사는 추론을 비활성화했을 때 세 가지 gpt-5.6 구성 모두 테스트한 mini 및 nano 구성보다 더 높은 점수를 받았다고 보고했다. Luna는 48개 작업 중 27개를 통과해 mini의 20개를 앞섰다. 보고된 가격 인하 후 AWS는 Luna의 통과 산출물당 비용을 0.010달러로 계산했으며, mini는 0.030달러, nano는 0.012달러였다.
이 결과가 일반적인 모델 품질을 깔끔하게 측정하는 것은 아니다. AWS에 따르면 직무 카테고리의 표본이 작았고, 8,192토큰 출력 제한 때문에 Luna 6개, Terra 9개, Sol 7개, mini 0개, nano 1개의 산출물이 잘려 나갔다. 더 높은 출력 제한은 품질과 비용 모두를 바꿀 수 있다.
그러나 기업 구매자에게 이 테스트는 실용적인 질문을 던진다. 대안이 검토, 재작업 또는 상향 조정을 필요로 할 때 더 높은 통과율은 얼마나 가치가 있는가? 더 비싼 모델이 하류 비용을 줄인다면 경제적일 수 있고, 반대로 저위험 분류나 초안 작성 작업에서는 더 저렴한 모델이 여전히 더 나을 수 있다.
게시물에서 openai-on-aws/benchmarks-openai로 식별된 AWS 벤치마킹 하네스는 엔지니어링 팀이 자신의 프롬프트와 수용 기준으로 모델 선택을 평가할 수 있게 해준다. 이는 연구 에이전트에 가장 좋은 모델이 대량 추출 파이프라인에도 가장 좋은 모델이라는 보장이 없고, 벤치마크 점수가 기업의 오류 허용 범위를 반영하지 않을 수 있기 때문에 중요하다.
AI 에이전트를 구축하는 팀은 토큰 지출과 함께 턴 수, 도구 호출, 입력 증가, 지연 시간, 성공 작업 비용을 추적해야 한다. 또한 애플리케이션이 저장된 맥락을 재사용할 수 있는지, 검색 루프를 제한할 수 있는지, 도구 결과를 요약할 수 있는지, 어려운 사례를 더 강력한 모델로 라우팅할 수 있는지도 결정해야 한다. 이런 통제는 기반 모델 가격과 무관하게 경제성을 바꿀 수 있다.
제품 팀에게 더 유용한 단위는 승인된 문서, 해결된 티켓, 완료된 워크플로당 비용일 수 있다. 이를 위해서는 안정적인 루브릭과 실패 출력, 사람의 수정, 재시도, 에스컬레이션 비율의 기록이 필요하다. AWS의 결정론적 체크와 LLM 심사관 사용은 한 가지 접근을 보여주지만, 회사 자체의 주의 사항은 평가 설계가 여전히 배포 문제의 일부임을 보여준다.
당장의 신호는 AWS의 7월 30일 가격 변경이 Amazon Bedrock의 모든 리전과 추론 티어에 일관되게 반영되는지 여부다. 구매자들은 또한 오픈소스 하네스가 추론 활성화, 일치하는 모델 구성, 더 큰 샘플, 그리고 운영 환경과 유사한 맥락 관리 전략을 사용한 독립 재현을 얻는지도 지켜봐야 한다.
추가 평가는 반복 실행에 대한 신뢰성, 도구 사용 안전성, 프롬프트 인젝션 저항성, 지연 시간, 출력 잘림, 사람 검토 비용을 시험해야 한다. 이러한 지표는 AWS가 gpt-5.6-luna와 다른 gpt-5.6 모델에 대해 보고한 우위를 좁히거나 넓힐 수 있다.
AWS는 흔한 조달 습관을 유용하게 바로잡고 있다. 토큰 가격은 눈에 보이지만 실패와 재작업 비용은 애플리케이션 전반에 분산되기 때문이다. 보고된 결과는 특히 도구를 반복 호출하고 누적된 맥락을 다시 보내는 에이전트의 경우 워크플로 수준에서 모델 선택을 측정해야 함을 뒷받침한다.
하지만 증거는 여전히 AWS가 통제하고 있고 구성에 특화돼 있다. 가장 강한 시사점은 어떤 OpenAI 모델이 보편적으로 가장 싸다는 것이 아니다. 가격표가 아키텍처를 결정하게 두기 전에, 빌더는 자신의 워크로드에서 성공적이고 수용 가능한 결과의 비용을 시험해야 한다는 것이다.