Dados de benchmark da AWS sugerem que os modelos da OpenAI no Amazon Bedrock podem reduzir o custo de respostas corretas quando as equipes medem qualidade, turnos e retrabalho.

A Amazon Web Services está pedindo às equipes que repensem como escolhem modelos da OpenAI no Amazon Bedrock, argumentando que o menor preço por milhão de tokens pode não produzir o menor custo de produção. Em uma nova publicação no AWS Machine Learning Blog, a empresa divulgou um harness de benchmark de código aberto que compara a precisão do modelo, o número de turnos do agente e o custo de um trabalho aceitável.
A análise cobre três modelos da OpenAI disponíveis via Amazon Bedrock — gpt-5.6-luna, gpt-5.6-terra e gpt-5.6-sol — e os compara com gpt-5.4-mini e gpt-5.4-nano via a API da OpenAI. A AWS diz que o objetivo é calcular o custo de uma resposta correta, um resultado de pesquisa aprovado ou um entregável profissional aceitável, em vez de tratar o preço por token como a principal métrica de compra.
Os resultados são reportados pelo fornecedor e vêm do próprio harness de testes da AWS. Eles também não são uma comparação totalmente controlada: a AWS diz que os modelos do Bedrock foram executados com o raciocínio desativado, enquanto as linhas de base da API usaram suas configurações padrão. A empresa aconselha os clientes a reproduzir os testes em suas próprias cargas de trabalho antes de tomar uma decisão de modelo.
O argumento da AWS é direto: aplicações de produção pagam por resultados, não por tokens. Um modelo mais barato por solicitação pode ficar mais caro se responder incorretamente, exigir novas tentativas ou obrigar um humano a corrigir sua saída.
Para testar essa ideia, a AWS executou o mesmo caminho de código da Responses API da OpenAI em cinco modelos, mantendo sua lógica de avaliação constante. O benchmark incluiu matemática AIME, ciência de nível de pós-graduação GPQA Diamond e MMLU-Pro. A AWS dividiu o gasto total do modelo — incluindo tentativas malsucedidas — pelo número de respostas corretas para estimar o custo observado por resposta correta.
Na amostra da empresa, gpt-5.6-sol atingiu 75% de precisão no AIME, em comparação com 37% do gpt-5.4-mini. Também liderou os resultados reportados do GPQA Diamond e do MMLU-Pro. A AWS alerta que esses são resultados de amostra, não uma classificação universal, e que pequenas diferenças devem ser tratadas como indicativas, a menos que sustentadas por estimativas de incerteza.
A conclusão de preço mudou depois que a AWS citou uma redução em 30 de julho de 2026 para GPT-5.6 Luna e Terra no Amazon Bedrock. A AWS informou um custo de US$ 0,0021 por resposta correta no AIME para gpt-5.6-luna, contra US$ 0,0139 para gpt-5.4-mini sob as suposições de seus arquivos de resultado. O post diz que o custo observado por resposta correta da Luna foi menor do que o das alternativas testadas, incluindo gpt-5.4-nano.
Esses números não devem ser lidos como preços universais atuais. A AWS orienta especificamente os leitores a verificar a região aplicável do Amazon Bedrock e a camada de inferência na página de preços ao vivo. O post também observa que atualizações da página de preços podem não coincidir imediatamente com um anúncio.
A parte mais consequente da análise diz respeito aos agentes de IA, em que cada chamada de modelo pode carregar um histórico de conversa crescente. A AWS testou uma amostra de 50 perguntas do DeepSearchQA usando ferramentas ao vivo web_search e fetch_page. O agente gerenciou seu próprio histórico com o armazenamento desativado, o que significa que o prompt do sistema, resultados anteriores de ferramentas e o contexto da conversa foram enviados novamente a cada turno.
Esse design torna o número de turnos um fator direto de custo e latência. A AWS diz que a entrada cumulativa pode crescer aproximadamente de forma quadrática à medida que um agente continua adicionando contexto. Na amostra, gpt-5.4-mini teve média de 7,6 turnos por pergunta, em grande parte por causa de loops de busca repetidos. Seu volume de entrada atingiu 114.000 tokens por pergunta, em comparação com 50.000 para gpt-5.6-terra.
A AWS relatou que Terra custou US$ 0,31 por resposta aprovada no teste, em comparação com US$ 0,40 para mini, ao mesmo tempo em que produziu uma pontuação média F1 mais alta. Ela relatou um custo ainda menor, de US$ 0,05 por resposta aprovada, para gpt-5.6-luna, contra US$ 0,40 para mini. Nano tinha um preço nominal por token mais baixo, mas aprovou apenas 18% das perguntas, resultando em um custo observado de US$ 0,07 por resposta aprovada.
A amostra continha apenas 50 perguntas, então as comparações não são conclusivas. Ainda assim, o resultado destaca uma variável de custo que não aparece em uma página de preços padrão: quão eficientemente um modelo conclui um fluxo de trabalho com uso de ferramentas.
A AWS também testou o GDPval, um benchmark construído em torno de entregáveis ocupacionais em vez de perguntas de resposta curta. Sua amostra de 48 tarefas cobriu documentos como briefs de conformidade, planos financeiros e protocolos de cuidado, com cada saída avaliada em relação a uma rubrica escrita por profissionais.
A empresa informou que as três configurações gpt-5.6 obtiveram pontuações mais altas do que as configurações mini e nano testadas quando o raciocínio estava desativado. Luna passou em 27 das 48 tarefas, contra 20 do mini. Após a redução de preço relatada, a AWS calculou o custo da Luna por entregável aprovado em US$ 0,010, contra US$ 0,030 para mini e US$ 0,012 para nano.
O resultado não é uma medida limpa da qualidade geral do modelo. A AWS diz que as categorias ocupacionais tinham amostras pequenas, e o limite de saída de 8.192 tokens truncou seis entregáveis da Luna, nove da Terra, sete da Sol, zero do mini e um do nano. Um limite de saída maior poderia mudar tanto a qualidade quanto o custo.
Para compradores corporativos, porém, o teste aponta para uma questão prática: quanto vale uma taxa de aprovação mais alta quando a alternativa exige revisão, retrabalho ou escalonamento? Um modelo mais caro pode ser econômico se reduzir esses custos a jusante, enquanto um modelo mais barato ainda pode ser preferível para tarefas de classificação ou redação de baixo risco.
O harness de benchmark da AWS, identificado no post como openai-on-aws/benchmarks-openai, oferece às equipes de engenharia uma forma de avaliar a escolha do modelo usando seus próprios prompts e critérios de aceitação. Isso importa porque o melhor modelo para um agente de pesquisa pode não ser o melhor para um pipeline de extração de alto volume, e uma pontuação de benchmark pode não refletir a tolerância de uma empresa a erros.
Equipes que constroem agentes de IA devem acompanhar turnos, chamadas de ferramentas, crescimento de entrada, latência e custo de tarefas bem-sucedidas junto com o gasto em tokens. Elas também devem decidir se sua aplicação pode reutilizar contexto armazenado, limitar loops de busca, resumir resultados de ferramentas ou encaminhar casos difíceis para um modelo mais forte. Esses controles podem alterar a economia independentemente do preço subjacente do modelo.
Para equipes de produto, a unidade mais útil pode ser custo por documento aprovado, ticket resolvido ou fluxo de trabalho concluído. Isso exige uma rubrica estável e um registro de saídas malsucedidas, edições humanas, tentativas repetidas e taxas de escalonamento. O uso de verificações determinísticas e de um juiz LLM pela AWS ilustra uma abordagem, mas as próprias ressalvas da empresa mostram por que o design de avaliação continua fazendo parte do problema de implantação.
O sinal imediato é se as mudanças de preço da AWS em 30 de julho são refletidas de forma consistente nas regiões do Amazon Bedrock e nas camadas de inferência. Os compradores também devem observar se o harness de código aberto ganha reproduções independentes com raciocínio habilitado, configurações de modelo correspondentes, amostras maiores e estratégias de gerenciamento de contexto semelhantes às de produção.
Avaliações adicionais devem testar confiabilidade em execuções repetidas, segurança no uso de ferramentas, resistência a prompt injection, latência, truncamento de saída e o custo da revisão humana. Essas medidas podem estreitar — ou ampliar — a vantagem que a AWS relata para gpt-5.6-luna e os outros modelos gpt-5.6.
A AWS está fazendo uma correção útil em um hábito comum de compras: o preço por token é visível, enquanto os custos de falha e retrabalho ficam distribuídos pela aplicação. Os resultados reportados apoiam medir a seleção de modelo no nível do fluxo de trabalho, especialmente para agentes que chamam ferramentas repetidamente e reenviam contexto acumulado.
Mas as evidências continuam controladas pela AWS e específicas da configuração. A principal conclusão não é que um modelo da OpenAI seja universalmente o mais barato. É que os construtores devem testar o custo de um resultado bem-sucedido e aceitável em sua própria carga de trabalho antes de permitir que uma planilha de preços decida a arquitetura.