Los datos de referencia de AWS sugieren que los modelos de OpenAI en Amazon Bedrock pueden reducir el costo de las respuestas correctas cuando los equipos miden la calidad, los turnos y el retrabajo.

Amazon Web Services está pidiendo a los equipos que replanteen cómo eligen los modelos de OpenAI en Amazon Bedrock, argumentando que el precio más bajo por millón de tokens puede no producir el menor costo de producción. En una nueva publicación del AWS Machine Learning Blog, la compañía publicó un marco de evaluación comparativa de código abierto que compara la precisión del modelo, el número de turnos del agente y el costo de un trabajo aceptable.
El análisis cubre tres modelos de OpenAI disponibles a través de Amazon Bedrock —gpt-5.6-luna, gpt-5.6-terra y gpt-5.6-sol— y los compara con gpt-5.4-mini y gpt-5.4-nano a través de la API de OpenAI. AWS dice que el objetivo es calcular el costo de una respuesta correcta, un resultado de investigación aprobado o un entregable profesional aceptable, en lugar de tratar el precio por token como la métrica principal de compra.
Los hallazgos son reportados por el proveedor y provienen del propio banco de pruebas de AWS. Tampoco se trata de una comparación totalmente controlada: AWS dice que los modelos de Bedrock se ejecutaron con el razonamiento desactivado, mientras que las líneas base de la API usaron su configuración predeterminada. La compañía aconseja a los clientes reproducir las pruebas en sus propias cargas de trabajo antes de tomar una decisión sobre el modelo.
El argumento de AWS es sencillo: las aplicaciones de producción pagan por resultados, no por tokens. Un modelo que es más barato por solicitud puede terminar siendo más caro si responde incorrectamente, requiere reintentos o obliga a un humano a reparar su salida.
Para probar esa idea, AWS ejecutó la misma ruta de código de la Responses API de OpenAI en cinco modelos, manteniendo constante su lógica de evaluación. El benchmark incluyó matemáticas AIME, ciencia de nivel de posgrado GPQA Diamond y MMLU-Pro. AWS dividió el gasto total del modelo —incluidos los intentos fallidos— entre el número de respuestas correctas para estimar el costo observado por respuesta correcta.
En la muestra de la compañía, gpt-5.6-sol logró una precisión del 75% en AIME, frente al 37% de gpt-5.4-mini. También lideró los resultados reportados de GPQA Diamond y MMLU-Pro. AWS advierte que estos son resultados de muestra, no una clasificación universal, y que las diferencias pequeñas deben considerarse orientativas salvo que estén respaldadas por estimaciones de incertidumbre.
La conclusión de precios cambió después de que AWS citara una reducción el 30 de julio de 2026 para GPT-5.6 Luna y Terra en Amazon Bedrock. AWS informó un costo de 0,0021 dólares por respuesta correcta en AIME para gpt-5.6-luna frente a 0,0139 dólares para gpt-5.4-mini bajo los supuestos de sus archivos de resultados. La publicación dice que el costo observado por respuesta correcta de Luna fue inferior al de las alternativas probadas, incluido gpt-5.4-nano.
Esas cifras no deben interpretarse como precios universales actuales. AWS indica específicamente a los lectores que verifiquen la región de Amazon Bedrock y el nivel de inferencia aplicables frente a la página de precios en vivo. La publicación también señala que las actualizaciones de la página de precios pueden no coincidir de inmediato con un anuncio.
La parte más importante del análisis se refiere a los agentes de IA, donde cada llamada al modelo puede arrastrar un historial de conversación cada vez mayor. AWS probó una muestra de 50 preguntas de DeepSearchQA usando las herramientas live web_search y fetch_page. El agente gestionó su propio historial con el almacenamiento desactivado, lo que significa que el prompt del sistema, los resultados anteriores de las herramientas y el contexto de la conversación se enviaron de nuevo en cada turno.
Ese diseño convierte el número de turnos en un factor directo de costo y latencia. AWS dice que la entrada acumulada puede crecer aproximadamente de forma cuadrática a medida que un agente sigue añadiendo contexto. En su muestra, gpt-5.4-mini promedió 7,6 turnos por pregunta, en gran parte debido a bucles de búsqueda repetidos. Su volumen de entrada alcanzó 114.000 tokens por pregunta, frente a 50.000 para gpt-5.6-terra.
AWS informó que Terra costó 0,31 dólares por respuesta aprobada en la prueba, frente a 0,40 dólares para mini, al tiempo que produjo una puntuación media F1 más alta. Informó un costo aún menor de 0,05 dólares por respuesta aprobada para gpt-5.6-luna, frente a 0,40 dólares para mini. Nano tenía un precio nominal por token más bajo, pero solo aprobó el 18% de las preguntas, lo que resultó en un costo observado de 0,07 dólares por respuesta aprobada.
La muestra contenía solo 50 preguntas, por lo que las comparaciones no son concluyentes. Aun así, el resultado destaca una variable de costo que no aparece en una página de precios estándar: con qué eficiencia un modelo completa un flujo de trabajo que utiliza herramientas.
AWS también probó GDPval, un benchmark construido en torno a entregables ocupacionales en lugar de preguntas de respuesta corta. Su muestra de 48 tareas cubrió documentos como resúmenes de cumplimiento, planes financieros y protocolos de atención, y cada salida fue evaluada contra una rúbrica escrita por profesionales.
La compañía informó que las tres configuraciones gpt-5.6 obtuvieron puntuaciones más altas que las configuraciones mini y nano probadas cuando el razonamiento estaba desactivado. Luna aprobó 27 de las 48 tareas, frente a 20 de mini. Tras la reducción de precio reportada, AWS calculó el costo de Luna por entregable aprobado en 0,010 dólares, frente a 0,030 dólares para mini y 0,012 dólares para nano.
El resultado no es una medida limpia de la calidad general del modelo. AWS dice que las categorías ocupacionales tenían muestras pequeñas, y el límite de salida de 8.192 tokens truncó seis entregables de Luna, nueve de Terra, siete de Sol, cero de mini y uno de nano. Un límite de salida más alto podría cambiar tanto la calidad como el costo.
Para los compradores empresariales, sin embargo, la prueba apunta a una pregunta práctica: ¿cuánto vale una tasa de aprobación más alta cuando la alternativa requiere revisión, retrabajo o escalamiento? Un modelo más caro puede ser económico si reduce esos costos posteriores, mientras que un modelo más barato puede seguir siendo preferible para tareas de clasificación o redacción de bajo riesgo.
El marco de evaluación comparativa de AWS, identificado en la publicación como openai-on-aws/benchmarks-openai, ofrece a los equipos de ingeniería una forma de evaluar la elección del modelo usando sus propios prompts y criterios de aceptación. Eso importa porque el mejor modelo para un agente de investigación puede no ser el mejor para una canalización de extracción de gran volumen, y una puntuación de benchmark puede no reflejar la tolerancia de una empresa al error.
Los equipos que construyen agentes de IA deberían seguir los turnos, las llamadas a herramientas, el crecimiento de entrada, la latencia y el costo de las tareas exitosas junto con el gasto en tokens. También deberían decidir si su aplicación puede reutilizar contexto almacenado, limitar bucles de búsqueda, resumir los resultados de las herramientas o derivar los casos difíciles a un modelo más potente. Estos controles pueden cambiar la economía independientemente del precio del modelo subyacente.
Para los equipos de producto, la unidad más útil puede ser el costo por documento aprobado, ticket resuelto o flujo de trabajo completado. Eso requiere una rúbrica estable y un registro de salidas fallidas, ediciones humanas, reintentos y tasas de escalamiento. El uso por AWS de verificaciones deterministas y un juez LLM ilustra un enfoque, pero las propias advertencias de la empresa muestran por qué el diseño de la evaluación sigue siendo parte del problema de despliegue.
La señal inmediata es si los cambios de precios del 30 de julio de AWS se reflejan de forma consistente en las regiones de Amazon Bedrock y los niveles de inferencia. Los compradores también deberían vigilar si el marco de código abierto obtiene reproducciones independientes con razonamiento habilitado, configuraciones de modelo coincidentes, muestras más grandes y estrategias de gestión de contexto similares a producción.
Evaluaciones posteriores deberían probar la fiabilidad en ejecuciones repetidas, la seguridad en el uso de herramientas, la resistencia a la inyección de prompts, la latencia, el truncamiento de salidas y el costo de la revisión humana. Esas medidas podrían reducir —o ampliar— la ventaja que AWS informa para gpt-5.6-luna y los otros modelos gpt-5.6.
AWS está corrigiendo de forma útil un hábito común de compra: el precio por token es visible, mientras que los costos por fallos y retrabajo se distribuyen por toda la aplicación. Los resultados reportados respaldan medir la selección del modelo a nivel de flujo de trabajo, especialmente para agentes que llaman repetidamente a herramientas y reenvían el contexto acumulado.
Pero la evidencia sigue estando controlada por AWS y es específica de la configuración. La conclusión más fuerte no es que un modelo de OpenAI sea universalmente el más barato. Es que los desarrolladores deberían probar el costo de un resultado exitoso y aceptable en su propia carga de trabajo antes de permitir que una hoja de cálculo de precios decida la arquitectura.