Бенчмарк-данные AWS показывают, что модели OpenAI в Amazon Bedrock могут снижать стоимость правильных ответов, если команды измеряют качество, число ходов и переделки.

Amazon Web Services предлагает командам пересмотреть подход к выбору моделей OpenAI в Amazon Bedrock, утверждая, что самая низкая цена за миллион токенов не обязательно означает самые низкие производственные затраты. В новой публикации AWS Machine Learning Blog компания представила открытый инструмент для бенчмаркинга, который сравнивает точность моделей, число ходов агента и стоимость приемлемой работы.
Анализ охватывает три модели OpenAI, доступные через Amazon Bedrock — gpt-5.6-luna, gpt-5.6-terra и gpt-5.6-sol — и сравнивает их с gpt-5.4-mini и gpt-5.4-nano через OpenAI API. По словам AWS, цель состоит в том, чтобы рассчитывать стоимость правильного ответа, успешного исследовательского результата или приемлемого профессионального результата, а не считать цену токенов главным критерием покупки.
Результаты предоставлены вендором и получены из собственного тестового инструмента AWS. Это также не полностью контролируемое сравнение: AWS сообщает, что модели Bedrock запускались с отключенным reasoning, тогда как базовые конфигурации API использовали настройки по умолчанию. Компания советует клиентам воспроизвести тесты на своих собственных рабочих нагрузках, прежде чем принимать решение о модели.
Аргумент AWS прост: производственные приложения платят за результат, а не за токены. Модель, которая дешевле за запрос, может оказаться дороже, если она отвечает неверно, требует повторных попыток или заставляет человека исправлять ее вывод.
Чтобы проверить эту идею, AWS прогнала один и тот же кодовый путь OpenAI Responses API через пять моделей, сохраняя логику оценки неизменной. В бенчмарк вошли AIME по математике, GPQA Diamond на уровне аспирантуры и MMLU-Pro. AWS разделила общие затраты на модель — включая неудачные попытки — на число правильных ответов, чтобы оценить наблюдаемую стоимость одного правильного ответа.
В примере компании gpt-5.6-sol показала точность 75% на AIME, по сравнению с 37% у gpt-5.4-mini. Она также лидировала в опубликованных результатах GPQA Diamond и MMLU-Pro. AWS предупреждает, что это выборочные результаты, а не универсальный рейтинг, и что небольшие различия следует считать ориентировочными, если они не подкреплены оценками неопределенности.
Ценовой вывод изменился после того, как AWS сослалась на снижение цен 30 июля 2026 года для GPT-5.6 Luna и Terra в Amazon Bedrock. AWS сообщила о стоимости $0,0021 за правильный ответ AIME для gpt-5.6-luna против $0,0139 для gpt-5.4-mini при предположениях, заложенных в файлы результатов. В публикации говорится, что наблюдаемая стоимость правильного ответа у Luna была ниже, чем у протестированных альтернатив, включая gpt-5.4-nano.
Эти цифры не следует воспринимать как текущие универсальные цены. AWS прямо рекомендует читателям проверять применимы ли регион Amazon Bedrock и уровень инференса по актуальной странице цен. В публикации также отмечается, что обновления ценовой страницы могут не совпадать с объявлением сразу.
Наиболее существенная часть анализа касается ИИ-агентов, где каждый вызов модели может сопровождаться растущей историей диалога. AWS протестировала выборку из 50 вопросов DeepSearchQA с использованием реальных инструментов web_search и fetch_page. Агент управлял собственной историей при отключенном хранилище, то есть системный промпт, предыдущие результаты инструментов и контекст беседы отправлялись заново на каждом ходе.
Такой дизайн делает число ходов прямым фактором затрат и задержки. AWS говорит, что накопленный ввод может расти примерно квадратично по мере добавления агентом контекста. В выборке gpt-5.4-mini в среднем делала 7,6 хода на вопрос, в основном из-за повторяющихся циклов поиска. Объем ввода достигал 114 000 токенов на вопрос, по сравнению с 50 000 у gpt-5.6-terra.
AWS сообщила, что Terra стоила $0,31 за прошедший ответ в тесте, против $0,40 у mini, при этом показывая более высокий средний F1-score. Для gpt-5.6-luna компания указала еще более низкую стоимость — $0,05 за прошедший ответ, против $0,40 у mini. Nano имела более низкую номинальную цену за токен, но прошла только 18% вопросов, что привело к наблюдаемой стоимости $0,07 за прошедший ответ.
В выборке было всего 50 вопросов, поэтому сравнения не являются окончательными. Тем не менее, результат подчеркивает переменную стоимости, которой нет на стандартной странице цен: насколько эффективно модель завершает workflow с использованием инструментов.
AWS также протестировала GDPval — бенчмарк, построенный вокруг профессиональных deliverables, а не вопросов с коротким ответом. Его выборка из 48 задач охватывала такие документы, как комплаенс-бриефы, финансовые планы и протоколы ухода, а каждый вывод оценивался по рубрике, написанной профессионалами.
Компания сообщила, что все три конфигурации gpt-5.6 получили более высокие оценки, чем протестированные конфигурации mini и nano, когда reasoning был отключен. Luna успешно справилась с 27 из 48 задач, по сравнению с 20 у mini. После заявленного снижения цен AWS рассчитала стоимость Luna за один прошедший deliverable в $0,010 против $0,030 для mini и $0,012 для nano.
Этот результат не является чистой мерой общей качества модели. AWS говорит, что в профессиональных категориях были небольшие выборки, а ограничение вывода в 8 192 токена обрезало шесть deliverables Luna, девять Terra, семь Sol, ноль mini и один nano. Более высокий лимит вывода мог бы изменить как качество, так и стоимость.
Для корпоративных покупателей тест, однако, поднимает практический вопрос: сколько стоит более высокий процент прохождения, если альтернатива требует проверки, переделки или эскалации? Более дорогая модель может быть экономичной, если сокращает эти последующие издержки, тогда как более дешевая может оставаться предпочтительной для низкорисковых задач классификации или черновой подготовки.
Тестовый инструмент AWS, обозначенный в публикации как openai-on-aws/benchmarks-openai, дает инженерным командам способ оценивать выбор модели на основе собственных промптов и критериев приемки. Это важно, потому что лучшая модель для исследовательского агента может не быть лучшей для высоконагруженного пайплайна извлечения, а бенчмарк-оценка может не отражать терпимость компании к ошибкам.
Команды, создающие ИИ-агентов, должны отслеживать число ходов, вызовы инструментов, рост входа, задержку и стоимость успешно выполненных задач наряду с расходами на токены. Им также следует решить, может ли приложение переиспользовать сохраненный контекст, ограничивать циклы поиска, суммировать результаты инструментов или перенаправлять сложные случаи на более сильную модель. Эти меры могут менять экономику независимо от базовой цены модели.
Для продуктовых команд более полезной единицей может быть стоимость за утвержденный документ, решенный тикет или завершенный workflow. Для этого нужна стабильная рубрика и учет неудачных выводов, правок человеком, повторных попыток и частоты эскалаций. Использование AWS детерминированных проверок и LLM-судьи иллюстрирует один подход, но собственные оговорки компании показывают, почему дизайн оценки остается частью задачи развертывания.
Сейчас главный сигнал — будут ли изменения цен AWS от 30 июля последовательно отражены во всех регионах Amazon Bedrock и уровнях инференса. Покупателям также стоит следить, появятся ли независимые воспроизведения open-source harness с включенным reasoning, сопоставимыми конфигурациями моделей, более крупными выборками и стратегиями управления контекстом, похожими на реальные производственные.
Дальнейшие оценки должны проверять надежность при повторных прогонах, безопасность использования инструментов, устойчивость к prompt injection, задержку, обрезку вывода и стоимость человеческой проверки. Эти метрики могут сузить — или расширить — преимущество, о котором AWS сообщает для gpt-5.6-luna и других моделей gpt-5.6.
AWS делает полезную поправку к распространенной практике закупок: цена токена видна, тогда как издержки неудач и переделок распределены по всему приложению. Опубликованные результаты поддерживают идею измерять выбор модели на уровне workflow, особенно для агентов, которые многократно вызывают инструменты и пересылают накопленный контекст.
Но доказательства по-прежнему контролируются AWS и зависят от конфигурации. Главный вывод не в том, что какая-то одна модель OpenAI универсально самая дешевая. Он в том, что разработчикам следует тестировать стоимость успешного, приемлемого результата на своей собственной нагрузке, прежде чем позволить прайс-листу решать архитектуру.