A AWS adicionou o Kimi K3 da Moonshot AI ao Amazon Bedrock, oferecendo aos desenvolvedores um modelo de peso aberto com visão, contexto longo e cache de prompts.

A Amazon Web Services disponibilizou o Kimi K3 da Moonshot AI no Amazon Bedrock, adicionando um modelo de peso aberto voltado para cargas de trabalho de programação e de trabalho do conhecimento. O lançamento dá aos desenvolvedores acesso a compreensão nativa de imagens, uma janela de contexto de 1 milhão de tokens e cache explícito de prompts por meio de APIs de inferência gerenciadas pela AWS.
O lançamento é mais importante para equipes que constroem agentes de longa duração e sistemas de programação que enviam repetidamente grandes repositórios, documentos de referência ou instruções de ferramentas. A AWS afirma que o Kimi K3 pode ser testado no console do Bedrock ou chamado programaticamente por meio das APIs do Bedrock, incluindo interfaces compatíveis com OpenAI. No entanto, as alegações mais fortes sobre capacidade e eficiência no anúncio vêm da Moonshot AI ou da AWS, e não de avaliações independentes.
O Kimi K3 foi desenvolvido pela Moonshot AI, a empresa por trás da família de modelos Kimi. De acordo com o AWS Machine Learning Blog, a Moonshot AI descreve o Kimi K3 como seu modelo mais capaz e afirma que ele é o primeiro modelo aberto a atingir 2,8 trilhões de parâmetros. A AWS também relata a afirmação da Moonshot de uma melhoria de aproximadamente 2,5 vezes na eficiência de escalonamento em relação ao Kimi K2.
Esses números são informados pelo fornecedor e o anúncio disponível não traz metodologia de benchmark independente, comparação de preços ou resultados de avaliação contra modelos concorrentes. A mudança mais concreta para os desenvolvedores é o acesso de implantação: o Kimi K3 agora pode ser selecionado no Amazon Bedrock ao lado de outros modelos compatíveis, em vez de exigir uma pilha de serving separada gerenciada pelo cliente.
O modelo combina capacidades nativas de visão com uma janela de contexto de 1 milhão de tokens. Essa configuração é relevante para aplicações que precisam manter grandes quantidades de material no contexto de trabalho, incluindo repositórios de software, documentação técnica, longos registros empresariais e arquivos com imagens. Uma janela de contexto grande, por si só, não garante raciocínio confiável sobre todo esse material, então as equipes de produção ainda precisarão de controles de recuperação, avaliação e gerenciamento de contexto.
A AWS está posicionando o cache explícito de prompts como um dos principais diferenciais práticos do Kimi K3 no Bedrock. O recurso permite que os desenvolvedores marquem um prefixo de prompt reutilizável, como instruções de repositório, definições de ferramentas ou material de referência. O prefixo deve conter pelo menos 1.024 tokens e pode ser reutilizado em chamadas futuras ao modelo.
Quando uma solicitação subsequente corresponde ao prefixo em cache, a AWS diz que o Bedrock pode reduzir a latência de resposta e os custos de tokens de entrada. Tokens em cache são cobrados a uma taxa mais alta quando gravados, mas a AWS afirma que permanecem disponíveis por pelo menos 30 minutos. Solicitações correspondentes recebem preço descontado para tokens de entrada, e tokens em cache não contam para as cotas de tokens de entrada por minuto.
Esse design é especialmente relevante para assistente de programação com IA e fluxos de trabalho de agentes. Um agente pode reenviar a mesma orientação de sistema, o mesmo mapa da base de código ou o mesmo esquema de ferramentas ao longo de dezenas de turnos. O cache pode reduzir o peso das entradas repetidas, embora o benefício financeiro dependa das taxas de acerto do cache, do tamanho do prompt, da frequência das solicitações e dos preços regionais aplicáveis. O anúncio da AWS não informa os preços por token do Kimi K3.
Os desenvolvedores podem testar o Kimi K3 pelo console do Amazon Bedrock, abrindo Test and Playground e selecionando o modelo. As aplicações podem usar o endpoint Bedrock Runtime, as APIs Invoke e Converse do Amazon Bedrock, ou as APIs compatíveis com OpenAI Responses e Chat Completions.
A AWS oferece suporte ao modelo por meio de perfis de inferência entre regiões. O perfil global, identificado como global.moonshotai.kimi-k3, pode rotear solicitações para regiões comerciais da AWS compatíveis em todo o mundo. A AWS diz que a inferência global entre regiões custa aproximadamente 10% menos do que um perfil geográfico. Para clientes com requisitos de residência de dados nos EUA, o anúncio lista us.moonshotai.kimi-k3 como o perfil geográfico dos EUA.
A AWS também afirma que o Kimi K3 herda os controles da plataforma para modelos de peso aberto: os dados são processados dentro da fronteira de dados da AWS, não são compartilhados com o fornecedor do modelo e não são usados para treinar o modelo subjacente. A empresa diz que o zero data retention está habilitado para solicitações de inferência e que o zero operator access impede que operadores da AWS acessem prompts e completions durante a inferência. Essas são alegações de serviço e política da AWS; os compradores ainda devem validar a configuração exata, o roteamento regional, o registro e os termos contratuais para suas cargas de trabalho.
O anúncio coloca o Kimi K3 dentro da expansão mais ampla de modelos de peso aberto no Bedrock. A AWS afirma que o serviço adicionou dezenas de modelos desde 2025 de fornecedores como DeepSeek, Google, MiniMax, Mistral AI, Moonshot AI, NVIDIA, OpenAI e Qwen. Também diz que o Bedrock adicionou, em 2026, suporte em nível de plataforma para chamada de ferramentas, saída estruturada, raciocínio, streaming de respostas e as APIs Responses e Chat Completions.
Para builders, recursos em nível de plataforma podem reduzir o trabalho de integração necessário ao testar diferentes modelos. Uma equipe pode avaliar o Kimi K3 usando a autenticação, permissões, observabilidade e código de aplicação existentes do Bedrock, em vez de criar um caminho de inferência separado. A AWS lista bedrock:InvokeModel, bedrock:InvokeModelWithResponseStream e bedrock:CreateInference entre as permissões necessárias para chamar o modelo.
O anúncio também destaca o OpenCode, um assistente de programação open source e agnóstico em relação a modelos com um provedor nativo do Amazon Bedrock, bem como o Hermes Agent, um assistente de produtividade open source que oferece suporte a pesquisa e automação de tarefas. Esses exemplos mostram como o Kimi K3 poderia se encaixar em ferramentas existentes, mas são exemplos de integração, não evidência de adoção ampla ou desempenho superior.
Para equipes corporativas, a decisão prática provavelmente vai se concentrar na economia da carga de trabalho e na confiabilidade. O contexto longo e o cache do Kimi K3 podem ajudar aplicações com entradas estáveis e repetidas, enquanto a inferência entre regiões pode oferecer uma troca entre custo e capacidade. Equipes com requisitos rígidos de residência ou regulatórios precisarão escolher perfis geográficos com cuidado. Elas também devem testar a qualidade da saída em seus próprios repositórios e documentos, especialmente em tarefas de programação de longo horizonte, nas quais o simples aumento do contexto pode não evitar erros.
Os próximos sinais úteis serão avaliações independentes do Kimi K3 em programação, visão, uso de ferramentas e recuperação de contexto longo. Detalhes públicos de preços e a economia real de acertos de cache determinarão se o cache explícito de prompts altera materialmente o custo total da aplicação.
Os desenvolvedores também devem acompanhar relatórios de produção sobre latência, disponibilidade regional, limites de taxa e comportamento de falha sob cargas sustentadas de agentes. A adoção por assistentes de programação e frameworks de agentes pode fornecer uma indicação mais clara de se o acesso via Bedrock torna o Kimi K3 uma alternativa prática a outros modelos hospedados e autogerenciados.
A importância do Kimi K3 está menos em uma única alegação de contagem de parâmetros e mais na combinação de acesso a peso aberto, contexto longo, visão nativa e cache em um ambiente de nuvem gerenciado. A AWS está facilitando que as equipes testem essas capacidades sem abrir mão do modelo de implantação do Bedrock ao redor.
A principal incerteza continua sendo a evidência. As alegações da Moonshot AI sobre escala e eficiência não são comprovadas de forma independente no material fornecido, e uma janela de 1 milhão de tokens não se traduz automaticamente em comportamento confiável de agentes. Os builders devem tratar o lançamento como um novo alvo de avaliação: útil para cargas de trabalho com contexto repetido e entradas grandes, mas ainda sujeito a testes em nível de aplicação para qualidade, custo e adequação à governança de dados.