AWS lleva Kimi K3 de Moonshot AI a Amazon Bedrock con contexto largo y almacenamiento en caché de prompts

AWS ha añadido Kimi K3 de Moonshot AI a Amazon Bedrock, ofreciendo a los desarrolladores un modelo de peso abierto con visión, contexto largo y almacenamiento en caché de prompts.

AI News

Amazon Web Services ha puesto Kimi K3 de Moonshot AI a disposición en Amazon Bedrock, sumando un modelo de peso abierto orientado a cargas de trabajo de programación y trabajo del conocimiento. El lanzamiento da a los desarrolladores acceso a comprensión nativa de imágenes, una ventana de contexto de 1 millón de tokens y almacenamiento en caché explícito de prompts mediante APIs de inferencia gestionadas por AWS.

El lanzamiento importa sobre todo para equipos que construyen agentes de larga duración y sistemas de programación que envían repetidamente grandes repositorios, documentos de referencia o instrucciones de herramientas. AWS afirma que Kimi K3 puede probarse en la consola de Bedrock o llamarse programáticamente a través de las APIs de Bedrock, incluidas interfaces compatibles con OpenAI. Sin embargo, las afirmaciones más fuertes sobre capacidad y eficiencia en el anuncio provienen de Moonshot AI o de AWS, más que de evaluaciones independientes.

Kimi K3 llega como una opción de peso abierto en Bedrock

Kimi K3 fue desarrollado por Moonshot AI, la empresa detrás de la familia de modelos Kimi. Según el AWS Machine Learning Blog, Moonshot AI describe Kimi K3 como su modelo más capaz y afirma que es el primer modelo abierto en alcanzar 2,8 billones de parámetros. AWS también informa de la afirmación de Moonshot de una mejora de aproximadamente 2,5 veces en la eficiencia de escalado frente a Kimi K2.

Esas cifras son reportadas por el proveedor y el anuncio disponible no ofrece una metodología de benchmark independiente, una comparación de precios ni resultados de evaluación frente a modelos competidores. El cambio más concreto para los desarrolladores es el acceso de despliegue: ahora Kimi K3 puede seleccionarse en Amazon Bedrock junto con otros modelos compatibles, en lugar de requerir una pila de servicio separada gestionada por el cliente.

El modelo combina capacidades nativas de visión con una ventana de contexto de 1 millón de tokens. Esa configuración es relevante para aplicaciones que necesitan mantener grandes cantidades de material en el contexto de trabajo, incluidos repositorios de software, documentación técnica, extensos registros empresariales y archivos con imágenes. Una gran ventana de contexto no garantiza por sí sola un razonamiento fiable sobre todo ese material, por lo que los equipos de producción seguirán necesitando controles de recuperación, evaluación y gestión del contexto.

El almacenamiento en caché de prompts apunta al contexto repetido

AWS está posicionando el almacenamiento en caché explícito de prompts como uno de los principales diferenciadores prácticos de Kimi K3 en Bedrock. La función permite a los desarrolladores marcar un prefijo de prompt reutilizable, como instrucciones del repositorio, definiciones de herramientas o material de referencia. El prefijo debe contener al menos 1.024 tokens y puede reutilizarse en llamadas posteriores al modelo.

Cuando una solicitud posterior coincide con el prefijo almacenado en caché, AWS dice que Bedrock puede reducir la latencia de respuesta y los costes de los tokens de entrada. Los tokens almacenados en caché se facturan a una tarifa más alta cuando se escriben, pero AWS dice que permanecen disponibles durante al menos 30 minutos. Las solicitudes coincidentes reciben un precio descontado para los tokens de entrada, y los tokens almacenados en caché no cuentan para las cuotas de tokens de entrada por minuto.

Ese diseño es especialmente relevante para asistente de programación con IA y flujos de trabajo de agentes. Un agente puede reenviar la misma guía del sistema, el mapa de la base de código o el esquema de herramientas durante decenas de turnos. El almacenamiento en caché podría reducir la carga de entradas repetidas, aunque el beneficio financiero dependerá de las tasas de acierto de la caché, el tamaño del prompt, la frecuencia de las solicitudes y los precios regionales aplicables. El anuncio de AWS no indica los precios por token de Kimi K3.

Bedrock gestiona el acceso, las APIs y los controles de datos

Los desarrolladores pueden probar Kimi K3 a través de la consola de Amazon Bedrock abriendo Test and Playground y seleccionando el modelo. Las aplicaciones pueden usar el endpoint Bedrock Runtime, las APIs Invoke y Converse de Amazon Bedrock, o las APIs compatibles con OpenAI Responses y Chat Completions.

AWS admite el modelo mediante perfiles de inferencia entre regiones. El perfil global, identificado como global.moonshotai.kimi-k3, puede enrutar solicitudes a regiones comerciales compatibles de AWS en todo el mundo. AWS afirma que la inferencia global entre regiones cuesta aproximadamente un 10 % menos que un perfil geográfico. Para clientes con requisitos de residencia de datos en EE. UU., el anuncio enumera us.moonshotai.kimi-k3 como el perfil geográfico de EE. UU.

AWS también dice que Kimi K3 hereda los controles de la plataforma para modelos de peso abierto: los datos se procesan dentro del perímetro de datos de AWS, no se comparten con el proveedor del modelo y no se usan para entrenar el modelo subyacente. La compañía dice que la retención cero de datos está habilitada para las solicitudes de inferencia y que el acceso cero de operadores impide que los operadores de AWS accedan a prompts y completions durante la inferencia. Estas son afirmaciones de servicio y política de AWS; aun así, los compradores deberían validar la configuración exacta, el enrutamiento regional, el registro y los términos contractuales para sus cargas de trabajo.

Evidencia, ecosistema e implicaciones para los creadores

El anuncio sitúa Kimi K3 dentro de la expansión más amplia de modelos de peso abierto en Bedrock. AWS afirma que el servicio ha añadido decenas de modelos desde 2025 de proveedores como DeepSeek, Google, MiniMax, Mistral AI, Moonshot AI, NVIDIA, OpenAI y Qwen. También dice que Bedrock añadió en 2026 soporte a nivel de plataforma para llamadas a herramientas, salida estructurada, razonamiento, transmisión de respuestas y las APIs Responses y Chat Completions.

Para los creadores, las funciones a nivel de plataforma pueden reducir el trabajo de integración necesario al probar diferentes modelos. Un equipo puede evaluar Kimi K3 usando la autenticación, los permisos, la observabilidad y el código de aplicación existentes de Bedrock en lugar de crear una ruta de inferencia separada. AWS enumera bedrock:InvokeModel, bedrock:InvokeModelWithResponseStream y bedrock:CreateInference entre los permisos necesarios para llamar al modelo.

El anuncio también destaca OpenCode, un asistente de programación de código abierto e independiente del modelo con un proveedor nativo de Amazon Bedrock, así como Hermes Agent, un asistente de productividad de código abierto que admite investigación y automatización de tareas. Estos ejemplos muestran cómo Kimi K3 podría encajar en herramientas existentes, pero son ejemplos de integración y no evidencia de adopción amplia o de rendimiento superior.

Para los equipos empresariales, la decisión práctica probablemente girará en torno a la economía de la carga de trabajo y la fiabilidad. El contexto largo y el almacenamiento en caché de Kimi K3 pueden ayudar a aplicaciones con entradas estables y repetidas, mientras que la inferencia entre regiones puede ofrecer un intercambio entre coste y capacidad. Los equipos con requisitos estrictos de residencia o regulación deberán elegir cuidadosamente los perfiles geográficos. También deberían probar la calidad de salida en sus propios repositorios y documentos, especialmente en tareas de programación de largo alcance donde la longitud del contexto por sí sola puede no evitar errores.

Qué vigilar a continuación

Las próximas señales útiles serán evaluaciones independientes de Kimi K3 en programación, visión, uso de herramientas y recuperación de contexto largo. Los detalles públicos de precios y la economía real de aciertos de caché determinarán si el almacenamiento en caché explícito de prompts cambia de forma material el coste total de la aplicación.

Los desarrolladores también deberían vigilar informes de producción sobre latencia, disponibilidad regional, límites de tasa y comportamiento ante fallos bajo cargas sostenidas de agentes. La adopción por asistentes de programación y marcos de agentes podría ofrecer una indicación más clara de si el acceso mediante Bedrock convierte a Kimi K3 en una alternativa práctica a otros modelos alojados y autogestionados.

Perspectiva de Creati.ai

La importancia de Kimi K3 tiene menos que ver con una sola afirmación sobre el número de parámetros y más con la combinación de acceso de peso abierto, contexto largo, visión nativa y almacenamiento en caché en un entorno de nube gestionado. AWS está facilitando que los equipos prueben esas capacidades sin renunciar al modelo de despliegue de Bedrock que las rodea.

La principal incertidumbre sigue siendo la evidencia. Las afirmaciones de Moonshot AI sobre escala y eficiencia no están respaldadas de forma independiente en el material proporcionado, y una ventana de 1 millón de tokens no se traducirá automáticamente en un comportamiento fiable de los agentes. Los creadores deberían tratar el lanzamiento como un nuevo objetivo de evaluación: útil para cargas de trabajo con contexto repetido y entradas grandes, pero aún sujeto a pruebas a nivel de aplicación para calidad, coste y adecuación a la gobernanza de datos.

Anuncios