AWS가 Moonshot AI의 Kimi K3를 Amazon Bedrock에 추가해, 비전, 긴 컨텍스트, 프롬프트 캐싱을 갖춘 오픈웨이트 모델을 개발자에게 제공한다.

Amazon Web Services는 Moonshot AI의 Kimi K3를 Amazon Bedrock에서 사용할 수 있도록 하여, 코딩과 지식 작업 워크로드를 겨냥한 오픈웨이트 모델을 추가했다. 이번 출시로 개발자는 AWS가 관리하는 추론 API를 통해 네이티브 이미지 이해, 100만 토큰 컨텍스트 창, 명시적 프롬프트 캐싱을 활용할 수 있다.
이번 출시는 대규모 저장소, 참고 문서, 도구 지시를 반복해서 전송하는 장기 실행 에이전트와 코딩 시스템을 구축하는 팀에 특히 중요하다. AWS는 Kimi K3를 Bedrock 콘솔에서 테스트하거나, OpenAI 호환 인터페이스를 포함한 Bedrock API를 통해 프로그램적으로 호출할 수 있다고 밝혔다. 다만 발표에서 제시된 가장 강력한 성능 및 효율성 주장은 독립 평가가 아니라 Moonshot AI 또는 AWS에 의한 것이다.
Kimi K3는 Kimi 모델 패밀리를 만든 Moonshot AI가 개발했다. AWS Machine Learning Blog에 따르면 Moonshot AI는 Kimi K3를 자사에서 가장 뛰어난 모델로 설명하며, 2.8조 파라미터에 도달한 최초의 오픈 모델이라고 주장한다. AWS는 또한 Moonshot이 Kimi K2 대비 스케일링 효율이 약 2.5배 향상됐다고 주장한 내용을 전한다.
이 수치는 공급업체가 제시한 것이며, 공개된 발표에는 독립적인 벤치마크 방법론, 가격 비교, 경쟁 모델과의 평가 결과가 포함되어 있지 않다. 개발자에게 더 구체적인 변화는 배포 접근성이다. 이제 Kimi K3는 고객이 별도의 서빙 스택을 관리할 필요 없이 Amazon Bedrock에서 다른 지원 모델과 함께 선택할 수 있다.
이 모델은 네이티브 비전 기능과 100만 토큰 컨텍스트 창을 결합한다. 이 구성은 소프트웨어 저장소, 기술 문서, 긴 비즈니스 기록, 이미지가 포함된 파일 등 작업 컨텍스트에 방대한 자료를 유지해야 하는 애플리케이션에 중요하다. 큰 컨텍스트 창이 그 모든 자료에 대해 자동으로 신뢰할 만한 추론을 보장하는 것은 아니므로, 프로덕션 팀은 여전히 검색, 평가, 컨텍스트 관리 제어가 필요하다.
AWS는 명시적 프롬프트 캐싱을 Bedrock에서 Kimi K3의 주요 실용적 차별점 중 하나로 내세우고 있다. 이 기능을 통해 개발자는 저장소 지침, 도구 정의, 참고 자료와 같은 재사용 가능한 프롬프트 접두사를 표시할 수 있다. 접두사에는 최소 1,024 토큰이 포함되어야 하며 이후 모델 호출에서 재사용될 수 있다.
이후 요청이 캐시된 접두사와 일치하면, AWS는 Bedrock이 응답 지연 시간과 입력 토큰 비용을 낮출 수 있다고 말한다. 캐시된 토큰은 기록될 때 더 높은 요율로 청구되지만, AWS는 최소 30분 동안 사용할 수 있다고 설명한다. 일치하는 요청은 할인된 입력 토큰 가격을 적용받으며, 캐시된 토큰은 분당 입력 토큰 한도에 포함되지 않는다.
이 설계는 AI 코딩 어시스턴트와 에이전트 워크플로에 특히 관련이 크다. 에이전트는 수십 번의 턴 동안 동일한 시스템 지침, 코드베이스 맵, 도구 스키마를 다시 보낼 수 있다. 캐싱은 반복 입력 부담을 줄일 수 있지만, 재정적 이점은 캐시 적중률, 프롬프트 크기, 요청 빈도, 적용되는 지역 가격에 따라 달라진다. AWS의 발표에는 Kimi K3의 토큰당 가격이 명시되어 있지 않다.
개발자는 Amazon Bedrock 콘솔에서 Test and Playground를 열고 모델을 선택해 Kimi K3를 시험해 볼 수 있다. 애플리케이션은 Bedrock Runtime 엔드포인트, Amazon Bedrock Invoke 및 Converse API, 또는 OpenAI 호환 Responses 및 Chat Completions API를 사용할 수 있다.
AWS는 교차 리전 추론 프로필을 통해 이 모델을 지원한다. global.moonshotai.kimi-k3로 식별되는 글로벌 프로필은 전 세계의 지원되는 AWS 상용 리전으로 요청을 라우팅할 수 있다. AWS는 글로벌 교차 리전 추론이 지리 프로필보다 약 10% 저렴하다고 말한다. 미국 데이터 거주 요건이 있는 고객을 위해 발표에는 us.moonshotai.kimi-k3가 미국 지리 프로필로 나와 있다.
AWS는 또한 Kimi K3가 오픈웨이트 모델에 대해 플랫폼이 제공하는 제어를 상속한다고 설명한다. 데이터는 AWS 데이터 경계 내에서 처리되며, 모델 제공업체와 공유되지 않고, 기본 모델 학습에도 사용되지 않는다. 또한 추론 요청에 대해 zero data retention이 활성화되어 있고, zero operator access를 통해 AWS 운영자가 추론 중 프롬프트와 완료 결과에 접근하지 못한다고 밝혔다. 이는 AWS 서비스 및 정책 주장이다. 구매자는 자신들의 워크로드에 맞는 정확한 구성, 지역 라우팅, 로깅, 계약 조건을 여전히 검증해야 한다.
이번 발표는 Kimi K3를 Bedrock에서 오픈웨이트 모델이 확대되는 흐름 속에 위치시킨다. AWS는 2025년 이후 DeepSeek, Google, MiniMax, Mistral AI, Moonshot AI, NVIDIA, OpenAI, Qwen 등 제공업체로부터 수십 개의 모델을 추가했다고 말한다. 또한 Bedrock은 2026년에 도구 호출, 구조화된 출력, 추론, 응답 스트리밍, Responses 및 Chat Completions API에 대한 플랫폼 수준 지원을 추가했다고 설명한다.
빌더에게 플랫폼 수준 기능은 서로 다른 모델을 시험할 때 필요한 통합 작업을 줄여줄 수 있다. 팀은 별도의 추론 경로를 만들지 않고도 기존 Bedrock 인증, 권한, 관측성, 애플리케이션 코드를 사용해 Kimi K3를 평가할 수 있다. AWS는 모델 호출에 필요한 권한으로 bedrock:InvokeModel, bedrock:InvokeModelWithResponseStream, bedrock:CreateInference를 나열한다.
발표는 또한 Amazon Bedrock 공급자를 기본으로 사용하는 모델 비종속 오픈소스 코딩 어시스턴트 OpenCode와, 연구 및 작업 자동화를 지원하는 오픈소스 생산성 어시스턴트 Hermes Agent도 강조한다. 이 사례들은 Kimi K3가 기존 도구에 어떻게 들어갈 수 있는지 보여주지만, 광범위한 채택이나 우월한 성능의 증거는 아니다.
기업 팀에게 실제 결정은 워크로드 경제성과 신뢰성에 달려 있을 가능성이 높다. Kimi K3의 긴 컨텍스트와 캐싱은 안정적이고 반복적인 입력을 가진 애플리케이션에 도움이 될 수 있으며, 교차 리전 추론은 비용 또는 용량의 절충안을 제공할 수 있다. 엄격한 거주지 또는 규제 요건이 있는 팀은 지리 프로필을 신중히 선택해야 한다. 또한 특히 장기 코딩 작업에서는 컨텍스트 길이만으로 오류를 막지 못할 수 있으므로, 자체 저장소와 문서에서 출력 품질을 테스트해야 한다.
앞으로 유용한 신호는 코딩, 비전, 도구 사용, 긴 컨텍스트 검색에서 Kimi K3에 대한 독립 평가가 될 것이다. 공개 가격 정보와 실제 캐시 적중 경제성이 명시적 프롬프트 캐싱이 전체 애플리케이션 비용을 실질적으로 바꾸는지를 결정할 것이다.
개발자는 또한 지속적인 에이전트 워크로드에서의 지연 시간, 지역 가용성, 속도 제한, 실패 동작에 대한 운영 보고도 주시해야 한다. 코딩 어시스턴트와 에이전트 프레임워크의 채택은 Bedrock 접근이 Kimi K3를 다른 호스팅 및 자체 관리 모델의 실용적 대안으로 만드는지에 대한 더 명확한 신호를 줄 수 있다.
Kimi K3의 의미는 단일 파라미터 수치 주장보다는 오픈웨이트 접근, 긴 컨텍스트, 네이티브 비전, 관리형 클라우드 환경의 캐싱이 결합되어 있다는 데 있다. AWS는 주변의 Bedrock 배포 모델을 포기하지 않고도 팀이 이러한 기능을 테스트하기 쉽게 만들고 있다.
가장 큰 불확실성은 여전히 근거다. Moonshot AI의 규모와 효율성 주장은 제공된 자료에서 독립적으로 입증되지 않았고, 100만 토큰 창이 곧바로 신뢰할 수 있는 에이전트 동작으로 이어지지는 않는다. 빌더는 이번 출시를 새로운 평가 대상로 봐야 한다. 반복되는 컨텍스트와 큰 입력이 필요한 워크로드에는 유용하지만, 품질, 비용, 데이터 거버넌스 적합성에 대해서는 여전히 애플리케이션 수준의 테스트가 필요하다.