AWS, SageMaker Inference 지연 해소 위해 HyperPod 모델 캐싱과 접두사 라우팅 도입
AWS가 SageMaker HyperPod에 모델 캐싱을, SageMaker Inference에 접두사 인식 라우팅을 추가해 더 빠른 스케일아웃과 낮은 LLM 지연 시간을 노린다.
Amazon SageMaker HyperPod에 대한 최신 뉴스 및 분석
AWS가 SageMaker HyperPod에 모델 캐싱을, SageMaker Inference에 접두사 인식 라우팅을 추가해 더 빠른 스케일아웃과 낮은 LLM 지연 시간을 노린다.
Hugging Face와 AWS가 원클릭 SageMaker Studio 연결과 새로운 HyperPod 추론 기능을 추가해 기업용 AI 배포의 설정 부담을 줄였다.