AWS、HyperPodのモデルキャッシュとプレフィックスルーティングでSageMaker推論の遅延に対処
AWSは、SageMaker HyperPodにモデルキャッシュを、SageMaker Inferenceにプレフィックス対応ルーティングを追加し、より速いスケールアウトとLLMの低遅延を狙う。
Amazon SageMaker HyperPodに関する最新ニュースと分析
AWSは、SageMaker HyperPodにモデルキャッシュを、SageMaker Inferenceにプレフィックス対応ルーティングを追加し、より速いスケールアウトとLLMの低遅延を狙う。
Hugging Face と AWS は、ワンクリックの SageMaker Studio 引き継ぎと新しい HyperPod 推論機能を追加し、企業向け AI 展開のセットアップ負荷を軽減した。