AWS cible les retards d’inférence SageMaker avec la mise en cache des modèles HyperPod et le routage par préfixe
AWS ajoute la mise en cache de modèles à SageMaker HyperPod et un routage sensible au préfixe à SageMaker Inference, visant un scale-out plus rapide et une latence LLM plus faible.
