AWS zielt mit SageMaker Inference auf Verzögerungen durch HyperPod-Model-Caching und Prefix-Routing
AWS ergänzt SageMaker HyperPod um Model-Caching und SageMaker Inference um prefixbewusstes Routing, um schnelleres Scale-out und geringere LLM-Latenz zu erreichen.
