AWS mira atrasos de inferência no SageMaker com cache de modelos do HyperPod e roteamento por prefixo
A AWS adiciona cache de modelo ao SageMaker HyperPod e roteamento sensível a prefixo ao SageMaker Inference, visando escala horizontal mais rápida e menor latência de LLM.
