AWS apunta a los retrasos de inferencia en SageMaker con el almacenamiento en caché de modelos de HyperPod y el enrutamiento por prefijo
AWS añade almacenamiento en caché de modelos a SageMaker HyperPod y enrutamiento con conocimiento de prefijo a SageMaker Inference, buscando un escalado horizontal más rápido y menor latencia en LLM.
