AWS нацелен на задержки SageMaker Inference с помощью кэширования моделей HyperPod и маршрутизации по префиксу
AWS добавляет кэширование моделей в SageMaker HyperPod и маршрутизацию с учетом префикса в SageMaker Inference, нацеленную на более быстрое масштабирование и меньшую задержку LLM.
