Amazon SageMaker AI сообщил о 13 запусках для инференса в первой половине 2026 года. Они относятся к двум направлениям развертывания: полностью управляемым конечным точкам и Amazon SageMaker HyperPod Inference.

В описании упомянуты рекомендации для инференса, пулы экземпляров с учетом доступной емкости, многоуровневое кэширование KV, а также разделение этапов prefill и decode. AWS Machine Learning Blog представляет эти изменения как обзор запусков за первое полугодие.

Для пользователей это указывает на развитие инструментов управления инференсом и его оптимизации в экосистеме SageMaker AI. Но источник доступен только в виде метаданных и синопсиса, поэтому нельзя надежно оценить производительность, цены, географию доступности или эффект каждого запуска.