Amazon SageMaker AI a annoncé 13 lancements pour l'inférence au cours du premier semestre 2026 année. Ils concernent deux voies de déploiement: points de terminaison entièrement gérés et Amazon SageMaker HyperPod Inference.

Dans la description, des recommandations pour l'inférence, des pools d'instances selon la capacité disponible, le cache KV à plusieurs niveaux, ainsi que la séparation des étapes prefill et decode sont mentionnés. AWS Machine Learning Blog présente ces changements comme un aperçu des lancements du premier semestre.

Pour les utilisateurs, cela indique le développement des outils de gestion et d'optimisation de l'inférence au sein de SageMaker AI. Mais la source n'est disponible que sous forme de métadonnées et de synopsis, donc il n'est pas possible d'évaluer de manière fiable les performances, les coûts, la géographie de disponibilité ou l'effet de chaque lancement.