Intelligence artificielle
Amazon SageMaker réduit la latence des LLM grâce à un routage optimisé
- Amazon SageMaker Inference introduit un routage sensible aux préfixes pour les requêtes LLM.
- La technologie maintient le cache KV chaud, améliorant les temps de réponse sur Llama 3.1 70B.
- Les tests montrent une réduction jusqu’à 77 % du temps pour le premier jeton.