vendredi 11 septembre 2026ven. 11 sept.1311 faits, 174 médias, 14 pays
FFactae.The Factual NewsDes signaux, du bruit, des faits…
‹ Tous les sujets

Amazon SageMaker réduit la latence des LLM grâce à un routage optimisé

ia1 faits au totalémergence 0
Intelligence artificielle1 rédaction

Amazon SageMaker réduit la latence des LLM grâce à un routage optimisé

  • Amazon SageMaker Inference introduit un routage sensible aux préfixes pour les requêtes LLM.
  • La technologie maintient le cache KV chaud, améliorant les temps de réponse sur Llama 3.1 70B.
  • Les tests montrent une réduction jusqu’à 77 % du temps pour le premier jeton.
Lire à la source