Les caches KV réduits ne suffisent pas à accélérer les transformeurs
La réduction de la taille du cache KV ne résout pas les goulots d'étranglement de performance lors de la génération de texte en contexte étendu.
Les transformeurs modernes doivent conserver des caches de clé-valeur importants pour traiter les longs contenus.
1 rédaction rapporte ce fait
Factae établit le fait ; chaque récit est à un clic, chez sa rédaction.