KVQuant permet d'exécuter des modèles IA massifs sur des appareils limités
L'outil KVQuant compresse en temps réel la mémoire cache KV des modèles linguistiques.
Il permet de faire fonctionner des modèles de 70 milliards de paramètres sur des ordinateurs avec 8 Go de RAM.
1 rédaction rapporte ce fait
Factae établit le fait ; chaque récit est à un clic, chez sa rédaction.