KVQuant permet d'exécuter des modèles IA massifs sur des appareils limités
L'outil KVQuant compresse en temps réel la mémoire cache KV des modèles linguistiques.
Il permet de faire fonctionner des modèles de 70 milliards de paramètres sur des ordinateurs avec 8 Go de RAM.
Les chiffres du fait
70 milliards de paramIl permet de faire fonctionner des modèles de 70 milliards de paramètres sur des ordinateurs…
Le fil de l’événement13 faits · 15 avr. → 16 juil.