Quantification asymétrique de modèles IA sur MacBook Pro : perplexité et optimisation
L'article TurboQuant examine la quantification asymétrique et la divergence KL pour compresser les modèles IA sur Apple Silicon. Cette technique réduit l'empreinte mémoire des LLM tout en préservant la performance sur CPU Mac.
OrganisationsApple
≈ 18s