Les ingénieurs discutent du refroidissement critical de la RTX 4090 pour les déploiements LLM.
La quantification du cache KV réduit la mémoire sans dégradation significative d'inférence.
Les modèles Deepseek V4 Flash offrent une alternative plus légère aux modèles complets.