RTX 4090 cooling, LLM KV cache quantization, Deepseek V4 flash models
Les ingénieurs discutent du refroidissement critical de la RTX 4090 pour les déploiements LLM. La quantification du cache KV réduit la mémoire sans dégradation significative d'inférence. Les modèles Deepseek V4 Flash offrent une alternative plus légère aux modèles complets.
OrganisationsNVIDIA
≈ 20s