Exécuter Qwen 3.6-27B sur 800 dollars de GPU grand public sans cloud
Un ingénieur a exécuté le modèle Qwen 3.6-27B sur des GPU consumer pour 800 dollars le premier jour.
La comparaison entre llama.cpp et vLLM montre les coûts et performances respectifs.
Le test prouve que l inférence LLM peut fonctionner sans infrastructure cloud coûteuse.