Les développeurs maîtrisent l'optimisation des modèles de langage pour réduire les coûts
Des ingénieurs partagent des techniques d'optimisation pour réduire les crashs et coûts des modèles LLM en production : speculative decoding, shrinking draft models. Les techniques permettent de diviser par plusieurs le coût des inférences sans perte de performance.
≈ 20s