Informatique
Multi Token Prediction accélère les modèles d'IA locaux
- Une technique appelée Multi Token Prediction booste les performances des LLMs locaux.
- Ce procédé permet d'augmenter significativement le débit de génération de texte.
- Testé par Heise, il réduit les temps de réponse sans perte de qualité.