Pourquoi les petits modèles de langage échouent sur les tâches rares
Une étude révèle que les petits modèles oublient les tâches rares car les tâches fréquentes les écrasent lors de l'entraînement
Les chercheurs ont testé des modèles de 4 millions à 4 milliards de paramètres pour identifier ce mécanisme
Augmenter la fréquence de la tâche cible dans les données d'entraînement pourrait suffire, sans avoir besoin de scale up
1 rédaction rapporte ce fait
Factae établit le fait ; chaque récit est à un clic, chez sa rédaction.
4 millionsUne étude révèle que les petits modèles oublient les tâches rares car les tâches fréquentes…4 milliards de paramUne étude révèle que les petits modèles oublient les tâches rares car les tâches fréquentes…
Le fil de l’événement
13 faits · 7 juin → 13 août
Pourquoi les petits modèles de langage échouent sur les tâches raresVOUS ÊTES ICI