Un benchmark teste si les modèles IA détectent vraiment les mensonges informatiques
BullshitBench est un nouveau benchmark posant la question : les modèles IA détectent-ils vraiment les mensonges ?
L'évaluation teste la capacité des IA à reconnaître les affirmations fausses et la désinformation structurée.
1 rédaction rapporte ce fait
Factae établit le fait ; chaque récit est à un clic, chez sa rédaction.