Un benchmark teste si les modèles IA détectent vraiment les mensonges informatiques
BullshitBench est un nouveau benchmark posant la question : les modèles IA détectent-ils vraiment les mensonges ? L'évaluation teste la capacité des IA à reconnaître les affirmations fausses et la désinformation structurée.
≈ 18s