Éditeurs d'IA : où trouvent-ils les milliards de textes d'entraînement ?
Les éditeurs de systèmes d'intelligence artificielle restent très discrets sur les sources de leurs données d'entraînement.
Ces entreprises accumulent des montagnes de textes pour développer leurs modèles sans transparence publique.
La question des droits d'auteur et de l'origine légale des corpus pose des enjeux majeurs pour l'édition et la création.