Comprendre les transformeurs : construire les couches du décodeur
Une série pédagogique poursuit l'explication des architectures transformers en détaillant l'implémentation des couches de décodage essentielles.
Le décodeur utilise une auto-attention masquée et une attention croisée pour générer des séquences token par token en respectant le contexte.
Cette profondeur mathématique intéresse les chercheurs et les développeurs d'IA modernes.