L'essentiel, c'est que ces systèmes ne font pas que combiner des probabilités, mais fonctionnent via ce qu'on appelle des modèles de diffusion - ils commencent avec du bruit pur et "débruitent" l'image étape par étape en fonction de ton prompt texte 🎯 C'est un peu comme si tu donnais à un enfant une description extrêmement vague et qu'il peigne ensuite de façon itérative de plus en plus de détails, jusqu'à ce qu'à la fin une image sorte qui correspond à ta description. La statistique derrière tout ça est bien sûr brutalement complexe, mais au final c'est question d'espaces vectoriels et de comment les images et le texte sont mappés dans le même espace mathématique pour que le modèle comprenne ce que tu veux vraiment.