← Alexis Flesch

Deux petites IA

Deux réseaux de neurones conçus en 2023, pour comprendre comment on apprend à une machine. Ils tournent dans votre navigateur : rien n'est envoyé nulle part.

Content, pas content réseau convolutif, 2023

Dessinez un visage : un petit réseau de neurones dit, en direct, s'il est content.

un visage : deux yeux, une bouche…

Les barres bougent pendant que vous tracez. Essayez de retourner la bouche, ou de ne dessiner qu'un œil.

Puissance 4 apprentissage par renforcement, 2023

Deux réseaux entraînés à jouer par renforcement : Grogu, une simple matrice, et Yoda, un vrai réseau de neurones. Battez-les, ou regardez-les s'affronter.

Votre adversaire, et ses taux de victoire

VouscontreGrogu

Une grille de Puissance 4 dessinée au crayon. Au-dessus de chaque colonne, une barre montre la note que le réseau lui donne.

Vous jouez les jetons rouges : cliquez sur une colonne, ou tapez 1 à 7. Le joueur attentif gagne quand il le peut et bloque toujours les menaces immédiates, sinon il joue au hasard ; taux mesurés sur 2 000 parties. Pendant le match, chaque réseau tire son coup au sort en favorisant fortement ses meilleures notes, pour que les parties varient.

Une expérience, pas un champion

Je voulais voir jusqu'où va un réseau qui juge les sept colonnes d'un coup d'œil, sans jamais calculer la suite de la partie, quand on l'entraîne par renforcement (DDQN). La réponse : il progresse vite, puis plafonne. Contre un joueur attentif, Yoda gagne 7 % des parties après 20 000 parties d'entraînement, 43 % après 200 000, 72 % après un million, et la courbe est alors à plat. Grogu, qui n'est qu'une matrice, ne dépasse pas 13 %, et Yoda le bat dans plus de neuf matchs sur dix.

Pour bien jouer au Puissance 4, il faut calculer : explorer l'arbre des coups, comme une recherche Monte-Carlo, ou comme AlphaZero, qui guide cette recherche avec un réseau. Le jeu est d'ailleurs résolu depuis 1988 : en jouant parfaitement, le premier joueur gagne toujours.