NIM
Apprentissage par Renforcement
Partie en cours
Historique des coups
Entraîner l'IA
Comment l'IA apprend (version simple)
Elle répète des parties et ajuste ses décisions :
- État : nombre de bâtonnets restants
- Action : retirer 1, 2 ou 3
- Récompense : + en cas de victoire, − en cas de défaite
- Mise à jour : les bons choix deviennent plus probables
Paramètres avancés — mode simplifié v
Important : pour garder l'interface claire, seuls quelques réglages sont modifiables.
Le reste est réglé automatiquement avec des valeurs stables.
Conseil : change un seul paramètre à la fois, puis relance.
Résultats
STDOUTAucun entraînement lancé. Clique sur "Lancer l'entraînement" pour commencer.
Visualisation 3D
Comment lire le graphique ?
Le graphique 3D montre l'évolution des probabilités d'action pendant l'apprentissage. Le « paysage » se stabilise quand l'IA a convergé.
Métadonnées du graphe
Les informations de paramètres et de configuration s'afficheront ici après chargement.
Graphique de convergence
Lance un entraînement avec l'option track_convergence activée,
puis charge
les données ici.
Atelier des Boîtes de Nim
Le principe (version ludique)
On crée une boîte par état du jeu : la boîte 20 correspond à "il reste 20 bâtonnets", la boîte 19 à "il reste 19", etc.
Dans chaque boîte, l'IA tire une boule colorée pour décider combien de bâtonnets retirer.
À la fin de la partie seulement, on applique la règle d'apprentissage : victoire = +1 boule pour les choix mémorisés, défaite = -1 boule.
- 1. Observer : on regarde combien de bâtonnets il reste
- 2. Tirer une boule : la couleur indique "retirer 1", "retirer 2", "retirer 3"...
- 3. Mémoriser : on garde la trace de toutes les boules tirées pendant la partie
- 4. Renforcer : en fin de partie, on ajoute ou retire des boules selon le résultat
Règle de mise à jour : pour chaque décision mémorisée dans la partie :
Victoire IA - on ajoute +1 boule de la couleur tirée dans la boîte de l'état concerné.
Défaite IA - on retire -1 boule (sans descendre sous 1) pour éviter de bloquer l'exploration.
Mode actuel: Classique (+1/-1).
Visualisation des boîtes
Dernière partie
Lance une nouvelle partie pour voir le tirage des boules puis le renforcement final.
Diagnostic des résultats
Pas assez de données pour conclure. Lance au moins 40 parties.
Clique sur "Jouer 1 partie" pour commencer.
Bonus · Aller plus loin
Comparateur des modes: +1/-1 vs +3/-0
Compare automatiquement les deux règles de renforcement sur plusieurs simulations. Ce bloc est optionnel et sert à aller plus loin après la prise en main.
Aucune comparaison lancée.