NIM

Apprentissage par Renforcement

Choisis un mode et lance une partie

Partie en cours

Prêt à jouer
Bâtonnets restants
0

Historique des coups

    Entraîner l'IA

    Apprentissage par Renforcement
    Politique probabiliste · Mises à jour adaptatives

    Comment l'IA apprend (version simple)

    Elle répète des parties et ajuste ses décisions :

    1. État : nombre de bâtonnets restants
    2. Action : retirer 1, 2 ou 3
    3. Récompense : + en cas de victoire, − en cas de défaite
    4. Mise à jour : les bons choix deviennent plus probables
    Paramètres avancés — mode simplifié v

    Important : pour garder l'interface claire, seuls quelques réglages sont modifiables.

    Le reste est réglé automatiquement avec des valeurs stables.

    Conseil : change un seul paramètre à la fois, puis relance.

    Résultats

    STDOUT
    Aucun entraînement lancé.
    
    Clique sur "Lancer l'entraînement" pour commencer.

    Visualisation 3D

    Comment lire le graphique ?

    Le graphique 3D montre l'évolution des probabilités d'action pendant l'apprentissage. Le « paysage » se stabilise quand l'IA a convergé.

    Axe XNuméro de partie (progression)
    Axe YÉtat du jeu (bâtonnets restants)
    Axe ZProbabilité de l'action optimale
    Lance d'abord un entraînement dans l'onglet Entraîner l'IA pour générer les données.

    Métadonnées du graphe

    Les informations de paramètres et de configuration s'afficheront ici après chargement.

    Graphique de convergence

    3D

    Lance un entraînement avec l'option track_convergence activée,
    puis charge les données ici.

    Atelier des Boîtes de Nim

    Le principe (version ludique)

    On crée une boîte par état du jeu : la boîte 20 correspond à "il reste 20 bâtonnets", la boîte 19 à "il reste 19", etc.

    Dans chaque boîte, l'IA tire une boule colorée pour décider combien de bâtonnets retirer.

    À la fin de la partie seulement, on applique la règle d'apprentissage : victoire = +1 boule pour les choix mémorisés, défaite = -1 boule.

    1. 1. Observer : on regarde combien de bâtonnets il reste
    2. 2. Tirer une boule : la couleur indique "retirer 1", "retirer 2", "retirer 3"...
    3. 3. Mémoriser : on garde la trace de toutes les boules tirées pendant la partie
    4. 4. Renforcer : en fin de partie, on ajoute ou retire des boules selon le résultat

    Règle de mise à jour : pour chaque décision mémorisée dans la partie :

    Victoire IA - on ajoute +1 boule de la couleur tirée dans la boîte de l'état concerné.

    Défaite IA - on retire -1 boule (sans descendre sous 1) pour éviter de bloquer l'exploration.

    Mode actuel: Classique (+1/-1).

    Visualisation des boîtes

    Prêt

    Dernière partie

    Lance une nouvelle partie pour voir le tirage des boules puis le renforcement final.

    Diagnostic des résultats

    Pas assez de données pour conclure. Lance au moins 40 parties.

    Clique sur "Jouer 1 partie" pour commencer.

    Bonus · Aller plus loin

    Comparateur des modes: +1/-1 vs +3/-0

    Compare automatiquement les deux règles de renforcement sur plusieurs simulations. Ce bloc est optionnel et sert à aller plus loin après la prise en main.

    Aucune comparaison lancée.