Arbre de décision – classer des données par questions oui/non
InformatiqueDonnées, IA et apprentissage automatique17–18 ans
Chargement…
Connectez-vous pour lancerDes données de deux classes dans un plan défini par deux caractéristiques (la météo et la sortie, pomme ou citron, réussite à un test). L’ordinateur construit un arbre de décision en choisissant à chaque nœud la question « caractéristique ≤ seuil ? » qui réduit le plus l’impureté de Gini ou l’entropie, ou les élèves découpent eux-mêmes des régions en voyant à l’avance la baisse d’impureté. Le plan est divisé en rectangles et l’arbre s’affiche dessous ; modifiez la profondeur maximale pour comparer l’exactitude sur les données d’entraînement et de test et voir nettement le surapprentissage.
Leçon : Apprentissage automatique : arbres de décision, impureté de Gini et entropie, données d’entraînement et de test, surapprentissage
Ce qu’elle montre
Un arbre de décision classe un exemple par une suite de questions oui/non, chacune comparant une caractéristique à un seuil ; le plan est donc découpé en rectangles. Les données viennent d’une règle cachée avec des étiquettes inversées au hasard (bruit) ; 70 % servent à entraîner l’arbre et 30 % sont gardées pour le test. À chaque nœud, l’ordinateur choisit de façon gloutonne la coupe qui réduit le plus l’impureté de Gini ou l’entropie pondérées. Un arbre plus profond colle mieux à l’entraînement, mais peut apprendre le bruit par cœur : l’exactitude de test cesse de progresser ou baisse.
Mode d’emploi
Dans Arbre automatique, faites varier la Profondeur maximale de 1 à 8 et suivez l’exactitude d’entraînement et de test sur le graphique. Passez à Posez vos questions, choisissez Coupe verticale ou Coupe horizontale, survolez pour l’aperçu puis cliquez dans une région. Comparez avec Meilleure question, annulez avec Fusionner et appuyez sur Nouvelles données.
Paramètres modifiables
- Jeu de données Sortir ? (température, humidité), Pomme ou citron ? (masse, rougeur de la peau), Test réussi ? (heures de révision, test d’entraînement)
- Nombre de données 40–200 points
- Bruit (part d’étiquettes inversées) 0–30 %
- Profondeur maximale de l’arbre 1–8
- Critère de découpage Impureté de Gini, Entropie (gain d’information)
- Afficher les données de test
Questions à explorer
- Pourquoi l’exactitude d’entraînement augmente-t-elle toujours avec la profondeur, mais pas celle de test ?
- Pourquoi le jeu « Test réussi ? », à frontière diagonale, demande-t-il autant de questions ?
- Que vous apprend la première question choisie à la racine sur les données ?