Entscheidungsbaum – Daten mit Ja/Nein-Fragen klassifizieren
InformatikDaten, KI und maschinelles LernenAlter 17–18
Wird geladen …
Zum Starten anmeldenDaten aus zwei Klassen in einer Ebene mit zwei Merkmalen (Wetter und Ausgehen, Apfel oder Zitrone, Test bestanden). Der Computer baut einen Entscheidungsbaum, indem er an jedem Knoten die Frage „Merkmal ≤ Schwellenwert?“ wählt, die die Gini-Unreinheit oder Entropie am stärksten senkt, oder die Lernenden schneiden Bereiche selbst und sehen die Abnahme der Unreinheit vorab. Die Ebene wird in Rechtecke geteilt, der Baum erscheint darunter; über die maximale Tiefe vergleichen Sie die Genauigkeit auf Trainings- und Testdaten und sehen Überanpassung deutlich.
Lektion: Maschinelles Lernen: Entscheidungsbäume, Gini-Unreinheit und Entropie, Trainings- und Testdaten, Überanpassung
Was sie zeigt
Ein Entscheidungsbaum klassifiziert ein Beispiel durch eine Kette von Ja/Nein-Fragen, die jeweils ein Merkmal mit einem Schwellenwert vergleichen; so wird die Merkmalsebene in Rechtecke geteilt. Die Daten entstehen aus einer verborgenen Regel mit zufällig vertauschten Labels (Rauschen); 70 % trainieren den Baum, 30 % bleiben zum Testen. An jedem Knoten wählt der Computer gierig den Schnitt, der die gewichtete Gini-Unreinheit oder Entropie am stärksten senkt. Tiefere Bäume passen besser zu den Trainingsdaten, lernen aber auch das Rauschen auswendig, sodass die Testgenauigkeit nicht mehr steigt oder sinkt.
So funktioniert es
Stellen Sie unter Computer baut den Baum die Maximale Tiefe von 1 bis 8 ein und beobachten Sie Trainings- und Testgenauigkeit im Diagramm. Wechseln Sie zu Eigene Fragen stellen, wählen Sie Senkrechter Schnitt oder Waagrechter Schnitt, sehen Sie die Vorschau und klicken Sie in einen Bereich. Vergleichen Sie mit Beste Frage, machen Sie mit Zusammenführen rückgängig und drücken Sie Neue Daten.
Einstellbare Parameter
- Datensatz Rausgehen? (Temperatur, Luftfeuchtigkeit), Apfel oder Zitrone? (Masse, Rötung der Schale), Test bestanden? (Lernstunden, Probetest)
- Anzahl der Datenpunkte 40–200 Punkte
- Rauschen (Anteil vertauschter Labels) 0–30 %
- Maximale Baumtiefe 1–8
- Teilungskriterium Gini-Unreinheit, Entropie (Informationsgewinn)
- Testdaten anzeigen
Fragen zum Erkunden
- Warum steigt die Trainingsgenauigkeit mit der Tiefe immer weiter, die Testgenauigkeit aber nicht?
- Warum braucht der Datensatz „Test bestanden?“ mit seiner schrägen Grenze so viele Fragen?
- Was verrät die erste Frage an der Wurzel über die Daten?