Zum Inhalt springen

Woche 7 | Session 3: Aufbau des Regressionsbaums — MSE, Aufteilungslogik & Vorhersagebeispiele

Kurs: Supply Chain Digitalisierung — Modul 3: Analytics im SCM



4 Vorhersagebeispiele — Anwendung des Regressionsbaums

Abschnitt betitelt „4 Vorhersagebeispiele — Anwendung des Regressionsbaums“
EinzelhändlerRegionKredit (₹L)StandortAlter (J.)Größe (K sqft)Aktion (0/1)FeiertagePrognostizierte NachfrageKnoten
AWest10Urban128 ≤ 30.5 ✓1 ✓32360 EinheitenKnoten 4
BOst14Ländlich23 > 17.5 ✓33 > 30.5 ✓018227 EinheitenKnoten 6
CNord3Semi-Urban1220 ≤ 30.5 ✓1 ✓22360 EinheitenKnoten 4
DSüd20Urban2012 ≤ 30.5 ✓0 ✗2943 EinheitenKnoten 3
  • Einzelhändler A & C: Landen im selben Knoten (Knoten 4 — 2360 Einheiten), obwohl sie in verschiedenen Regionen und an verschiedenen Standorten sind. Das Modell sagt uns: Diese Variablen sind nicht so wichtig wie Größe + Aktion.
  • Einzelhändler B: Großes + altes Geschäft. Landet in Knoten 6 — höchste Nachfrage, geringster Support.
  • Einzelhändler D: Kleines Geschäft + keine Aktion. Landet in Knoten 3 — geringste Nachfrage.

Warum Größe (30.5K sq ft)? Warum Aktion bei Knoten 1? Die Entscheidungen des Algorithmus werden ausschließlich dadurch bestimmt, welche Variable + Cutoff den MSE an jedem Knoten maximal reduziert — nicht durch menschliches Ermessen.

3-Schritte-Algorithmus zum Aufbau eines Regressionsbaums

Abschnitt betitelt „3-Schritte-Algorithmus zum Aufbau eines Regressionsbaums“
  1. Alle Trainingsdaten in den Wurzelknoten (Knoten 0) legen: 700 Beobachtungen in Knoten 0. Prognostizierte Nachfrage = ȳ = 2270. MSE = 8.151.813. Basisvorhersage = einfacher Durchschnitt.
  2. Wurzel aufteilen anhand von Variable + Cutoff, die die MAXIMALE Reduktion des MSE bringt: Alle Variablen + alle möglichen Cutoffs ausprobiert. Größe ≤ 30.5K sq ft brachte die maximale MSE-Reduktion.
  3. Schritt 2 für jeden internen Knoten wiederholen, bis Stoppkriterien erfüllt sind: Knoten 1 aufgeteilt nach Aktion. Knoten 2 aufgeteilt nach Alter. Stopp bei Tiefe 2.

Mean Squared Error (MSE) — Das Aufteilungskriterium

Abschnitt betitelt „Mean Squared Error (MSE) — Das Aufteilungskriterium“

Definition: MSE (Mittlerer quadratischer Fehler) = Durchschnitt der quadrierten Differenzen zwischen tatsächlicher Nachfrage und prognostizierter Nachfrage (Mittelwert). Zweck: Misst, wie sehr die Y-Werte um ihren Mittelwert innerhalb eines Knotens gestreut sind. Niedrigerer MSE = weniger Varianz = homogenere Gruppe = bessere Vorhersage.

MSE = (1/n) × Σᵢ₌₁ⁿ (yᵢ − ȳ)² (wobei yᵢ = tatsächliche Nachfrage von Einzelhändler i, ȳ = prognostizierte Nachfrage, n = Anzahl der Beobachtungen)

  • Quadrierter Fehler: Die Quadrierung stellt sicher, dass sich negative und positive Fehler nicht aufheben, und bestraft große Abweichungen stärker.
  • Mittelwert: Die Division durch n normiert auf die Knotengröße → vergleichbar über Knoten unterschiedlicher Größe hinweg.

An jedem Knoten: Alle (Variable, Cutoff) Kombinationen ausprobieren. Wähle (Variable, Cutoff), die die GRÖSSTE Reduktion des MSE bringt → dies ist der optimale Split.


KnotenBeob. (n)Prognostizierte Nachfrage (ȳ)MSE FormelMSE WertInterpretation
Knoten 0 (Wurzel)7002270Σ(yᵢ − 2270)² / 7008.151.813Basiswert — keine Merkmalsinfo. Hoher MSE = schlechte Vorhersage.
Knoten 1 (Größe ≤ 30.5K)6121902Σ(yᵢ − 1902)² / 6126.605.698MSE reduziert vs. Knoten 0. Homogenere Gruppe.
Knoten 2 (Größe > 30.5K)884829Σ(yᵢ − 4829)² / 8811.412.707Höherer MSE — große Geschäfte variieren stark in der Nachfrage.
Knoten 3 (Klein, keine Aktion)198943Σ(yᵢ − 943)² / 1982.384.088Niedriger MSE — kleine Geschäfte ohne Aktion clustern eng um 943.

Vor dem Split: Alle Einzelhändler in einer Gruppe → Mittelwert ȳ = 2270. Einzelhändler reichen von 0 bis 8000+ Einheiten → MSE sehr hoch. Nach Größen-Split: Kleine Geschäfte clustern um 1902. Große Geschäfte clustern um 4829. Jede Gruppe ist intern ähnlicher → niedrigerer MSE innerhalb jeder Gruppe.


Stoppkriterien — Wann man aufhören sollte zu teilen

Abschnitt betitelt „Stoppkriterien — Wann man aufhören sollte zu teilen“
StoppkriteriumDefinitionWie in diesem Beispiel verwendet
Max. BaumtiefeStoppt das Aufteilen, sobald der Baum eine vorgegebene Anzahl von Ebenen ab Wurzel erreichtTiefe = 2 hier verwendet. Danach nicht weiter aufgeteilt.
Min. Beobachtungen pro KnotenTeile nicht auf, wenn Knoten weniger als eine Mindestanzahl an Beobachtungen hatKnoten 6 hat nur 32 Beob. (5%). Bei Schwelle = 10% würde ein Stopp ausgelöst.
Min. MSE Reduktion (Delta Schwelle)Teile nicht auf, wenn die maximal mögliche MSE-Reduktion unter einer Schwelle δ liegtVerhindert, dass trivial kleine Verbesserungen unnötige Komplexität erzeugen.
  • Overfitting im Regressionsbaum: Wenn nicht gestoppt wird → Baum erstellt schließlich ein Blatt pro Einzelhändler → MSE bei Trainingsdaten = 0 → aber Modell scheitert komplett bei neuen Einzelhändlern (Testdaten).

Klassifikationsbaum vs. Regressionsbaum — Algorithmus-Vergleich

Abschnitt betitelt „Klassifikationsbaum vs. Regressionsbaum — Algorithmus-Vergleich“
Aspekt des BaumaufbausKlassifikationsbaum (Maschinenausfall)Regressionsbaum (Nachfrageprognose)
Zielvariable (Y)Kategorisch (Ausfall / Kein Ausfall)Kontinuierlich (Bestellmenge in Einheiten)
Vorhersage am BlattknotenMehrheitsklasse + WahrscheinlichkeitMittelwert (ȳ) aller Y-Werte in diesem Blatt
AufteilungskriteriumGini-Index oder Entropie (Unreinheitsreduktion)Mean Squared Error (MSE) (Varianzreduktion)
Stoppkriterienmax. Tiefe, min. Beob., min. Gini-Reduktionmax. Tiefe, min. Beob., min. MSE-Reduktion (δ)
HauptunterschiedNutzt Gini/Entropie als Metrik für Split-QualitätNutzt MSE als Metrik für Split-Qualität — die EINZIGE Änderung!

  • 4 Vorhersagebeispiele: A & C → Knoten 4 (2360, Aktion + kleines Geschäft) | B → Knoten 6 (8227, groß + alt) | D → Knoten 3 (943, klein, keine Aktion)
  • Aufbau-Algorithmus: 3 Schritte — alle Daten in Wurzel legen → mit Variable/Cutoff aufteilen, die max. MSE-Reduktion bringt → wiederholen bis Stoppkriterien erfüllt
  • MSE Formel: (1/n) × Σ(yᵢ − ȳ)² | Misst Varianz innerhalb der Gruppe | Niedrigerer MSE = bessere, homogenere Gruppe
  • MSE Werte: Knoten 0 = 8.151.813 → Knoten 1 = 6.605.698 → Knoten 3 = 2.384.088 (MSE reduziert sich mit jedem Split)
  • Stoppkriterien: Max. Tiefe | Min. Beobachtungen pro Knoten | Min. MSE-Reduktion pro Split (δ Schwelle)
  • vs. Klassifikationsbaum: Einziger Unterschied = MSE ersetzt Gini/Entropie als Aufteilungsmetrik. Alle anderen Schritte sind identisch.
  • Nächste Sessions: Python-Implementierung des Regressionsbaums für diesen Nachfrageprognose-Fall + Fehlermetriken (MAE, RMSE, MAPE)