Zum Inhalt springen

Woche 7 | Session 2: Nachfrageprognose — Regressionsbaum-Fallstudie (FMCG)

Kurs: Supply Chain Digitalisierung — Modul 3: Analytics im SCM



  • Setting: Großes FMCG-Unternehmen mit einem Netzwerk von Einzelhändlern in ganz Indien
  • Problem: Leiter der Bedarfsplanung ist mit der Prognosegenauigkeit unzufrieden. Die Lücke zwischen tatsächlicher und prognostizierter Nachfrage führt entweder zu Überbeständen ODER zu entgangenen Umsätzen.
  • Auslöser: Manager nahm an einem KI-ML-Training teil → verstand, dass KI-ML notwendig ist, da sich Nachfragemuster schnell ändern
  • Ziel: Entwicklung eines besseren Modells zur Nachfrageprognose, um die Lücke zwischen tatsächlicher und prognostizierter Nachfrage zu verkleinern → geringere Lagerkosten + weniger entgangene Umsätze
  • Gewähltes Modell: Regressionsbaum (Entscheidungsbaum mit kontinuierlichem Output) — prognostiziert die BESTELLMENGE für jeden Einzelhändler

Regressionsbaum vs. Klassifikationsbaum — Hauptunterschied

Abschnitt betitelt „Regressionsbaum vs. Klassifikationsbaum — Hauptunterschied“
AspektKlassifikationsbaumRegressionsbaum
Art der Zielvariablen (Y)Kategorisch (z.B. Ausfall / Kein Ausfall)Kontinuierlich (z.B. Bestellmenge in Einheiten)
Vorhersage am BlattknotenLabel der Mehrheitsklasse (z.B. “Ausgefallen”)Mittelwert (ȳ) aller Y-Werte in diesem Knoten
AufteilungskriteriumGini-Index oder Entropie (unreinheitsbasiert)Mean Squared Error (MSE) / Varianzreduktion
Verwendung in diesem Kurs fürPredictive Maintenance (Maschinenausfall)Vorhersage der Bestellmenge von Einzelhändlern

Datenaufbau — 1000 Einzelhändler, 7 Merkmale, 1 Ziel

Abschnitt betitelt „Datenaufbau — 1000 Einzelhändler, 7 Merkmale, 1 Ziel“
  • Datensatz: 1000 Einzelhändler. Jede Zeile = ein Einzelhändler in einer Woche.
  • Train-Test-Split: 700 Beobachtungen fürs Training (70%) | 300 fürs Testen (30%)
  • Ziel (Y): Bestellmenge (Order Quantity) — kontinuierliche Anzahl an Einheiten, die dieser Einzelhändler in dieser Woche bestellt hat

7 unabhängige Variablen (Merkmale) + 1 Zielvariable

Abschnitt betitelt „7 unabhängige Variablen (Merkmale) + 1 Zielvariable“
#VariableTyp / EinheitWarum es für die Nachfrage wichtig ist
X1RegionKategorisch (Süd/Ost/West/Nord)Geografische Nachfragemuster variieren erheblich nach Region.
X2Ausstehender KreditbetragKontinuierlich (₹ Lakhs)Betrag, den der Einzelhändler dem FMCG-Unternehmen noch schuldet.
X3StandortKategorisch (Urban / Semi-urban / Ländlich)Städtische Einzelhändler haben typischerweise mehr Laufkundschaft → höhere Nachfrage.
X4Alter des EinzelhändlersKontinuierlich (Jahre)Ältere Einzelhändler haben stärkere Kundenbeziehungen, treuen Kundenstamm → mehr Laufkundschaft.
X5Größe des GeschäftsKontinuierlich (‘000 sq ft)Größeres Geschäft → mehr ausgestellte Produkte → mehr Laufkundschaft.
X6Aktionsangebot (Promotion)Binär (1 = angeboten, 0 = nicht angeboten)Aktionen kurbeln die Nachfrage direkt an. In einer Aktionswoche → deutlich höhere Bestellungen.
X7Anzahl an FeiertagenZählung (0, 1, 2, 3…)Mehr Feiertage → mehr Einkaufsanlässe → höhere Nachfrage in dieser Woche.
YBestellmenge (Ziel)Kontinuierlich (Bestellte Einheiten)Wie viele Einheiten der Einzelhändler in dieser Woche bestellt.

  • Verwendetes Modell: Regressionsbaum | Trainingsdaten: 700 Beob. | Baumtiefe: 2
  • Vom Modell ausgewählte Variablen: Größe des Geschäfts | Aktionsangebot | Alter des Geschäfts → Modell ignorierte Region, Kredit, Standort, Feiertage als weniger differenzierend

Alle 7 Knoten — Bedingungen, prognostizierte Nachfrage (Mittelwert), Support

Abschnitt betitelt „Alle 7 Knoten — Bedingungen, prognostizierte Nachfrage (Mittelwert), Support“
KnotenTypBedingungen zum Erreichen dieses KnotensAufteilungsvariable & SchwellenwertPrognostizierte Nachfrage (ȳ)Beob.Support
0 (Wurzel)InternAlle TrainingsdatenGröße ≤ 30.5K sq ft2270 (Basiswert)700100%
1InternGröße des Geschäfts ≤ 30.5K sq ftAktion (0 oder 1)190261287%
2InternGröße des Geschäfts > 30.5K sq ftAlter (≤ 17.5 Jahre)48298813%
3 (Blatt)BLATTGröße ≤ 30.5K sq ft, Aktion = 0STOPP94319828%
4 (Blatt)BLATTGröße ≤ 30.5K sq ft, Aktion = 1STOPP236041459%
5 (Blatt)BLATTGröße > 30.5K sq ft, Alter ≤ 17.5 JahreSTOPP2887568%
6 (Blatt)BLATTGröße > 30.5K sq ft, Alter > 17.5 JahreSTOPP8227325%

Wie sich die Vorhersage mit jeder Aufteilung verbessert

Abschnitt betitelt „Wie sich die Vorhersage mit jeder Aufteilung verbessert“
StufeVerwendete InformationenPrognostizierte NachfrageInterpretation
Knoten 0 (Keine Info)Keine — Zufallsauswahl aus 700 Einzelhändlern2270 (ȳ für alle)Basiswert: einfacher Durchschnitt aller Bestellungen.
Nach Split 1 (Knoten 1)Geschäftsgröße ≤ 30.5K sq ft1902 (↓ von 2270)Hinzufügen von Größeninfos verfeinert Prognose für kleine Geschäfte.
Nach Split 1 (Knoten 2)Geschäftsgröße > 30.5K sq ft4829 (↑ von 2270)Große Geschäfte bestellen viel mehr. Prognose springt auf 4829.
Nach Split 2 (Knoten 4)Größe ≤ 30.5K + Aktion = 12360 (Aktionseffekt: +458)Gleiches kleines Geschäft, aber mit Aktion → Nachfrage steigt.
Nach Split 2 (Knoten 6)Größe > 30.5K + Alter > 17.5 J.8227 (alt + groß = am höchsten)Großes UND altes Geschäft = höchste prognostizierte Nachfrage.

Kernlogik: Mehr relevante Informationen über einen Einzelhändler → verfeinerte Gruppe, in die er fällt → Mittelwert dieser Gruppe liegt näher an seiner tatsächlichen Nachfrage.


4 Geschäftsregeln — Referenzkarte für die Praxis

Abschnitt betitelt „4 Geschäftsregeln — Referenzkarte für die Praxis“
RegelBedingung 1 (Größe)Bedingung 2 (Aktion oder Alter)Profil des EinzelhändlersPrognostizierte NachfrageSupport
R1 (Knoten 3)Größe ≤ 30.5K sq ftAktion = 0 (Kein Angebot)Kleines Geschäft, keine Aktion → wöchentlich geringe Nachfrage943 Einheiten28%
R2 (Knoten 4)Größe ≤ 30.5K sq ftAktion = 1 (Angebot aktiv)Kleines Geschäft ABER Aktion läuft → Nachfrage angekurbelt2360 Einheiten59%
R3 (Knoten 5)Größe > 30.5K sq ftAlter ≤ 17.5 J. (Relativ neu)Großes, aber neueres Geschäft — noch kein starker Kundenstamm2887 Einheiten8%
R4 (Knoten 6)Größe > 30.5K sq ftAlter > 17.5 J. (Alt, etabliert)Großes UND altes Geschäft → treue Kunden, hohe Laufkundschaft → höchste Nachfrage8227 Einheiten5%

Gegebene Daten für Einzelhändler A: Region: West | Kredit: ₹10 Lakh | Standort: Urban | Alter: 12 Jahre | Geschäftsgröße: 8.000 sq ft (8K) | Aktionsangebot: Ja (1) | Anzahl Feiertage: 3

  1. Geschäftsgröße prüfen: 8K sq ft ≤ 30.5K sq ft → gehe zu Knoten 1 (linker Zweig)
  2. Aktion prüfen: Aktion = 1 → gehe zu Knoten 4 (rechter Zweig von Knoten 1)
  3. Ergebnis: Knoten 4 → Prognostizierte Nachfrage = 2360 Einheiten

Interpretation des Supports — Wie zuversichtlich ist die Vorhersage?

Abschnitt betitelt „Interpretation des Supports — Wie zuversichtlich ist die Vorhersage?“

Support = % der Trainingsbeobachtungen, die in diesen Blattknoten fallen.

  • Knoten 4 (59% Support): Am zuverlässigsten — deckt die Mehrheit der kleinen Geschäfte + Aktions-Einzelhändler ab.
  • Knoten 6 (5% Support): Geringste Zuversicht — nur 32 von 700 sind große + alte Geschäfte.

Können wir uns noch weiter verbessern? — Tieferer Baum

Abschnitt betitelt „Können wir uns noch weiter verbessern? — Tieferer Baum“
  • Ja: Knoten mit zusätzlichen Merkmalen weiter aufteilen → geringerer Mean Squared Error innerhalb jedes Blattes → Vorhersagen rücken näher an die tatsächliche Nachfrage heran.
  • Nachteil: Tieferer Baum = bessere Trainingsgenauigkeit, ABER höheres Risiko für Overfitting. Es gelten die gleichen Stoppkriterien wie beim Klassifikationsbaum (Max. Tiefe, Min. Beobachtungen, Min. Varianzreduktion).

  • Fall: Leiter der Bedarfsplanung eines FMCG-Unternehmens → nutzt Regressionsbaum zur Prognose von Bestellmengen.
  • Regressionsbaum vs. Klassifikationsbaum: Kontinuierliches Ziel → Blatt prognostiziert den Mittelwert (ȳ). Aufteilungskriterium = Varianzreduktion (nicht Gini).
  • Modell wählt 3 von 7 Merkmalen: Größe des Geschäfts | Aktionsangebot | Alter des Geschäfts
  • 4 Blattknoten → 4 Geschäftsregeln: 943 (klein, keine Aktion) | 2360 (klein + Aktion, 59% Support) | 2887 (groß + jung) | 8227 (groß + alt — höchste Nachfrage)
  • Vorhersage für Einzelhändler A: Größe = 8K sq ft (≤ 30.5K) | Aktion = 1 → Knoten 4 → Prognostizierte Nachfrage = 2360 Einheiten
  • Nächste Session: Erstellen eines Regressionsbaums in Python + Fehlermetriken für Nachfrageprognosen (MAE, RMSE, MAPE)