Zum Inhalt springen

Tag 6 - GenAI Business Cases

Generative AI for Managers - TUHH Institute of Entrepreneurship · Teil meines Technology-Management-MBA · Lernnotizen zur Wiederholung.


Die Tage 1 bis 5 drehten sich darum, wie die Technik funktioniert - Prompting, Retrieval, Extraktion, Agenten und ein bisschen Machine Learning. Tag 6 dreht die ganze Fragestellung um. In den ersten fünf Tagen habe ich immer wieder gefragt: “Können wir das bauen?” Heute zählt nur noch die Managerfrage: “Sollten wir das bauen - und wenn ja, warum, und wie würde ich es belegen?”

Das ist also der Tag, an dem aus dem technischen Stoff ein Business Case wird: ein kurzes, ehrliches Dokument, das eine Entscheiderin oder einen Entscheider überzeugt, ein kleines Pilotprojekt zu finanzieren. Unten stehen meine Wiederholungsnotizen, wie man so einen aufbaut - in der Reihenfolge, in der der Kurs ihn durchgeht.

Fachbegriffe kurz erklärt. GenAI = generative KI, also Werkzeuge wie Large Language Models (LLMs), die Text, Code oder Bilder erzeugen. MVP = Minimum Viable Product, die kleinste Version, die trotzdem echten Nutzen stiftet. Pilot = ein kleiner, zeitlich befristeter Test mit einer Handvoll echter Nutzer, bevor irgendetwas breit ausgerollt wird.

Der ganze Tag läuft auf ein einziges Paket zu, das ein echtes Team einem Steering Committee (der Gruppe erfahrener Führungskräfte, die Budgets freigeben) vorlegen würde. Es entsteht in vier Blöcken, von denen jeder in den nächsten mündet:

A · Auswählendie richtige Idee
→
B · Belegenden Wert
→
C · Gestaltendas Produkt
→
D · Deployment& messen
Die vier Blöcke von Tag 6 - jeder übergibt sein Ergebnis an den nächsten.

Am Ende hast du sechs zusammenhängende Bausteine:

#BausteinWas er beantwortet
1Use-Case-OnepagerWelches Problem, in Business-Begriffen formuliert
2Prozesslandkarte + Wert-SizingWie GenAI die Arbeit verändert und was es spart
3MVP-Anforderungen (PRD)Was gebaut wird, für wen, in welcher Reihenfolge
4Build/Buy + ArchitekturskizzeWie es funktioniert, und Make-vs-Buy
5Rollout-Plan + KPIsWie du es einführst und den Erfolg belegst
6Governance-lite-ChecklisteWie du es sicher und verantwortungsvoll hältst

Der Rest dieses Kapitels ist eigentlich nur das Denken hinter jedem dieser Punkte.

Nicht jede Aufgabe ist ein guter GenAI-Kandidat. Der schnellste Weg, Geld zu verbrennen, ist, die Technik auf die falsche Aufgabe anzusetzen. Zwei schnelle Perspektiven helfen.

Gute Passung vs. schlechte Passung. GenAI glänzt bei repetitiven Sprach-Aufgaben und darin, unstrukturierten, unübersichtlichen Text in etwas Strukturiertes oder Brauchbares zu verwandeln.

Gute Passung für GenAISchlechte Passung - nochmal überdenken
Repetitives Verfassen (E-Mails, Antworten, Zusammenfassungen)Einmalentscheidungen, die nur ein paar Mal im Jahr anfallen
Unübersichtlichen Text strukturieren (Rechnungen → Daten)Aufgaben, bei denen niemand beurteilen kann, ob das Ergebnis gut ist
Fragen über die eigenen Dokumente beantworten”Eine ganze Abteilung ersetzen”
Anfragen mit hohem Volumen klassifizieren oder weiterleitenAlles, wofür Daten nötig sind, auf die du rechtlich nicht zugreifen darfst

Der MVP-taugliche Filter. Ein starker Kandidat besteht alle fünf Prüfungen:

FilterDie Frage dazuBestanden, wenn…
Hohes VolumenPassiert das hunderte/tausende Male pro Jahr?z. B. 500 Tickets/Woche
Klarer Input/OutputKann ich definieren, was reingeht und wie “gut” aussieht?Feste Antwortkategorien; ein Datenschema
Bewertbare QualitätKann ich messen, ob das Ergebnis etwas taugt?50 Stichproben per Hand prüfen; ≥85 % Genauigkeit
Geringe MVP-KomplexitätKann eine nützliche v1 ohne komplexe Integrationen existieren?Ein eigenständiges Tool, bevor man es in Altsysteme verdrahtet
Machbarer DatenzugriffBekomme ich die Daten unter Richtlinien und Gesetz?Interne Dokumente - nicht personenbezogene Kundendaten ohne Kontrollen

Und die Anti-Muster, die man sofort erkennen sollte - vage, nicht messbare oder unmöglich breite Ideen:

“Ein Chatbot für alles""Ein ganzes Team ersetzen”Kein Weg zu den DatenErfolg nicht messbar

Sobald du eine Liste von Ideenkandidaten hast, sortierst du sie nach Wirkung zuerst, mit einem realistischen Weg zum Piloten. Zwei Werkzeuge erledigen das.

Die Value-×-Time-to-value-2×2-Matrix. Trage jede Idee danach ab, wie viel Wert sie schafft, gegen die Geschwindigkeit, mit der dieser Wert eintrifft (“Time-to-value” = wie lange, bis du Ergebnisse siehst).

Schnell zum WertLangsam zum Wert
Hoher WertQuick Wins - zuerst starten, Schwung aufbauenStrategische Wetten - sorgfältig planen, brauchen Rückhalt der Geschäftsleitung
Geringer WertLückenfüller - nur wenn Ressourcen brachliegenVermeiden - keine Mühe verschwenden

Das 1-5-Bewertungsraster. Bewerte jede Idee der engeren Auswahl nach fünf Kriterien, insgesamt maximal 25 Punkte. Beachte, dass zwei Kriterien umgekehrt sind - bei Time-to-value und Risiko bedeutet ein hoher Wert “schnell” bzw. “geringes Risiko”, höher ist also immer besser.

KriteriumPunkt 1 (niedrig)Punkt 3 (mittel)Punkt 5 (hoch)
WertpotenzialKleine Erleichterung (unter 5 % gespart)Spürbar (15-25 % weniger Handarbeit)Groß (>500 Tsd. €/Jahr oder starke Risikosenkung)
Time-to-value umgekehrt6+ Monate bis ROI2-3 Monate bis Pilotergebnisseunter 4 Wochen bis zu ersten Ergebnissen
MachbarkeitGroße Integration, wackelige Daten1-2 Systeme, strukturierte DatenPlug-and-play, Standardformate
Risiko/Randbedingungen umgekehrtReguliert, sensible personenbezogene DatenEinige sensible Daten, Richtlinien vorhandenNur interne Daten, geringes Risiko
BewertbarkeitKeine Kennzahl, subjektivProxy-Kennzahlen vorhandenKlare Ground Truth, leicht prüfbar

Lies die Gesamtsumme so: 18+ ist meist MVP-reif; 12-17 braucht mehr Validierung; unter 12 nochmal überdenken. Eine menschliche Anmerkung aus dem Kurs, die ich mag - frag nach der Rechnerei auch: Liegt dem Team dieser Bereich überhaupt am Herzen? Die beste Wahl ist oft der Prozess, über den sich jemand seit Jahren persönlich ärgert.

Fachbegriffe kurz erklärt. ROI = Return on Investment (der Wert, den du zurückbekommst, gegenüber dem, was du ausgibst). Ground Truth = eine bekannt-korrekte Antwort, mit der du die Ausgabe der KI vergleichen kannst.

Das Ergebnis dieses Schritts ist der Use-Case-Onepager - dein Business Case auf einer einzigen Seite verdichtet:

  1. Use-Case-Name - klar, nicht niedlich (z. B. “Automatische Extraktion von Rechnungspositionen”).
  2. Hauptnutzer - wer, in welcher Abteilung, und wie oft sie die Aufgabe erledigen.
  3. Problemstellung - 2-3 Sätze: welche Handarbeit anfällt, der Schmerz, warum es wichtig ist.
  4. Warum GenAI (statt einfacher Regeln oder klassischem Machine Learning) - drei Stichpunkte.
  5. Randbedingungen & Abhängigkeiten - Datensensibilität, Systeme, Zeitplan, nötige Freigaben.
  6. Erwarteter Wert - wo möglich quantifiziert, angegeben als Spanne.
  7. Score & nächste Schritte - die Rastersumme, und was vor dem MVP-Design zu validieren ist.

Ein Onepager erzeugt Aufmerksamkeit; eine Prozesslandkarte plus Wert-Sizing macht daraus einen Business Case. Das ist Block B.

Bilde einen Workflow ab, vorher und nachher. Wähle einen einzelnen Workflow (6-10 Schritte - nicht das ganze Unternehmen). Zeichne zuerst die Ist-Landkarte: jeden Schritt, wer ihn macht, wie lange er dauert und wo sich Fehler oder Nacharbeit einschleichen. Zeichne dann die Soll-Landkarte mit GenAI, das nur dort eingesetzt wird, wo es wirklich hilft, und behalte für jede echte Entscheidung einen Menschen in der Schleife.

Ticket lesen
→
Wissensdatenbank durchsuchen
→
Antwort entwerfen
→
Prüfung durch Vorgesetzte
→
Senden · ~37 Min
KI entwirft Antwort
→
Agent prüft
→
Bearbeiten & senden
→
Automatisch protokolliert · ~6 Min
Ein Support-Ticket-Beispiel: Die KI entwirft, aber der Mensch prüft und sendet weiterhin. Das Urteil bleibt menschlich; die Fleißarbeit schrumpft.

Beachte, was menschlich blieb - die Schritte Prüfen und Senden. GenAI assistiert; es ersetzt nicht das Urteilsvermögen bei irgendetwas, das mit Kunden zu tun hat.

Beziffere den Wert mit transparenter Rechnung. Du baust kein ausgeklügeltes Finanzmodell (kein DCF - Discounted Cash Flow, eine detaillierte Bewertung über mehrere Jahre). Du brauchst nur “gut genug”-Zahlen, die nachvollziehbar sind, um einen Piloten zu rechtfertigen:

Jährlich gesparte Stunden = (Volumen pro Jahr × gesparte Minuten pro Fall) ÷ 60 Jährlicher Wert = jährlich gesparte Stunden × Vollkosten-Stundensatz

“Vollkosten-Stundensatz” bedeutet der voll durchgerechnete Stundensatz der Person (Gehalt plus Overhead). Gib immer eine Spanne niedrig / wahrscheinlich / hoch an und schreibe deine Annahmen auf - die Ehrlichkeit zählt mehr als falsche Präzision. Beziehe deine Volumina aus echten Daten (“wir protokollieren ~500 Tickets pro Woche”), nie aus “ganz vielen”.

AnnahmeNiedrigWahrscheinlichHoch
Tickets pro Jahr26.00026.00026.000
Gesparte Minuten pro Ticket152531
Jährlich gesparte Stunden6.50010.83313.433
Vollkosten-Stundensatz45 €45 €45 €
Jährliche Zeitersparnis292.500 €487.500 €604.500 €
+ Qualitätsersparnis (weniger Nacharbeit)39.000 €78.000 €117.000 €
Jährlicher Gesamtwert331.500 €565.500 €721.500 €

Dann verknüpft ein 6-zeiliges Business-Case-Narrativ alles miteinander: woher der Wert kommt, warum er messbar ist, deine größte Annahme plus wie du sie testen wirst, die Hauptrisiken, wie Erfolg nach 30 Tagen aussieht und was dich zum Abbruch bewegen würde.

Block C macht aus der Idee etwas Baubares: ein PRD, eine Architekturskizze und eine Build-vs-Buy-Entscheidung.

Das MVP-PRD (Product Requirements Document - die Spezifikation dessen, was du baust). Bei GenAI ist die eigentliche Aufgabe des PRD die Scope-Disziplin: Das größte Risiko in jedem KI-Projekt ist Scope Creep (endloses Hinzufügen von Features). Es muss enthalten:

  1. Zielnutzer + Job-to-be-done (JTBD) - das Ergebnis, das der Nutzer tatsächlich will.
  2. 3-5 User Stories - “Als [Rolle] möchte ich [etwas], damit [Nutzen].”
  3. Ausgabeformat + Randbedingungen - wie “gut” aussieht (Tonfall, Latenz, Genauigkeit).
  4. Nicht-Features - eine explizite Liste dessen, was du nicht baust. Das ist der wertvollste Teil; Nein sagen ist das, was ein 12-Wochen-MVP von einem 18-Monats-Marathon unterscheidet.
  5. Abnahmekriterien - testbare Bestanden/Durchgefallen-Schwellen (z. B. “80 %+ der Vorschläge werden über einen 2-wöchigen Piloten angenommen”).

Wähle ein Architekturmuster und skizziere es. Jede Skizze muss vier Dinge zeigen: Datenquellen (was du liest), Ausgaben (was du schreibst), Freigabepunkte durch Menschen (wo Risiko gesteuert wird) und Logging (was du misst). Die vier Muster auf Managementebene lassen sich sauber auf die Tage 1-5 abbilden:

Vorschläge innerhalb eines bestehenden Tools. Die KI entwirft, der Mensch gibt frei.

Nutzer arbeitet im ToolKI schlägt vorMensch bearbeitet/lehnt abAktion ausgeführt
Am besten für: Effizienz innerhalb aktueller Workflows. Baut auf: Prompting (Tag 1).

Build vs. Buy. Baust du selbst, kaufst du eine Plattform, oder gehst du hybrid? Kürze den Vergleich auf das, was für einen Piloten zählt:

KriteriumSelbst bauenPlattform kaufen
Geschwindigkeit bis MVPLangsam (8-16 Wochen)Schnell (2-4 Wochen)
Daten & SicherheitVolle KontrolleVom Anbieter abhängig
Kosten Jahr 1Hoch (Entwickler)Mittel (Lizenz)
DifferenzierungHoch (eigene Logik)Gering (wie bei der Konkurrenz)
Vendor-Lock-inKeinerHoch

Der Kurs ist hier erfrischend direkt: Das ist keine Ethikvorlesung, sondern operative Pragmatik. Lässt du sie aus, lädst du Datenschutzverletzungen, Widerstand der Nutzer und Verlust von Glaubwürdigkeit ein. “Governance-lite” ist das Minimum, das du klären musst, bevor ein Pilot live geht.

BereichKernfragePilot-Minimum
DatenklassifizierungWelche Daten sieht das Modell?Jeden Input als öffentlich / intern / vertraulich kennzeichnen
ZugriffskontrolleWer darf das Tool nutzen?Rollen und Berechtigungen definieren; protokollieren, wer zugreift
Logging & AuditWas muss festgehalten werden?Inputs, Outputs, Nutzeraktionen, Zeitstempel protokollieren
BewertungsplanWoher wissen wir, dass es funktioniert?50-100 gelabelte Testfälle; ein Rhythmus für menschliche Prüfung
Human-in-the-loop (HITL)Wer gibt folgenreiche Aktionen frei?Prüfumfang und Eskalationspfad definieren

Benenne daneben deine Fehlermodi ehrlich - Halluzination (das Modell erfindet falsche Fakten), Bias, Datenlecks, Ablehnung durch Nutzer - und lege im Voraus fest, wann ein Mensch eingreift und wer den Piloten stoppen darf.

Block D ist das Deployment. Du legst nicht für alle auf einmal den Schalter um; du rollst in drei Phasen aus, jede mit einem “Erfolgs-Gate”, das erreicht sein muss, bevor du erweiterst.

  1. Tage 1-30 - Pilot. Wähle eine kleine Pilotgruppe (sagen wir 5-10 Nutzer) und begründe, warum gerade sie. Schule sie, gib eine Prompt-Bibliothek und einen Nutzungsleitfaden mit, fahre eine wöchentliche Feedback-Schleife. Gate: Ist das “gut genug, um weiterzumachen”?
  2. Tage 31-60 - Erweitern. Vergrößere die Gruppe anhand der Pilot-Erkenntnisse, behebe die drei größten Probleme, verfeinere Prompts und Freigabe-Gates. Gate: Ist das “bereit zum Skalieren”?
  3. Tage 61-90 - Skalieren. Voller Rollout im Team/in der Abteilung, Integration mit bestehenden Systemen, ein laufender Monitoring-Rhythmus, und die erste formale ROI-Auswertung.

KPIs: vorlaufend und nachlaufend. Ein KPI (Key Performance Indicator) ist eine Zahl, die du verfolgst, um den Erfolg zu beurteilen. Du brauchst zwei Arten - vorlaufende Indikatoren (leading) sagen dir früh, ob die Leute es annehmen; nachlaufende Indikatoren (lagging) sagen dir später, ob echter Wert entstanden ist.

TypWas er misstWann du ihn siehst
Vorlaufend (leading)Annahme & NutzungSofort (z. B. wöchentlich aktive Nutzer)
Nachlaufend (lagging)GeschäftsergebnisseNach Wochen/Monaten (z. B. Kosten pro Fall)

Verteile deine KPIs auf vier Kategorien und gib jedem eine Definition, eine Datenquelle und ein Ziel:

KategorieWas sie verfolgtBeispiel-KPIs
AnnahmeNutzen die Leute es?Wöchentlich aktive Nutzer; Aufgaben pro Nutzer
EffizienzGeht die Arbeit schneller?Bearbeitungszeit (vorher vs. nachher); Durchsatz
QualitätIst das Ergebnis gut?Nacharbeitsquote; Übersteuerungsquote durch Menschen
GeschäftsergebnisseHat es etwas bewegt?Kosten pro Fall; CSAT oder Durchlaufzeit

“Übersteuerungsquote durch Menschen” - wie oft Nutzer den Vorschlag der KI ablehnen - ist meine liebste stille Kennzahl: eine hohe ist ein Frühwarnsignal, dass die Qualität noch nicht da ist.

Das Schöne an diesem Tag ist, dass nichts aus den früheren Tagen verschwendet ist - die technische Souveränität wird zur Glaubwürdigkeit hinter dem Business Case.

Aus einem früheren TagWas es mir gabWie Tag 6 es nutzt
Prompting (Tag 1)Zuverlässige Ausgabe aus einem LLM bekommenDas Copilot-Muster; Prompt-Bibliotheken für den Rollout schreiben
RAG (Tag 2)Antworten in echten Dokumenten verankernDas Architekturmuster des RAG-Assistenten
Extraktion (Tag 3)Unübersichtlicher Text → strukturierte DatenDas Extractor→Workflow-Muster; Rechnungs-artige Use Cases
Agenten (Tag 4)Mehrstufige, Tool-nutzende KIDas Agentic-Muster, mit menschlichen Freigabe-Gates
Machine Learning (Tag 5)Wann klassisches ML GenAI schlägt (und umgekehrt)Begründen, “warum GenAI, nicht Regeln oder klassisches ML”

Die technischen Fähigkeiten geben dir das Recht, geglaubt zu werden; das Business-Denken gibt dir die Wirkung.

Tag 6 hat keine Notebooks zum Herunterladen - das Ergebnis ist ein Team-Capstone, keine Programmierübung. In Teams erstellt ihr das komplette Capstone Proposal Pack und pitcht es, als ginge es an eine CEO, die entscheidet, ob der Pilot finanziert wird.

Es gibt zwei Dinge einzureichen:

  1. Das Capstone Proposal Pack - ein PDF (~9-10 Seiten) mit allen sechs Komponenten: dem Use-Case-Onepager, Prozesslandkarte + Wert-Sizing, MVP-PRD, Build/Buy + Architekturskizze, Rollout-Plan + KPIs und der Governance-lite-Checkliste.
  2. Der Pitch - ein Foliensatz (8-12 Folien) plus ein aufgezeichnetes 10-Minuten-Video (Link auf der ersten oder letzten Folie). Der Pitch läuft: Problem → Warum jetzt → MVP → Wert → Plan → Ask, und sollte mit dem Geschäftsproblem beginnen, nicht mit der Technik.

Die Bewertung belohnt Konkretheit über Ehrgeiz - ein detaillierter Plan für einen einfachen Use Case schlägt einen vagen Plan für einen grandiosen. Der goldene Test durchgehend: Wenn ein Leser nicht erkennen kann, wer was wann macht und wie Erfolg gemessen wird, ist es nicht fertig. (Das Pack ist außerdem so angelegt, dass es sich natürlich zu einer Masterarbeit erweitern lässt, wenn du es weiterführen möchtest.)

Meine Capstone-Abgabe: Business-Case-Vorschlag (PDF) · Pitch-Deck (PDF) - die finalen Abgaben meines Teams für den Kurs.

KernpunktKurz gemerkt
Der KernwechselWeg von “können wir es bauen?” hin zu “sollten wir - und kann ich es belegen?”
Guter Use CaseAbgegrenzt + messbar + als ~4-Wochen-MVP machbar.
GenAI-SweetspotRepetitive Sprachaufgaben und Unübersichtlicher-Text-zu-Struktur, bei hohem Volumen.
MVP-FilterHohes Volumen · klarer I/O · bewertbar · geringe Komplexität · Daten, auf die du zugreifen kannst.
PriorisierungValue × Time-to-value als 2×2, dann 1-5 über fünf Kriterien bewerten (18+ = bereit).
Wert-Sizing(Volumen × gesparte Minuten ÷ 60) × Vollkosten, immer als niedrig/wahrscheinlich/hoch.
Mensch bleibt drinGenAI entwirft; der Mensch prüft und gibt alles frei, was zählt.
Eigentliche Aufgabe des PRDScope-Disziplin - die Liste der Nicht-Features ist der wertvollste Teil.
ArchitekturmusterCopilot · RAG · Extractor · Agentic - jedes bildet eine Fähigkeit aus Tag 1-5 ab.
Build vs. BuyKernvorteil → build; Commodity-Effizienz → buy.
Governance-liteDaten klassifizieren, Zugriff kontrollieren, alles loggen, Evals planen, HITL behalten.
Rollout & KPIs30/60/90-Phasen mit Gates; vorlaufende und nachlaufende KPIs verfolgen.
Das CapstoneEin 6-teiliges Proposal Pack + ein 10-Minuten-Pitch, der mit dem Problem beginnt.