Zum Inhalt springen

Tag 1 - LLMs & Transformer: Der Motor hinter GenAI

Generative AI for Managers - TUHH Institute of Entrepreneurship · Teil meines Technology-Management-MBA · Lernnotizen zur Wiederholung.


Tag 1 war die Session nach dem Motto „Motorhaube öffnen und den Motor anschauen”. Keine Mathematik, kein Programmieren - nur der Aufbau eines ehrlichen mentalen Modells davon, was ein großes Sprachmodell (LLM) wirklich ist, damit alles, was wir später machen (Prompting, Retrieval, Agenten, Business Cases), auf festem Boden steht. Das hier sind meine Wiederholungsnotizen, so geschrieben, wie ich es einer Kollegin oder einem Kollegen bei einem Kaffee erklären würde.

Der eine nützlichste Gedanke, den man sich vorher merken sollte: Ein LLM ist keine Datenbank voller Fakten und auch kein denkender Mensch. Es ist ein sehr, sehr guter Rater des nächsten Wortes. Fast jede Stärke und jede Schwäche, die wir sehen werden, folgt direkt aus diesem einen Satz.

KI ist nicht über Nacht entstanden. Sie hat sich durch einige klar unterscheidbare Epochen bewegt, und jede davon veränderte, wer die harte Arbeit übernahm, die Regeln herauszufinden.

EpocheAnsatzWas das in der Praxis bedeutete
1950er-1990erHandgeschriebene RegelnEin Mensch schrieb jedes „wenn dies, dann das” von Hand - z. B. wenn die Nachricht „Rückerstattung” enthält, schicke sie ans Retouren-Team.
1990er-2010erMachine LearningMenschen wählten nützliche Merkmale aus; der Computer lernte die Gewichte aus gelabelten Beispielen (klassische Spam-Filter).
2010erDeep LearningNeuronale Netze lernten die Muster selbst aus gelabelten Daten (Bilderkennung, Sprache).
2017-heuteLarge Language ModelsNetze lernen Sprache direkt aus riesigen Mengen Rohtext - keine handgeschriebenen Regeln, keine manuellen Merkmale.

Die entscheidende Verschiebung betrifft den Aufwand. Ältere Systeme brauchten einen Menschen, der die Regeln definierte oder die wichtigen Signale von Hand auswählte. LLMs überspringen das: Sie lesen Rohtext in einem Umfang, den kein Mensch je bewältigen könnte, und ermitteln die Muster von selbst. Das ist der Sprung, der die heutigen Chatbots möglich gemacht hat.

Wenn man den ganzen Hype wegkratzt, tut ein LLM genau eine Sache: Es schaut sich einen Text an und sagt vorher, was als Nächstes kommt.

Gib ihm „Die Hauptstadt von Frankreich ist” und es sagt mit hoher Sicherheit „Paris” vorher. Das ist alles. Aber jetzt kommt der clevere Teil - um in diesem einen Spiel gut zu werden, ist das Modell gezwungen, Grammatik, Fakten, Denkmuster, Schreibstile und sogar die Struktur von Programmcode aufzusaugen. Man kann über Milliarden von Sätzen hinweg nicht zuverlässig das nächste Wort erraten, ohne all das unterwegs mitzunehmen.

Wie wird aus „ein Wort raten” also ein ganzer Absatz? Durch eine Schleife namens autoregressive Generierung - ein hochtrabender Begriff für eine simple Gewohnheit: ein Token vorhersagen, es hinten anhängen, dann anhand des längeren Textes erneut vorhersagen. Das Modell frisst laufend seine eigene Ausgabe.

Prompt„Die Hauptstadt von Frankreich ist”
→
1 Token vorhersagen„Paris”
→
Anhängen & wiederholen„…Paris. Sie ist…”
→
StoppEnd-Token oder Längenlimit
Text wird Token für Token erzeugt; jedes neue Token wird zurückgespeist, bevor das nächste gewählt wird. Die Schleife stoppt an einem natürlichen Endpunkt oder bei einer Maximallänge.
  1. Beginne mit deiner Eingabe: „Die Hauptstadt von Frankreich ist”.
  2. Sage das nächste Token vorher und füge es hinzu → „Die Hauptstadt von Frankreich ist Paris”.
  3. Speise das Ganze zurück und sage erneut vorher → „…Paris.”
  4. Schleife weiter → „…Paris. Sie ist” → „…Paris. Sie ist die größte…”
  5. Stopp, wenn das Modell ein „Ende”-Signal ausgibt oder das von dir gesetzte Längenlimit erreicht.

Das lohnt sich zu verinnerlichen, weil es viel vom alltäglichen Verhalten erklärt: Das Modell hat keinen Plan für die gesamte Antwort im Voraus, es legt sich Token für Token fest. Deshalb kann eine kleine falsche Abzweigung am Anfang eine Lawine auslösen, und deshalb kann derselbe Prompt bei verschiedenen Durchläufen unterschiedliche Antworten liefern.

3 · Tokens: die Bausteine, die das Modell tatsächlich liest

Abschnitt betitelt „3 · Tokens: die Bausteine, die das Modell tatsächlich liest“

Wir sagen bewusst immer „Token” statt „Wort”, denn LLMs lesen keine ganzen Wörter. Sie lesen Tokens - Textstücke, die oft, aber nicht immer, ein ganzes Wort sind.

TextWie er in Tokens zerfällt
Hello["Hello"] - ein gängiges Wort, ein Token
ChatGPT["Chat", "G", "PT"] - eine ungewöhnliche Zeichenkette, in Stücke geteilt
unhappiness["un", "happiness"] - ein Präfix plus ein bekannter Baustein

Warum die Wörter so zerhacken? Weil gängige Stücke weitaus häufiger vorkommen als seltene ganze Wörter. Das Arbeiten mit wiederverwendbaren Bausteinen hält das Vokabular des Modells überschaubar und erlaubt ihm, nie zuvor gesehene Wörter zu verarbeiten, indem es sie aus vertrauten Teilen zusammensetzt.

3.1 Wie Tokenisierung funktioniert - BPE in einer Zeile

Abschnitt betitelt „3.1 Wie Tokenisierung funktioniert - BPE in einer Zeile“

Die meisten modernen Modelle verwenden Byte Pair Encoding (BPE). Die Idee ist erfrischend einfach: Man beginnt mit einzelnen Zeichen und klebt dann wiederholt das Paar zusammen, das am häufigsten auftritt - immer und immer wieder. Häufige Kombinationen (wie th, ing oder ganze gängige Wörter) landen als einzelne Tokens; seltenes Zeug bleibt in kleinere Stücke zerlegt.

Tokens sind kein akademisches Detail - sie sind die Einheit, die abgerechnet, begrenzt und zeitlich getaktet wird, und genau deshalb tauchen sie später als „Stellschraube für Praktiker” wieder auf.

Hier ist ein Problem, das offensichtlich klingt, sobald man es ausspricht: Computer können mit den Buchstaben „k-a-t-z-e” nichts anfangen. Sie arbeiten nur mit Zahlen. Jedes Token muss also zu einer Zahl werden - genauer gesagt zu einer Liste von Zahlen -, bevor das Modell es verarbeiten kann. Der Kniff besteht darin, das bedeutungsvoll zu tun.

Die einfachste Idee ist, jedem Wort einen eigenen Platz zu geben - das nennt man One-Hot-Encoding:

  • Katze = [1, 0, 0, 0, …]
  • Hund = [0, 1, 0, 0, …]
  • Bank = [0, 0, 1, 0, …]

Es funktioniert, aber es ist auf eine ganz bestimmte Weise dumm: Es behandelt jedes Wort als gleich unverwandt mit jedem anderen. Nach diesem Schema ist „Katze” nicht näher an „Hund” als an „Bank” - was Unsinn ist. In diesen Zahlen steckt nirgends ein Begriff von Bedeutung.

Statt willkürlicher Plätze lernen wir für jedes Token eine reichhaltige Liste von Zahlen (einen Vektor), so angeordnet, dass Wörter mit ähnlicher Bedeutung nahe beieinander liegen und verwandte Paare in ähnliche Richtungen zeigen. Diese gelernte Repräsentation nennt man ein Embedding.

Die berühmte Demonstration dafür, wie viel Bedeutung erfasst wird:

König
−
Mann
+
Frau
≈
Königin
Der Schritt von „Mann” zu „Frau” erfasst die Idee des Geschlechts; addiert man denselben Schritt zu „König”, landet man neben „Königin”. Bedeutung wird zur Rechenaufgabe.

Das funktioniert nur, weil die Richtung von Mann zu Frau „Geschlecht” kodiert, und wenn man sie zu König addiert, gelangt man zum weiblichen Pendant. Dasselbe Muster gilt für die Verbzeit (gehen → ging) und für Land → Hauptstadt (Deutschland → Berlin). Bedeutung ist buchstäblich zu Geometrie geworden.

Embeddings sind kein Partytrick - sie treiben im Stillen viele praktische Werkzeuge an, denn „nahe beieinander im Zahlenraum” ist ein maschinenfreundlicher Ersatz für „ähnlich in der Bedeutung”.

AnwendungWie Embeddings helfen
SucheDokumente finden, die dasselbe bedeuten, nicht nur solche mit denselben Stichwörtern
Empfehlungen„Kundinnen und Kunden, die X mochten, mochten auch Y” - X und Y liegen nahe beieinander
ClusteringÄhnliches Kundenfeedback oder Tickets automatisch gruppieren
RAG (Tag 3)Den relevantesten Kontext holen, um ihn dem Modell vor der Antwort zu geben

Wir haben nun Tokens, die in bedeutungsvolle Zahlen verwandelt wurden. Der Transformer ist die Architektur, die sie verarbeitet - und er ist das „T” in GPT. Er kam mit einem Paper von 2017 namens „Attention Is All You Need” auf und ist tatsächlich der Grund, warum moderne GenAI funktioniert.

Vor 2017 lasen Modelle Text strikt von links nach rechts, ein Wort nach dem anderen. Das hatte drei hartnäckige Probleme:

  • Langsam - jedes Wort musste auf das vorherige warten; man konnte sie nicht gemeinsam verarbeiten.
  • Vergesslich - Details vom Anfang einer langen Passage verblassten, bis das Modell das Ende erreichte.
  • Kurzsichtig - lange Dokumente waren ein echtes Problem.

Der Transformer behob alle drei mit zwei Kniffen: Er betrachtet alle Wörter auf einmal (dadurch ist er parallel und schnell) und nutzt Self-Attention, damit jedes Wort selbst entscheiden kann, welche anderen Wörter für es relevant sind.

Attention beantwortet für jedes Wort eine Frage: „auf welche anderen Wörter sollte ich achten, um mich selbst zu verstehen?”

Das klassische Beispiel: „Die Katze saß auf der Matte, weil sie müde war.” Worauf bezieht sich „sie”? Du wusstest es sofort - die Katze, nicht die Matte. Attention ist der Mechanismus, mit dem das Modell genau diese Art von Verbindung lernen und anwenden kann.

Jedes Wort erzeugt drei Dinge, und am leichtesten merkt man sie sich mit der Bibliotheks-Analogie:

RolleBibliotheks-AnalogieIn der Attention
Query (Q)Deine Frage: „Ich brauche Bücher über Klimawandel”Wonach dieses Wort sucht
Key (K)Das Etikett auf dem BuchrückenWas jedes Wort über sich selbst kundtut
Value (V)Der eigentliche Inhalt des BuchesDie Information, die jedes Wort weitergeben kann

Du kommst mit einer Query herein, überfliegst den Key (das Etikett) jedes Buches, um zu sehen, was relevant ist, und nimmst dann den Value (Inhalt) aus den Büchern in dem Maße, wie gut sie passten. Die Wortverarbeitung funktioniert genauso: vergleichen, gewichten, dann vermischen.

5.3 Durchgerechnetes Beispiel: „sie” → „Katze” auflösen

Abschnitt betitelt „5.3 Durchgerechnetes Beispiel: „sie” → „Katze” auflösen“

Verfolgen wir es für das Wort „sie” in „Die Katze saß, weil sie müde war”:

  1. „sie” bildet eine Query - fragt im Grunde „worauf beziehe ich mich?”
  2. Jedes Wort bietet einen Key an - „Katze” tut kund „ich bin ein Tier, ein Substantiv”, „saß” tut kund „ich bin eine Handlung”, und so weiter.
  3. Vergleiche die Query mit jedem Key, um die Relevanz zu bewerten:
    • sie vs. „Die” → 0,05 (niedrig)
    • sie vs. „Katze” → 0,72 (hoch - beste Übereinstimmung!)
    • sie vs. „saß” → 0,15 (mittel)
    • sie vs. „weil” → 0,08 (niedrig)
  4. Normalisiere die Werte (ein Schritt namens Softmax), sodass sie sich zu 1,0 summieren - jetzt sind es saubere Gewichte.
  5. Vermische die Values mit diesen Gewichten. Da „Katze” 0,72 des Gewichts trägt, ist das Ergebnis überwiegend Information aus „Katze”.

Ergebnis: Die interne Repräsentation von „sie” im Modell enthält nun faktisch „Katze”. Das ist ein kontextuelles Embedding, das in Echtzeit aufgebaut wird - dasselbe Wort würde sich in einem anderen Satz anders vermischen.

Eine berechtigte Frage: Warum nicht einfach das Embedding des Wortes direkt für alle drei Rollen verwenden? Weil ein Wort je nach Kontext unterschiedliche Rollen spielt. Nimm „Bank”:

  • Als Query muss es fragen: „bin ich Geld-Bank oder Fluss-Ufer-Bank?”
  • Als Key tut es kund: „ich könnte finanziell oder geografisch sein.”
  • Als Value liefert es: „hier ist meine tatsächliche Bedeutung.”

Fragen, Kundtun und Liefern sind wirklich verschiedene Aufgaben, deshalb lernt das Modell drei getrennte Transformationen - eine für jede.

5.5 Multi-Head-Attention und das Stapeln von Blöcken

Abschnitt betitelt „5.5 Multi-Head-Attention und das Stapeln von Blöcken“

Echte Transformer führen Attention nicht nur einmal aus. Sie betreiben mehrere Attention-Heads parallel, jeder eine andere „Perspektive” auf denselben Satz - ein Head verfolgt vielleicht die Grammatik, ein anderer die Bedeutung, ein weiterer schlicht die Wortposition. Viele Heads gleichzeitig laufen zu lassen, erlaubt dem Modell, viele Arten von Beziehungen auf einmal zu erkennen (ein großes Modell nutzt vielleicht Dutzende Heads).

Und Attention ist nur ein Teil eines einzelnen Transformer-Blocks. Ein Block bündelt zusammen:

Self-Attentionwer bezieht sich auf wen
→
Feed-Forwarddas Ergebnis verarbeiten
→
Residual + NormInformation stabil halten
Ein Transformer-Block: Attention findet die Beziehungen, ein Feed-Forward-Netz verdaut sie, und Residual-Verbindungen plus Normalisierung halten frühere Informationen intakt und das Training stabil.

Dann werden diese Blöcke gestapelt - moderne Modelle türmen Dutzende davon auf. Jede Schicht fügt eine Abstraktionsebene hinzu: Frühe Schichten kümmern sich um Grammatik und Wortbeziehungen, mittlere Schichten bauen Bedeutung und Fakten auf, und spätere Schichten übernehmen das schwerere Denken. Aus der Tiefe kommt die Raffinesse.

Ein fertiger, hilfreicher Assistent wird in drei klar getrennten Phasen aufgebaut. Lässt man eine davon aus, bekommt man ein ganz anderes (und schlechteres) Produkt.

1 · Pre-trainingSprache lernen
→
2 · Instruction Tuninghilfreich werden lernen
→
3 · RLHFmenschliche Vorlieben lernen
Zuerst kommt die reine Sprachfähigkeit, dann die Gewohnheit, Anweisungen zu befolgen, dann der Feinschliff bei Tonfall, Sicherheit und Hilfsbereitschaft.

Das Modell liest einen enormen Stapel Text - Bücher, Wikipedia, Websites, Foren, wissenschaftliche Arbeiten, Code, Nachrichten - und spielt immer wieder das Spiel mit dem nächsten Token. Allein durch dieses Spiel greift es Grammatik, Fakten, Denkmuster, Stil und Code-Struktur auf.

Größenordnung zum Würdigen: Billionen von Wörtern, Tausende spezialisierter Chips, die monatelang laufen, und geschätzte Kosten von grob 10 Mio.-100 Mio. $+ für ein Spitzenmodell. Deshalb trainiert nur eine Handvoll Organisationen Modelle von Grund auf.

Analogie: Es ist, als würde man Schreiben lernen, indem man jedes Buch in jeder Bibliothek millionenfach liest - man würde Grammatik und Fakten aufsaugen, ohne dass einem jemand eine einzige Regel beibringt.

Das ist die Handvoll Begriffe, an denen du beim Arbeiten mit einem Modell tatsächlich drehst. Verstehe diese vier und du kannst in jedem GenAI-Gespräch mithalten.

Weil alles in Tokens gemessen wird, sind Tokens die Währung der Arbeit mit LLMs:

  • Preisgestaltung - APIs rechnen pro Token ab und zählen sowohl deine Eingabe als auch die Ausgabe des Modells.
  • Limits - jedes Modell hat ein Maximum, das es auf einmal verarbeiten kann (siehe Context Window unten).
  • Geschwindigkeit - mehr Tokens bedeuten mehr Verarbeitungszeit.

Der Geldaspekt ist real: Ein wortreicher Prompt mit 1.000 Tokens kostet für dieselbe Aufgabe das 5-Fache eines knappen mit 200 Tokens. Knappe Prompts, das Cachen wiederholter Anfragen und der Einsatz eines kleineren Modells für einfache Aufgaben sind die leichten Gewinne.

7.2 Context Window = die Größe des Schreibtischs des Modells

Abschnitt betitelt „7.2 Context Window = die Größe des Schreibtischs des Modells“

Das Context Window ist die maximale Textmenge, die das Modell in einem Moment „sehen” kann - und entscheidend ist, dass es deine Eingabe und die erzeugte Ausgabe zusammen umfasst.

ModellContext WindowUngefähr
GPT-3.516K Tokens~12.000 Wörter
GPT-4128K Tokens~96.000 Wörter
Claude 3200K Tokens~150.000 Wörter
Gemini 1.51M+ Tokens~750.000 Wörter

Temperature steuert, wie zufällig die Ausgabe ist. Eine niedrige Temperature lässt das Modell auf Nummer sicher gehen und jedes Mal das wahrscheinlichste nächste Token wählen; eine hohe Temperature lässt es Risiken eingehen.

AnwendungsfallEmpfohlene Temperature
Datenextraktion0,0 - 0,2 am präzisesten
Zusammenfassung0,2 - 0,4
Allgemeine Fragen & Antworten0,5 - 0,7
Kreatives Schreiben0,7 - 0,9
Brainstorming0,9 - 1,0 am variantenreichsten

Bei 0,0 ist das Modell deterministisch - gleiche Eingabe, gleiche Ausgabe. Um 0,7-0,9 bekommst du nützliche kreative Vielfalt. Über 1,0 hinaus wird es oft zusammenhanglos.

Parameter sind die intern gelernten Werte - stell sie dir als Millionen oder Milliarden winziger Regler vor, die das Training justiert hat. Grobe Einordnung:

GrößeParameterTypischer Einsatz
Klein7-13 MilliardenSchnell und günstig; gut für einfache Aufgaben
Mittel30-70 MilliardenEin Ausgleich aus Fähigkeit und Kosten
Groß100B+Spitzenfähigkeit, höchste Kosten und Latenz

Mehr Parameter bedeuten in der Regel mehr Wissen, mehr Nuancen und besseres Denken - aber auch mehr Geld, langsamere Antworten und schwerere Hardware.

Hier klarsichtig zu sein, ist der ganze Sinn des Tages. LLMs sind bei manchen Dingen erstaunlich und bei anderen still unzuverlässig, und eine Managerin oder ein Manager muss wissen, was was ist.

Gut inTut sich schwer mit
Flüssigen Text erzeugen (E-Mails, Berichte, Werbetexte)Präziser faktischer Genauigkeit
Einfachen Anweisungen folgenKomplexen Aufgaben mit vielen Randbedingungen
Kontext verstehenEchtzeit- / aktuellen Informationen
Zusammenfassen und extrahierenExaktem Zählen und Rechnen
Kreativen VariantenSehr langer, perfekt konsistenter Ausgabe

Das Muster: LLMs glänzen bei Aufgaben, die Menschen mit Sprache erledigen. Wenn sich eine Aufgabe als „lies dies, dann schreibe das” formulieren lässt, kann ein LLM wahrscheinlich helfen. Nun die vier Ausfallmodi, die es zu benennen lohnt - jeder mit seiner Lösung:

Was: Das Modell nennt selbstbewusst, aber falsche Informationen - z. B. erfindet es plausibel klingende Titel von Forschungsarbeiten, die es nicht gibt.

Warum: Es sagt wahrscheinlich klingenden Text vorher; es schlägt nichts in einer Faktendatenbank nach. Flüssig und korrekt sind nicht dasselbe.

Gegenmaßnahme: Retrieval-Augmented Generation (RAG) - gib dem Modell die echten Quelldokumente, aus denen es antworten soll. Das ist der gesamte Tag 3.

Das Feld bewegt sich schnell, aber die wichtigsten Akteure und die drei Architektur-Familien lohnt es sich zu kennen.

UnternehmenModellfamilieBekannt für
OpenAIGPT-4, GPT-4oPionier moderner LLMs; starkes Reasoning
GoogleGeminiMultimodal (Text + Bilder); in Google integriert
AnthropicClaudeBetonung von Sicherheit und Hilfsbereitschaft
MetaLlamaOffene Gewichte - man kann es selbst betreiben
MistralMistral, MixtralEuropäisch; effiziente offene Modelle

Unter der Haube kommen transformerbasierte Modelle je nach Aufgabe in drei Formen:

ArchitekturBeispieleAm besten für
Decoder-onlyGPT, Claude, LlamaText erzeugen - Chat, Schreiben
Encoder-onlyBERT, RoBERTaText verstehen - Klassifikation, Suche
Encoder-DecoderT5, BARTÜbersetzung, Zusammenfassung

Fast jeder Chatbot, den du benutzt hast (GPT-4, Claude, Gemini), ist Decoder-only - gebaut, um zu erzeugen, Token für Token, genau wie wir es in Abschnitt 2 nachverfolgt haben.

Tag 1 kombiniert die obige Theorie mit Zeit in Google Colab, in der die Gemini API wirklich aufgerufen wird. Der vollständige, lauffähige Code liegt in den Notebooks - lade sie herunter und öffne sie in Colab, um mitzumachen.

Das angeleitete Lab - Your First LLM Interactions - wird vom Dozenten geführt und geht durch: das sichere Einrichten der Umgebung und des API-Keys, die ersten Aufrufe und das Lesen der Antwort, das Experimentieren mit Temperature (Vergleich von Ausgaben bei 0,0 vs. 1,0) und max Tokens, den Aufbau eines mehrstufigen Gesprächs (Multi-Turn), das den Kontext merkt, sowie das Zusammenstellen zweier kleiner Business-Tools - eines Generators für E-Mail-Antworten und eines Generators für Meeting-Zusammenfassungen. Es endet mit dem Export eines Prompt-Logs, damit jedes Experiment nachvollziehbar bleibt.

Das eigenständige Lab und die Aufgabe lassen dich dann auf eigene Faust üben: Wähle einen Business-Anwendungsfall, wende dieselben Parameter und Multi-Turn-Muster selbst an und protokolliere und überprüfe, was du baust - was die vier Grundregeln aus dem Lab festigt (wenn du unsicher bist, sag es; gib das Ausgabeformat an; erfinde keine Fakten; überprüfe wichtige Ausgaben).

Notebooks herunterladen (in Google Colab öffnen):

Meine eingereichte Lösung: Aufgabe 1 - mein gelöstes Notebook (.ipynb) - meine eigene Arbeit aus dem Kurs.

KernpunktKurz gemerkt
Was ein LLM istEin sehr guter Vorhersager des nächsten Tokens - keine Faktendatenbank, keine Person.
Autoregressive GenerierungEin Token vorhersagen, anhängen, wiederholen - kein Plan für die ganze Antwort im Voraus.
TokensDie Bausteine, die Modelle lesen; 1 Token ≈ 4 Zeichen ≈ ¾ Wort; sie treiben Kosten, Limits, Geschwindigkeit.
BPEEin Vokabular aufbauen, indem man wiederholt die häufigsten Zeichenpaare zusammenführt.
EmbeddingsWörter als bedeutungsvolle Vektoren - König − Mann + Frau ≈ Königin; treiben Suche, Empfehlungen, Clustering, RAG an.
Attention (Q/K/V)Query fragt, Keys antworten, Values liefern - wie „sie” lernt, dass es „Katze” bedeutet.
Multi-Head + StapelnViele Perspektiven pro Schicht; gestapelte Blöcke bauen Grammatik → Bedeutung → Reasoning auf.
Drei TrainingsphasenPre-training → Instruction Tuning → RLHF (Sprache → Hilfsbereitschaft → menschlicher Geschmack).
Die vier StellschraubenTokens (Kosten), Context Window (Kapazität), Temperature (Kreativität), Parameter (Größe).
TemperatureNiedrig (0-0,2) für Fakten; hoch (0,7-1,0) für Kreativität; 0,0 = deterministisch.
GrenzenHalluzination, Mathe/Zählen, Echtzeit-Infos, komplexe Randbedingungen - behebbar mit RAG, Code, Suche, Schritt für Schritt.
ArchitekturenDecoder-only (erzeugen) · Encoder-only (verstehen) · Encoder-Decoder (übersetzen).
Die goldene RegelLLMs ergänzen, ersetzen nicht - überprüfe Ausgaben mit hohem Einsatz immer.