LLM heißt Large Language Model – großes Sprachmodell. ChatGPT, Claude, Gemini, Llama und Co. sind im Kern alle dasselbe: ein riesiges Rechenmodell, das eine Sache extrem gut kann – vorhersagen, welches Textstück als Nächstes kommt.
Schritt 1: Aus Text werden Tokens
Ein LLM liest weder Buchstaben noch ganze Wörter, sondern Tokens: Textschnipsel, oft Silben oder Wortteile. Häufige Wörter sind ein einziges Token, seltene werden zerlegt. Jedes Token bekommt eine Nummer – denn das Modell rechnet ausschließlich mit Zahlen.
Vereinfachte Simulation. Echte Tokenizer (z. B. „Byte Pair Encoding") lernen ihre Zerlegung aus riesigen Textmengen. Faustregel: Ein Token entspricht etwa vier Zeichen englischem Text – Deutsch braucht meist mehr Tokens, weil lange Wörter öfter zerlegt werden. Die kleinen Zahlen stehen für die Token-IDs.
🍓 Deshalb scheiterten Modelle lange an „Wie viele r hat strawberry?". Sie sehen nicht s-t-r-a-w…, sondern eher „str" + „aw" + „berry". Buchstaben zählen ist für sie wie Gummibärchen in einer zugeklebten Tüte zählen.
Schritt 2: Tokens bekommen Bedeutung
Jede Token-Nummer wird in eine lange Zahlenliste übersetzt, ein Embedding (Vektor) mit oft Tausenden Dimensionen. Diese Zahlen funktionieren wie Koordinaten auf einer Bedeutungs-Landkarte: Ähnliches liegt nah beieinander – und sogar Richtungen haben eine Bedeutung.
Echte Embeddings haben Hunderte bis Tausende Dimensionen – hier auf zwei heruntergebrochen. Das berühmte König-Königin-Beispiel stammt aus der Forschung zu „Word2Vec" (2013).
⚖️ Die Landkarte lernt auch Vorurteile mit: Forschende fanden 2016 in solchen Wort-Vektoren Zuordnungen wie „Mann verhält sich zu Programmierer wie Frau zu Hausfrau". KI spiegelt, was in ihren Daten steckt (→ Station 9).
Schritt 3: Attention – wer achtet auf wen?
Das Herzstück fast aller Sprachmodelle ist der Transformer, 2017 von Google-Forschenden vorgestellt. Sein Trick heißt Attention (Aufmerksamkeit): Jedes Token schaut sich die anderen Tokens an und entscheidet, welche für seine Bedeutung gerade wichtig sind.
Tippe auf ein Wort und sieh, auf welche früheren Wörter es achtet.
Tipp: Probier mal „es".
Handgemachte Beispielwerte zur Veranschaulichung. Chat-Modelle schauen immer nur nach links, auf frühere Wörter – das Nächste ist ja noch nicht geschrieben.
Umleitung für Nerds: Query, Key, Value
Technisch bekommt jedes Token drei Vektoren: eine Query („Wonach suche ich?"), einen Key („Was biete ich an?") und einen Value („Das ist mein Inhalt"). Die Query eines Tokens wird mit den Keys aller vorherigen Tokens verrechnet. Daraus entstehen per Softmax die Aufmerksamkeitsgewichte, mit denen die Values gemischt werden.
Das passiert parallel in vielen Attention Heads (einer achtet eher auf Grammatik, ein anderer auf Bezüge) und in Dutzenden Schichten übereinander. Weil Chat-Modelle Text von links nach rechts erzeugen, verhindert eine „kausale Maske", dass Tokens in die Zukunft schauen.
Schritt 4: Das nächste Token wird gezogen
Am Ende berechnet das Modell für jedes mögliche nächste Token eine Wahrscheinlichkeit. Dann wird gezogen – ein Token, noch eins, noch eins. Jede Antwort, die du je von einer KI gelesen hast, ist so entstanden. Mit der Temperatur lässt sich einstellen, wie mutig gezogen wird.
„Nach der Schule gehe ich am liebsten …"
Niedrige Temperatur: fast immer die wahrscheinlichste Option – zuverlässig, aber langweilig. Hohe Temperatur: mehr Überraschungen – kreativ oder Quatsch. Vereinfacht mit ganzen Wortgruppen statt einzelner Tokens.
Wie lernt ein LLM das alles?
- Pre-Training: die Bibliothek lesen. Das Modell bekommt Billionen Tokens Text und übt eine einzige Aufgabe: das nächste Token vorhersagen. Es rät, vergleicht mit dem echten Text und dreht seine Milliarden Parameter (Stellschrauben) minimal in die richtige Richtung. Das passiert unvorstellbar oft, monatelang, auf Tausenden Spezialchips. Ergebnis: ein Basismodell, das Texte fortsetzen kann – aber noch kein hilfreicher Assistent ist.
- Fine-Tuning: die Ausbildung. Menschen schreiben Beispiel-Dialoge, wie ein guter Assistent antwortet. Das Modell lernt das Muster „Frage, dann hilfreiche Antwort".
- Feedback: der Coach. Menschen oder andere KI-Modelle bewerten Antworten nach festgelegten Prinzipien (Fachwort RLHF, bei Anthropic auch „Constitutional AI"). Belohnt wird, was hilfreich, ehrlich und harmlos ist. Hier entstehen auch Werte und Grenzen (→ Station 8).
Umleitung für Nerds: Gradientenabstieg
Parameter sind die Gewichte eines neuronalen Netzes. GPT-3 hatte 2020 schon 175 Milliarden davon; heutige Spitzenmodelle sind deutlich größer, genaue Zahlen verraten die Firmen meist nicht. Nach jeder Vorhersage misst eine Fehlerfunktion (Loss), wie weit das Modell danebenlag. Per Backpropagation wird berechnet, in welche Richtung jede Stellschraube gedreht werden muss, damit der Fehler sinkt: der Gradientenabstieg.
Metapher: Du stehst nachts im Nebel auf einem Berg und willst ins Tal. Du siehst nichts, spürst aber mit dem Fuß, wo es bergab geht – und machst einen kleinen Schritt. Und noch einen. Milliarden Mal.
Das Kontextfenster: ein Schreibtisch, kein Gedächtnis
Ein LLM erinnert sich nicht wie ein Mensch. Bei jeder Antwort bekommt es den kompletten bisherigen Chat erneut als Text vorgelegt – das Kontextfenster. Nur was auf dem Tisch liegt, kann die KI sehen. Wird es zu voll, fällt Altes runter oder wird zusammengefasst. „Memory"-Funktionen in Apps sind Zusatzsysteme, die Notizen speichern und später wieder auf den Tisch legen.
Kontextfenster mit Platz für 5 Nachrichten
Echte Kontextfenster fassen heute oft Hunderttausende Tokens – das Prinzip bleibt dasselbe.
Warum KI halluziniert
Ein Sprachmodell ist auf plausibel trainiert, nicht auf wahr. Wenn es etwas nicht weiß, entsteht trotzdem flüssiger Text – wie bei einem Impro-Theater-Profi, der niemals „Keine Ahnung" sagt. Dann entstehen Zahlen, Zitate oder Quellen, die echt klingen, aber erfunden sind.
⚖️ 2023 reichte ein Anwalt in New York einen Schriftsatz mit Gerichtsurteilen ein, die ChatGPT komplett erfunden hatte. Das Gericht verhängte eine Geldstrafe. Neuere Modelle mit Websuche und Training aufs Zugeben von Unsicherheit halluzinieren seltener – aber nie gar nicht.
Merke dir
- LLMs sagen Tokens voraus – sie schlagen nichts nach, außer sie haben ein Such-Werkzeug.
- Bedeutung entsteht aus der Bedeutungs-Landkarte (Embeddings) plus Kontext (Attention).
- Das Wissen stammt aus Trainingsdaten mit Stichtag. Was danach passiert ist, weiß das Modell nur, wenn man es ihm gibt.
- Flüssig heißt nicht korrekt.