Der Transformer ist die Architektur hinter praktisch allen modernen Sprachmodellen (GPT, Claude, BERT, Llama). Vorgestellt 2017 im Paper Attention Is All You Need, brach er mit der bis dahin üblichen Idee, Text Wort für Wort sequentiell zu verarbeiten. Stattdessen schaut ein Transformer über den Attention-Mechanismus auf alle Positionen einer Sequenz gleichzeitig und entscheidet für jedes Wort, welche anderen Wörter wichtig sind. Das macht ihn massiv parallelisierbar und stark darin, weit entfernte Bezüge im Text zu erfassen.
Betrachte den Satz: „Das Tier überquerte die Straße nicht, weil es zu müde war." Worauf bezieht sich „es" auf das Tier oder die Straße? Ein Mensch weiß: auf das Tier. Ein Modell muss diesen Bezug lernen, und das Wort „es" steht weit entfernt vom Wort „Tier". Ältere Architekturen (RNNs) reichten Information Schritt für Schritt weiter und „vergaßen" weit Zurückliegendes. Attention löst das, indem es jede Position direkt mit jeder anderen verbindet egal wie weit entfernt.
Der Kern von Attention ist eine Analogie zum Nachschlagen in einer Datenbank. Jedes Wort erzeugt drei Vektoren, indem sein Embedding mit drei gelernten Matrizen multipliziert wird:
Das Modell vergleicht die Query eines Worts mit den Keys aller Wörter (über das Skalarprodukt). Passt eine Query gut zu einem Key, bekommt dessen Value ein hohes Gewicht. Die gewichtete Summe aller Values ist das Ergebnis.
Berechnet man jede Query gegen jeden Key, entsteht eine quadratische Matrix: Zeile i, Spalte j gibt an, wie stark Wort i auf Wort j achtet. Jede Zeile summiert sich (nach softmax) zu 1. Genau diese Allzu-Allen-Berechnung ist der Grund für die quadratische Rechenkomplexität langer Kontexte.
Ein einzelner Attention-Mechanismus erfasst nur eine Art von Beziehung. Transformer nutzen daher mehrere Köpfe (Heads) parallel jeder mit eigenen Q/K/V-Matrizen. Ein Kopf lernt vielleicht grammatische Bezüge, ein anderer thematische Nähe, ein dritter die Position. Die Ergebnisse aller Köpfe werden zusammengefügt und gemeinsam weiterverarbeitet.
Das Originalmodell besteht aus einem Encoder (liest die Eingabe) und einem Decoder (erzeugt die Ausgabe). Jede Schicht enthält einen Attention-Block und ein kleines vorwärtsgerichtetes Netz (Feed-Forward), umgeben von Residual-Verbindungen und Normalisierung. Moderne Sprachmodelle wie GPT nutzen oft nur den Decoder-Teil. Da Text keine eingebaute Reihenfolge im Attention hat, addiert man Positionsinformation (siehe RoPE).
| Eigenschaft | RNN / LSTM | Transformer |
|---|---|---|
| Verarbeitung | sequentiell, Schritt für Schritt | parallel, alle Positionen zugleich |
| Lange Bezüge | verblassen über Distanz | direkter Pfad zu jeder Position |
| Training | schlecht parallelisierbar | nutzt GPUs voll aus |
| Kosten pro Schicht | linear in Länge | quadratisch in Länge |
Die quadratischen Kosten sind der zentrale Nachteil und Motor vieler Folgearbeiten (effiziente Attention, lange Kontexte). Doch die Kombination aus Parallelität und direktem Zugriff auf den gesamten Kontext machte den Transformer zur Grundlage der heutigen KI-Landschaft.