Die Attention ist das Herz der Transformer (BERT, GPT…). Jedes Token berechnet für alle anderen, wie stark es sie beim Aufbau seiner Repräsentation «anschauen» soll. Hier siehst du es: Die Matrix ist Token-zu-Token (jede Zeile ergibt in Summe 1) und die Bögen zeigen, wohin das von dir gewählte Token schaut. Schreibe deinen eigenen Satz.
key
Query, Key und Value (Q/K/V)
Um zu entscheiden, wen es beachten soll, entstehen aus jedem Token drei Vektoren: Query (Q, „was ich suche“), Key (K, „was ich anbiete“) und Value (V, „was ich beitrage, wenn man mich beachtet“).
• Das Gewicht von Token i gegenüber j ist das Skalarprodukt aus der Query von i und dem Key von j. • Es wird durch √dk geteilt (Skalierung, damit die Zahlen nicht explodieren) und durch Softmax geschickt, das die Gewichte jeder Zeile in Prozentwerte umwandelt, die sich zu 1 summieren. • Kurz gesagt: A = softmax(Q·Kᵀ / √dk). Dieses Werkzeug zeichnet diese Matrix A; ein echtes Modell würde diese Gewichte nutzen, um die Values zu mischen.
diversity_2
Mehrere Heads
Ein Transformer hat nicht EINE Attention, sondern mehrere Heads parallel, jeder mit anderen Projektionen → jeder achtet auf andere Beziehungen (einer auf das vorherige Wort, ein anderer auf das Subjekt…). Wechsle den Head und beobachte, wie sich das Muster verändert.
arrow_forward
Kausale Maske (GPT)
Modelle, die Text generieren (GPT), können nicht in die Zukunft schauen: Jedes Token beachtet nur die vorherigen. Aktiviere die kausale Maske und du siehst, wie die obere Hälfte der Matrix erlischt — so wird trainiert, das nächste Token vorherzusagen. Ohne Maske (BERT) sieht jedes Token den ganzen Satz.
grid_on
Wie man die Heatmap liest
Die Attention-Matrix ist eine Heatmap Token × Token: Die Zeile ist das Token, das schaut (von), und die Spalte das Token, das angeschaut wird (nach).
• Je intensiver blau die Zelle, desto höher das Gewicht; Weiß ist fast null. • Jede Zeile summiert sich auf 100 % (es ist eine Verteilung). • Fahre mit der Maus über eine Zelle, um den genauen Wert zu lesen (z. B. gato → gato: 40%). • Die Diagonale leuchtet meist auf: Fast immer beachtet sich ein Token ziemlich stark selbst.
timeline
Die Bögen: wohin ein Token schaut
Klicke im Satzstreifen auf ein Wort, und es erscheinen Bögen zu den Wörtern, die es beachtet, entnommen aus dieser Zeile der Matrix. Dicke und Deckkraft jedes Bogens sind proportional zum Gewicht (Gewichte unter 2 % werden ausgeblendet). Klicke erneut, um die Auswahl aufzuheben. Es ist dieselbe Information wie eine Zeile der Heatmap, aber über dem Text gezeichnet, um sie auf einen Blick zu lesen.
play_circle
Anleitung (Schritt für Schritt)
1. Schreibe einen Satz in das Feld oben (wird nach Wörtern und Satzzeichen tokenisiert, bis zu 40 Tokens). 2. Wähle einen Kopf (1–4), um unterschiedliche Muster zu sehen. 3. Aktiviere oder deaktiviere die kausale Maske, um GPT mit BERT zu vergleichen. 4.Klicke auf ein Wort (im Streifen oder in seiner Zeilenbeschriftung), um seine Bögen zu zeichnen. 5. Fahre mit der Maus über die Heatmap, um genaue Gewichte zu lesen. Alles wird sofort neu berechnet, in deinem Browser.
smart_toy
Dieses Demo im Vergleich zu einem echten Modell
Dieser Visualisierer ist didaktisch und deterministisch (offline): Die Vektoren jedes Tokens werden per Hash erzeugt (gleiche Tokens → gleicher Vektor) plus einer sinusförmigen Positionskodierung, und die Q/K-Projektionen werden mit einem Seed festgelegt, sodass das Ergebnis reproduzierbar ist. Die Attention-Berechnung (skaliertes Skalarprodukt + Softmax, mit optionaler kausaler Maske) ist echt. Ein echtes Modell lernt Q/K/V aus Daten und stapelt Dutzende Schichten und Köpfe. Verwandt: Tokenizer, Mini-LLM und Dimensionsreduzierer.
hubAttention-VisualisiererWorauf jedes Wort in einem Transformer schaut
hub
Attention-VisualisiererSieh, auf welche Wörter jedes Token «schaut» — der Mechanismus im Inneren eines Transformers
Head
Klicke auf ein Wort, um zu sehen, wohin es schaut:
Attention-Matrix (Zeile = von, Spalte = nach)
smart_toyDies ist der Attention-Mechanismus (skaliertes Skalarprodukt + Softmax). Ein echtes Modell lernt die Q/K/V-Projektionen und stapelt Dutzende Schichten und Heads, aber die Idee ist genau diese. Verwandt: Tokenizer, Mini-LLM und Dimensionsreduktion.