Text & Dokumente
Zahlen & Berechnung
Daten & Formate
Sicherheit
Entwicklung & DevOps
Künstliche Intelligenz
Finanzen
Gesundheit & Wohlbefinden
Produktivität
Spiele & Unterhaltung
Multimedia & Design
Unternehmen
Bedienungsanleitung
Was ist Attention?

Die Attention ist der zentrale Mechanismus der Transformer (BERT, GPT, Llama…). Jedes Wort (Token) wird nicht isoliert verarbeitet: Es schaut auf die anderen und entscheidet, wie stark jedes einzelne wiegt, wenn es seine eigene Bedeutung aufbaut. So kann in «Die Katze… weil sie müde war» «war» lernen, sich auf die Katze zu konzentrieren. Hier siehst du es auf zwei Arten: die Token-zu-Token-Matrix (jede Zeile summiert sich zu 1 = 100 %) und die Bögen über dem Satz. Schreib deinen eigenen Satz und experimentiere.

Query, Key und Value (Q/K/V)

Um zu entscheiden, wen es beachten soll, entstehen aus jedem Token drei Vektoren: Query (Q, „was ich suche“), Key (K, „was ich anbiete“) und Value (V, „was ich beitrage, wenn man mich beachtet“).

• Das Gewicht von Token i gegenüber j ist das Skalarprodukt aus der Query von i und dem Key von j.
• Es wird durch √dk geteilt (Skalierung, damit die Zahlen nicht explodieren) und durch Softmax geschickt, das die Gewichte jeder Zeile in Prozentwerte umwandelt, die sich zu 1 summieren.
• Kurz gesagt: A = softmax(Q·Kᵀ / √dk). Dieses Werkzeug zeichnet diese Matrix A; ein echtes Modell würde diese Gewichte nutzen, um die Values zu mischen.

Warum mehrere Heads

Ein Transformer hat nicht EINE Attention, sondern mehrere Heads (hier 4) parallel. Jeder Head nutzt unterschiedliche Q/K-Projektionen, sodass er lernt, sich auf unterschiedliche Beziehungen zu konzentrieren: einer auf das vorherige Wort, ein anderer auf das Subjekt, ein anderer auf die Kongruenz… und am Ende werden sie kombiniert. Wechsle den Head mit den Buttons 1–4 und beobachte, wie sich das Muster für denselben Satz vollständig ändert.

Kausale Maske: nicht in die Zukunft schauen

Modelle, die Text generieren (GPT), sagen das nächste Wort vorher, können also nicht in die Zukunft schauen: Jedes Token beachtet nur sich selbst und die vorherigen. Aktiviere die kausale Maske (GPT) und du siehst die gesamte obere rechte Hälfte der Matrix erlöschen — diese zukünftigen Positionen werden vor dem Softmax auf 0 gesetzt. Ohne Maske, wie bei BERT, sieht jedes Token den gesamten Satz, links und rechts.

Wie man die Heatmap liest

Die Attention-Matrix ist eine Heatmap Token × Token: Die Zeile ist das Token, das schaut (von), und die Spalte das Token, das angeschaut wird (nach).

• Je intensiver blau die Zelle, desto höher das Gewicht; Weiß ist fast null.
• Jede Zeile summiert sich auf 100 % (es ist eine Verteilung).
• Fahre mit der Maus über eine Zelle, um den genauen Wert zu lesen (z. B. gato → gato: 40%).
• Die Diagonale leuchtet meist auf: Fast immer beachtet sich ein Token ziemlich stark selbst.

Die Bögen: wohin ein Token schaut

Klicke im Satzstreifen auf ein Wort, und es erscheinen Bögen zu den Wörtern, die es beachtet, entnommen aus dieser Zeile der Matrix. Dicke und Deckkraft jedes Bogens sind proportional zum Gewicht (Gewichte unter 2 % werden ausgeblendet). Klicke erneut, um die Auswahl aufzuheben. Es ist dieselbe Information wie eine Zeile der Heatmap, aber über dem Text gezeichnet, um sie auf einen Blick zu lesen.

Anleitung (Schritt für Schritt)

1. Schreibe einen Satz in das Feld oben (wird nach Wörtern und Satzzeichen tokenisiert, bis zu 40 Tokens).
2. Wähle einen Kopf (1–4), um unterschiedliche Muster zu sehen.
3. Aktiviere oder deaktiviere die kausale Maske, um GPT mit BERT zu vergleichen.
4. Klicke auf ein Wort (im Streifen oder in seiner Zeilenbeschriftung), um seine Bögen zu zeichnen.
5. Fahre mit der Maus über die Heatmap, um genaue Gewichte zu lesen. Alles wird sofort neu berechnet, in deinem Browser.

Dieses Demo im Vergleich zu einem echten Modell

Dieser Visualisierer ist didaktisch und deterministisch (offline): Die Vektoren jedes Tokens werden per Hash erzeugt (gleiche Tokens → gleicher Vektor) plus einer sinusförmigen Positionskodierung, und die Q/K-Projektionen werden mit einem Seed festgelegt, sodass das Ergebnis reproduzierbar ist. Die Attention-Berechnung (skaliertes Skalarprodukt + Softmax, mit optionaler kausaler Maske) ist echt. Ein echtes Modell lernt Q/K/V aus Daten und stapelt Dutzende Schichten und Köpfe. Verwandt: Tokenizer, Mini-LLM und Dimensionsreduzierer.

Attention-VisualisiererWorauf jedes Wort in einem Transformer schaut
Attention-VisualisiererSieh, auf welche Wörter jedes Token «schaut» — der Mechanismus im Inneren eines Transformers
Kopf

Klicke auf ein Wort, um zu sehen, wohin es schaut:

Elgatosesentóenlaalfombraporqueestabacansado
Attention-Matrix (Zeile = von, Spalte = nach)
ElgatosesentóenlaalfombraporqueestabacansadoElEl → El: 9%El → gato: 3%El → se: 13%El → sentó: 3%El → en: 0%El → la: 2%El → alfombra: 1%El → porque: 37%El → estaba: 5%El → cansado: 27%gatogato → El: 3%gato → gato: 1%gato → se: 13%gato → sentó: 6%gato → en: 26%gato → la: 2%gato → alfombra: 10%gato → porque: 2%gato → estaba: 36%gato → cansado: 1%sese → El: 5%se → gato: 4%se → se: 6%se → sentó: 11%se → en: 12%se → la: 13%se → alfombra: 33%se → porque: 1%se → estaba: 13%se → cansado: 1%sentósentó → El: 2%sentó → gato: 11%sentó → se: 19%sentó → sentó: 21%sentó → en: 9%sentó → la: 6%sentó → alfombra: 20%sentó → porque: 3%sentó → estaba: 7%sentó → cansado: 2%enen → El: 3%en → gato: 45%en → se: 17%en → sentó: 13%en → en: 12%en → la: 4%en → alfombra: 1%en → porque: 2%en → estaba: 1%en → cansado: 1%lala → El: 6%la → gato: 11%la → se: 25%la → sentó: 34%la → en: 7%la → la: 3%la → alfombra: 4%la → porque: 3%la → estaba: 6%la → cansado: 1%alfombraalfombra → El: 6%alfombra → gato: 13%alfombra → se: 21%alfombra → sentó: 21%alfombra → en: 7%alfombra → la: 8%alfombra → alfombra: 10%alfombra → porque: 6%alfombra → estaba: 4%alfombra → cansado: 5%porqueporque → El: 26%porque → gato: 17%porque → se: 9%porque → sentó: 11%porque → en: 2%porque → la: 7%porque → alfombra: 4%porque → porque: 5%porque → estaba: 9%porque → cansado: 9%estabaestaba → El: 14%estaba → gato: 13%estaba → se: 15%estaba → sentó: 32%estaba → en: 11%estaba → la: 3%estaba → alfombra: 2%estaba → porque: 7%estaba → estaba: 1%estaba → cansado: 2%cansadocansado → El: 17%cansado → gato: 17%cansado → se: 7%cansado → sentó: 27%cansado → en: 11%cansado → la: 7%cansado → alfombra: 6%cansado → porque: 2%cansado → estaba: 5%cansado → cansado: 2%

Dies ist der Attention-Mechanismus (skaliertes Skalarprodukt + Softmax). Ein echtes Modell lernt die Q/K/V-Projektionen und stapelt Dutzende Schichten und Heads, aber die Idee ist genau diese. Verwandt: Tokenizer, Mini-LLM und Dimensionsreduktion.