Die Eingabe wird parallel verarbeitet —Phase prefill—, ihre Kosten sind also vor allem Rechenkosten. Die Ausgabe wird ein Token nach dem anderen erzeugt —Phase decode—, begrenzt durch die Speichermenge, die für jedes bewegt werden muss: deshalb skaliert es schlechter, und deshalb ist die Ausgabe im Listenpreis immer teurer. Daraus ergeben sich die drei Regler unten: ein Cache-Treffer nutzt ein bereits erledigtes Prefill wieder (deshalb kostet es ~10 %), und Reasoning-Tokens sind reines Decode — sie werden als Ausgabe abgerechnet, weil sie technisch genau das sind.