L’entrée est traitée en parallèle —phase de prefill—, donc son coût est surtout du calcul. La sortie est générée un token à la fois —phase de decode—, limitée par la quantité de mémoire à déplacer pour chacun : c’est pourquoi ça passe moins bien à l’échelle, et pourquoi le prix catalogue rend toujours la sortie plus chère. De là viennent les trois curseurs ci-dessous : un succès de cache réutilise un prefill déjà fait (d’où un coût de ~10 %), et les tokens de raisonnement sont du decode pur — ils sont facturés comme de la sortie parce que, techniquement, c’est exactement ce qu’ils sont.