A entrada processa-se em paralelo —fase de prefill—, por isso o seu custo é sobretudo de computação. A saída gera-se um token de cada vez —fase de decode—, limitada por quanta memória é preciso mover para cada um: por isso escala pior, e por isso o preço de tabela põe sempre a saída mais cara. Daqui saem os três controlos abaixo: um acerto de cache reutiliza um prefill já feito (por isso custa ~10%), e os tokens de raciocínio são decode puro — são faturados como saída porque, tecnicamente, é exatamente o que são.
Custos
Quantização