Cache de prompt, roteamento de modelo, lote e teto de gasto.
Sistema com IA tem custo que varia com o comportamento do usuário e do próprio agente — o número de voltas do laço não é decidido por você. As alavancas reais são poucas e ordenáveis: cache da parte estável do prompt, roteamento por tarefa, processamento em lote quando ninguém espera, e teto de passos. Aqui também entra o lado AWS: reserva, spot e alocação de custo em escala.
Agrupados pela trilha de origem — o tema atravessa 22 trilhas.
As consultas de maior intenção deste tema, respondidas aqui.
Nesta ordem, porque é a ordem do retorno: cache da parte estável do prompt, que costuma ser o maior item da entrada; roteamento por tarefa, mandando o que é simples para modelo menor; processamento em lote onde ninguém está esperando resposta; e só então encurtar prompt. As três primeiras não mexem na qualidade — a última mexe, e é por isso que vem por último.
Não há número fixo, e é justamente essa a característica que precisa ser administrada: o gasto depende de quantas voltas o laço dá, e isso depende do que o agente encontra. O que se faz é medir por tarefa real, estabelecer teto de passos e de gasto, e tratar tokens por tarefa como métrica de produto — do mesmo jeito que latência.
Lote quando ninguém está esperando: classificar histórico, gerar resumo de arquivo, rodar conjunto de avaliação. Custa significativamente menos e entrega em janela de horas. Chamada direta com resposta em fluxo para qualquer coisa com usuário na frente. O erro caro é usar chamada síncrona em trabalho de fundo só porque o código já estava escrito assim.