A régua que todo mundo usa para comparar IA está errada: preço por milhão de tokens.
Para agente, a régua certa é custo por tarefa concluída. A diferença entre as duas não é sutileza contábil: é a diferença entre escolher ferramenta por anúncio e escolher por planilha.
Por que o token não fecha a conta
Um fluxo agênico não consome um prompt. A própria Z.AI estima que cada consulta dispara entre 15 e 20 invocações do modelo, e um fluxo real empilha dezenas de consultas com janelas de 5 horas e cap semanal no caminho.
Cada invocação reenvia contexto, cada erro gera retry, cada iteração multiplica o consumo. O número da tabela de preços (o milhão de tokens) é um insumo; o que fecha a conta é a soma de todas as invocações até a tarefa estar concluída, com qualidade aceita e sem retrys infinitos.
O barato caro e o caro barato
O que isso muda na prática: um modelo 3 vezes mais barato por token pode sair mais caro se precisar de mais tentativas, mais contexto e mais retrys para concluir. E um modelo com cota tripla, cache eficiente e metade do preço fora de pico pode custar centavos por tarefa entregue.
O barato que importa é o da tarefa entregue, não o do token. É a mesma lógica do desperdício de 29% no cloud: preço de catálogo e custo real são números diferentes, e só a medição própria separa os dois.
A régua que sobrevive à reunião de orçamento
O método cabe em cinco passos: definir o que é tarefa no seu fluxo, instrumentar a contagem por execução (input, output e cache, agrupados pelo entregável), incluir tentativas e contexto no custo, comparar modelos pela mesma bateria de tarefas e dividir o total pelas conclusões aceitas.
O resultado, custo por tarefa aceita, é o único número de IA que sobrevive a uma reunião de orçamento. Ele responde as perguntas que importam: qual modelo usar, onde escalar, o que aposentar. E é o mesmo espírito do orçamento por agente: token sem contabilidade de tarefa é gasto sem dono, e gasto sem dono é o que a pesquisa da Harness mediu em 26%.
O plano que já nasce nessa régua
Para uso pesado de agentes, a Z.AI estruturou o GLM Coding Plan exatamente nessa lógica: o Flash carrega 3 vezes a cota do 5.3 no plano e, fora de pico, cada chamada custa metade dos créditos. O Pro, a 80 dólares por mês, beira o ilimitado para um fluxo intenso; o Max, a 168 dólares, é o melhor custo-benefício para quem roda vários projetos em paralelo. Quem quiser testar com o mesmo ambiente: https://z.ai/subscribe?ic=BGIRP61T2P (10% de desconto no primeiro pedido).
Mas a ferramenta é o último passo, e a regra vale para qualquer fornecedor: comece medindo tarefa, não milhão de tokens. A régua que o anúncio usa nunca é a que a fatura cobra.
Conclusão
Quem não mede custo por tarefa concluída está escolhendo ferramenta por anúncio. A tabela de preços responde "quanto custa o insumo"; só a sua medição responde "quanto custa o meu trabalho pronto".
Uma semana de instrumentação em uma tarefa repetitiva basta para ter o número na mão. Depois disso, as decisões de modelo, plano e volume viram aritmética em vez de fé. E é exatamente essa aritmética que separa quem usa IA de quem paga IA.