Ir al contenido principal
Cerrar
IA

Seu agente de IA tem orçamento? A fronteira do FinOps

Gabriel Ferraresi· CEO | Tech862 de outubro de 20264 min
iaagentesfinopsgovernancatokens

O cartão do humano tem limite. O agente autônomo não tem nenhum.

Um agente consome tokens em janelas seguidas, sem pausa e sem vergonha, e a fatura só aparece depois. A pergunta do FinOps em 2026 mudou de "quanto custa rodar IA" para "quem segura o agente quando ele decide gastar".

O gap que o agente mora

Os números mostram o tamanho do buraco: 73% das organizações já têm política de custo de IA, mas só 47% fazem cumprir, segundo o levantamento da Harness. É exatamente no vaivém entre escrever regra e executar regra que o agente mora.

Enquanto o humano espera aprovação, o agente itera de madrugada. Ele não pede orçamento, não percebe que está em loop e não acha graça no próprio erro: repete o padrão até terminar a tarefa ou até a cota acabar, o que vier primeiro. Sem freio, o que vier primeiro costuma ser a cota.

Na escala que a inferência atingiu, o problema parou de ser curioso e virou linha do orçamento: com um trilhão de tokens por dia sendo consumidos só em inferência, agentes sem teto são apostas com o cartão da empresa.

A disciplina nova tem receita

Orçamento por agente, teto por etapa e medidor de tokens como unidade contábil. A recomendação que se repete na literatura é instalar freios duros: um limite de passos que interrompe o agente e chama um humano antes do prejuízo.

Na prática, a receita cabe em quatro peças:

  1. Teto por agente e por tarefa: orçamento máximo definido antes da execução, não depois da fatura.
  2. Limite de passos com escalada humana: o disjuntor que interrompe o loop e devolve a decisão para quem responde por ela.
  3. Painel de uso com alerta: detectar agente fora de controle virou monitoramento tão básico quanto alerta de CPU.
  4. Custo por tarefa concluída: a métrica que fecha a conta e permite comparar agentes entre si.

E o mercado já entrega essa contabilidade pronta: planos desenhados para agentes vêm com cota por janela de horas, desconto fora de pico e medidor transparente. O GLM Coding Plan da Z.AI, que usamos e recomendamos, funciona assim, e a cota limitada por janela é justamente o freio que o agente precisa. Autonomia sem teto é, no fim do dia, aposta cega.

O testemunho do freio

Estou escrevendo este artigo com sete agentes rodando em paralelo na minha infraestrutura, e o que me deixa dormir não é confiança neles: é o freio. Cada frente tem teto, cada tarefa tem limite de passos e o painel de uso fica a um toque no celular.

A confiança em agentes cresce com o uso, e é exatamente por isso que o freio precisa existir antes da confiança. O agente que nunca estourou teto é o que tem teto: o resto ainda não fez a semana em que decide gastar.

O mesmo princípio que organiza o desperdício de cloud vale aqui: recurso sem dono e sem limite é desperdício contratado. O agente sem orçamento é a instância ociosa da década, só que gastando em vez de parada.

Conclusão

Dar teto ao agente é comprar o direito de deixá-lo rodando sozinho. O próximo passo do FinOps mora menos no dashboard de cloud e mais no prompt que define quanto o agente pode gastar antes de voltar a ser decisão humana.

Se você roda agentes sem limite de passos, sem teto por tarefa e sem painel de uso, a pergunta não é se a conta vai surpreender: é em qual fatura. O freio é barato, a receita é conhecida e a disciplina já tem nome. Falta instalar.

¿Necesitas orientación especializada?

Agenda una consultoría con nuestros especialistas.

Governança e FinOps para IA

Preguntas Frecuentes

Porque iteram sem pausa: um agente autônomo consome tokens em janelas seguidas, de madrugada, sem aprovação e sem vergonha, e a fatura só aparece depois. O humano espera orçamento e aprovação; o agente itera até terminar (ou até a cota acabar). 73% das organizações têm política de custo de IA, mas só 47% a fazem cumprir, segundo a Harness: é nesse gap que a conta estoura.

É o freio duro do agente: um número máximo de passos (requisições, iterações, chamadas de ferramenta) que interrompe automaticamente a execução e chama um humano antes do prejuízo crescer. O limite de passos é o equivalente do disjuntor elétrico para quem roda agentes: simples, barato e o que separa piloto de produção.

Pela tarefa concluída, não pelo token avulso: cada tarefa consumiu quantos tokens (input, output e cache), em quantas janelas, com qual custo em reais? Com essa unidade contábil, dá para comparar agentes, priorizar os que entregam e aposentar os que só gastam. Já escrevemos sobre a escala de inferência que torna essa contabilidade urgente.

Depende do perfil de uso, mas planos desenhados para agentes já resolvem o grosso da governança: cota por janela de horas, consumo com desconto fora de pico e medidor transparente. O GLM Coding Plan da Z.AI, que usamos e recomendamos, funciona assim, e a cota limitada por janela é justamente o freio que o agente precisa. Para quem quer começar por lá: https://z.ai/subscribe?ic=BGIRP61T2P

Tudo: a pergunta do FinOps em 2026 mudou de quanto custa rodar IA para quem segura o agente quando ele decide gastar. O orçamento por agente, o teto por etapa e o medidor de tokens são a mesma disciplina de cloud aplicada a uma máquina que gasta sozinha. O próximo passo da área mora menos no dashboard de cloud e mais no prompt que define o teto.

Blog — Contáctanos

¿Tienes alguna pregunta sobre nuestros artículos o servicios? Nuestro equipo está listo para ayudarte.

Agendar Reunión

Reserva un horario.

Agendar Ahora

Correo Electrónico

Envía un mensaje.

[email protected]

WhatsApp

Conversación rápida.

Dirección

Avenida Paulista, 1636 - São Paulo - SP - 01310-200

Especialista Tech86

En línea ahora

¡Hola! ¿Cómo podemos ayudar a escalar tu negocio hoy?

Tech86 Engineering

Valoramos tu privacidad

Utilizamos cookies y tecnologías similares para optimizar tu experiencia, analizar el tráfico del sitio web y personalizar contenido. Al hacer clic en "Aceptar Todos", aceptas el uso de todas las cookies. Lee nuestra Política de Privacidad.