Custo de IA em tokens: a conta real que ninguém abre

Custo de IA em tokens: a conta real que ninguém abre

Equipe Viver de IA · 2026-09-22

O que você paga quando usa IA de verdade, o que faz a fatura inflar sem aviso e os critérios que a gente usa por dentro pra manter a conta no lugar.

O essencial

  • O custo de IA é decidido no projeto, não na fatura: os principais vilões são arquitetura de contexto, tamanho de prompt e escolha de modelo, não o preço por token.
  • Começar pelo modelo mais barato que resolve a tarefa é o ajuste que mais reduz custo sem afetar o resultado percebido pelo usuário final.
  • Otimizar tokens só se torna prioritário quando o volume escala para milhares de chamadas diárias; antes disso, o custo dominante é o tempo de quem constrói.
  • Projetar o custo no pico de volume, não no volume médio, é o critério que determina se uma automação é viável antes de qualquer linha ser construída.

O que é um token, sem enrolação de engenheiro

Token é a unidade que a IA cobra. Pense num pedaço de palavra: "contabilidade" pode virar três ou quatro tokens, "nota fiscal" vira dois, um espaço conta, um sinal de pontuação conta. Toda vez que você manda um texto pro modelo e ele responde, os dois lados viram token, e você paga pelos dois.

A parte que pouca gente sabe: você paga pela entrada e pela saída em separado, e a saída costuma custar bem mais caro por token do que a entrada. Isso muda tudo na hora de desenhar uma automação. Um assistente que responde em três parágrafos gasta muito mais que um que responde em duas linhas, mesmo recebendo a mesma pergunta.

Quando a gente fala em custo de ia tokens dentro de um projeto, é isso: não é uma mensalidade fixa que você contrata. É consumo, igual conta de luz. Roda mais, paga mais. Roda mal desenhado, paga muito mais pelo mesmo resultado.

Essa é a primeira coisa que a gente destrava na cabeça de quem chega achando que IA é assinatura mensal. Não é. É medidor.

Por que a conta infla sem você mexer em nada

A fatura de IA raramente estoura por causa do preço por token. Estoura por causa de decisão de arquitetura que ninguém revisou. A gente vê o mesmo punhado de vilões se repetir nos projetos:

  • Contexto empilhado. Num chat que lembra a conversa toda, cada nova pergunta reenvia o histórico inteiro pro modelo. A quinta mensagem carrega as quatro anteriores junto. Sem poda, a conversa longa fica cara no fim, não no começo.
  • Prompt gigante em toda chamada. Se o seu agente tem uma instrução de duas páginas explicando tom de voz, regras e exemplos, essas duas páginas viajam em cada mensagem. Numa operação de mil atendimentos por dia, isso é peso morto multiplicado por mil.
  • Modelo maior do que a tarefa pede. O modelo mais potente custa um múltiplo do modelo intermediário. Muita gente pluga o topo de linha pra classificar se um e-mail é reclamação ou elogio. É como contratar um advogado sênior pra carimbar protocolo.
  • Resposta sem rédea. Se você não limita o tamanho da saída, o modelo às vezes resolve escrever uma redação. E saída é a parte cara.
  • Retentativa cega. Deu erro, o sistema tenta de novo. Deu erro de novo, tenta de novo. Cada tentativa é cobrada. Sem um teto de tentativas, um bug pequeno vira uma sangria.

Nenhum desses é preço de tabela. Todos são desenho. E é por isso que a gente insiste: o custo de IA é decidido no projeto, não na fatura.

Como a gente estima o gasto antes de ligar a chave

Dentro dos nossos projetos, ninguém liga uma automação pra "ver quanto dá". A gente estima antes, com uma conta grosseira que qualquer gestor consegue acompanhar. O raciocínio é este:

Volume por diaTamanho médio de cada chamadaEntrada + saída em tokensMultiplica pelo preço do modeloCusto mensal projetado

Na prática a gente pega três números do próprio negócio, não da tecnologia:

  1. Quantas vezes isso roda por dia. Atendimentos, e-mails processados, relatórios gerados. Esse é o multiplicador que manda na conta.
  2. Quão pesada é cada rodada. Um resumo de uma frase é leve. Uma análise que lê um contrato de 40 páginas é pesada. A diferença entre os dois é de ordem de grandeza, não de percentual.
  3. Qual modelo a tarefa exige de verdade. Aqui a gente é teimoso: começa pelo modelo mais barato que resolve, e só sobe se a qualidade não bater. O caminho inverso, começar no topo e tentar descer depois, quase nunca acontece porque o time não volta pra otimizar o que já está funcionando.

Com esses três números você não acerta o centavo, mas acerta a ordem de grandeza. E saber se uma automação vai custar dezenas ou milhares de reais por mês é o que decide se ela vale a pena antes de qualquer linha ser construída.

Quanto custa começar, na real?

Pra tarefas internas de baixo volume (um time gerando conteúdo, algumas análises por dia), o consumo de tokens costuma ser o menor item da conta, às vezes centavos por rodada. Nesse estágio, o custo que define o projeto é o tempo de quem constrói e mantém, não a fatura da API. A conta de token só vira protagonista quando o volume escala pra milhares de chamadas diárias, tipicamente num atendimento ao cliente aberto ao público. Antes disso, otimizar token é prematuro. Depois disso, é obrigatório.

O modelo que a gente escolhe primeiro é quase sempre o mais barato

Existe uma crença de que IA boa é IA cara. Nos projetos, o padrão é o contrário: a maioria das tarefas de empresa é resolvida por modelos intermediários com folga. Classificar, resumir, extrair dados de um documento, responder pergunta frequente. Nada disso precisa do cérebro mais caro do mercado.

O modelo de topo entra em coisa específica: raciocínio longo, decisão de negócio com muita nuance, código complexo. Fora disso, é dinheiro gasto por diferença de qualidade que o usuário final nem percebe.

A lógica que a gente aplica é simples de repetir:

  • Tarefa repetitiva e de padrão claro: modelo mais barato, sempre.
  • Tarefa com julgamento e contexto amplo: modelo intermediário, testando se sobe.
  • Tarefa crítica onde erro custa caro: aí sim vale o topo, e vale pagar.

Usar o modelo certo pra cada camada é o ajuste que mais derruba conta sem tocar em uma vírgula do resultado. É a diferença entre uma automação que se paga e uma que vira item de corte na próxima reunião de custo.

Por dentro: os critérios que a casa usa antes de aprovar um fluxo

Quando um projeto vai pro ar, a gente não olha só "funciona?". Olha "funciona e cabe na conta no volume real?". Os critérios que a gente passa antes de liberar são estes, na ordem:

  1. Qual o volume no pior mês? Não o volume de hoje. O de dezembro, o da campanha, o do pico. Se a conta só fecha no volume tranquilo, ela não fecha.
  2. A saída tem teto? Toda resposta precisa de um limite de tamanho. Assistente que responde solto é assistente que gasta solto.
  3. O prompt está enxuto? A gente corta instrução repetida, exemplo desnecessário, regra que o modelo já entende sozinho. Prompt enxuto é economia que se multiplica por cada chamada.
  4. Dá pra cachear o que não muda? Parte do contexto que se repete em toda chamada (as instruções fixas, uma base de referência) pode ser reaproveitada em vez de reenviada inteira. Onde a plataforma permite, isso derruba a parte de entrada de forma sensível.
  5. Tem teto de tentativas e alerta de gasto? Erro acontece. O que não pode acontecer é erro rodando em loop cobrando sozinho de madrugada. Um limite de tentativas e um alarme de consumo diário são a rede de segurança básica.

Se um fluxo não passa por esses cinco, ele volta pra prancheta. Não porque vai quebrar amanhã, mas porque vai virar uma surpresa desagradável em três meses, quando o volume crescer e ninguém lembrar por que a fatura dobrou.

Custo de IA não estoura de uma vez. Ele sobe um degrau a cada volume novo que ninguém remodelou.

O que o consumo de token esconde no valor total

Aqui está a parte que muda a conversa: na maioria dos projetos que a gente entrega, o token é o item barato. O que pesa de verdade é o que roda em volta dele.

Olha o caso da Nitro Química. A Nitro Química chegou a uma economia gerada com a Nina, uma colaboradora digital que consulta mais de 70 fontes de sistemas pra orientar usuários e resolver dúvidas, escalando pra chamado só quando é emergência. O gasto de token dessa operação existe, claro. Mas ele é uma fração minúscula perto do valor que a solução gerou e perto do custo de construir e integrar a Nina com dezenas de sistemas. Nenhum projeto desse porte trava por causa da fatura de token. Trava por causa da arquitetura, das integrações, da manutenção.

O mesmo raciocínio vale pra ponta menor. A Sulcontábil gerou R$ 1.200 por mês em economia com a Irisul, uma plataforma própria de automação de marketing e gestão comercial. Numa operação desse tamanho, o consumo de token é praticamente ruído na planilha. O valor está no processo que deixou de ser feito na mão.

A lição que a gente carrega de projeto em projeto: o custo de token importa quando você tem volume; o custo de construção e manutenção importa sempre. Focar só na fatura da API e ignorar quem vai manter o fluxo é olhar pro item errado da conta.

Quando o assunto é orçamento de IA de ponta a ponta, e não só a parte de token, vale entender o que entra em os planos antes de fechar qualquer conta de guardanapo.

Comprar pronto, construir do zero, ou implementar por dentro

Quando o gestor entende que token é consumo, aparece a pergunta seguinte: onde eu ligo isso? Três caminhos reais, com o custo de cada um jogado na mesa sem maquiagem.

CritérioFerramenta pronta de mercadoConstruir do zeroImplementar por dentro com método
Controle sobre o gasto de tokenBaixo, você paga o pacote delesTotal, e a responsabilidade tambémAlto, com critério de quem já rodou isso
Velocidade pra ligarRápidaLentaMédia
Custo de manutençãoEmbutido, opacoTodo seuSeu, mas com processo pra segurar
Onde a capacidade ficaFora da empresaDentro, se sobreviver à rotatividadeDentro, com o time treinado

A ferramenta pronta resolve rápido e esconde o token dentro de uma mensalidade. Cômodo até o dia em que você quer mudar algo e não pode. Construir do zero te dá controle total do gasto e te entrega, junto, toda a dor de otimizar prompt, escolher modelo e vigiar consumo sem nunca ter feito isso antes.

A terceira via é a que a gente defende, e não por conveniência de vendedor: implementar por dentro, com método e com o time da casa aprendendo a estimar, medir e cortar custo. Custa mais esforço no começo (exige um dono interno e rotina de acompanhamento), mas a competência de controlar a própria conta de IA fica na empresa. É a diferença entre saber por que a fatura subiu e só receber o susto. Se você prefere ver isso montado e rodando com os critérios já aplicados, dá pra começar pelas soluções prontas e ir assumindo o controle de dentro.

O trade-off que fica

Controlar custo de token tem um preço, e é honesto dizer qual. Toda economia que a gente descreveu (modelo mais barato, prompt enxuto, saída com teto, cache) exige atenção contínua. Não é ligar e esquecer. É medir, revisar quando o volume muda, questionar cada fluxo que cresceu.

O caminho preguiçoso é plugar o modelo mais caro em tudo, deixar a resposta solta e não olhar a fatura até ela doer. Funciona por um tempo, e some com a margem no silêncio.

O caminho que a gente escolhe cobra disciplina: alguém dentro da empresa que olhe o consumo como olha qualquer outra despesa variável. Em troca, você tem IA que escala sem que a conta escale junto. Essa é a escolha real. Não entre IA cara e IA barata. Entre uma operação que você entende e uma que te surpreende todo dia 5.

Quem paga o preço da disciplina fica com o controle. Quem não paga, paga a fatura.

Relacionados

Agentes de IA: o guia completo

Soluções de IA prontas para empresas

Mais de 500 cases reais de IA

Multa de R$ 50 milhões: o que o PL da IA muda pra sua empresa

Idempotência em automação de IA sem cobrança dobrada

Perguntas frequentes

IA é cobrada como assinatura mensal ou como consumo?

É consumo, igual conta de luz: quanto mais a automação roda, mais você paga, e um fluxo mal desenhado paga muito mais pelo mesmo resultado.

Por que minha fatura de IA subiu sem eu mudar nada?

O custo infla por decisões de arquitetura: histórico de conversa empilhado, prompts gigantes repetidos em cada chamada, modelo mais caro do que a tarefa exige ou respostas sem limite de tamanho.

Como estimar o custo de uma automação antes de colocá-la em produção?

Cruzar três números do próprio negócio: quantas vezes o fluxo roda por dia, quão pesada é cada chamada em tokens, e qual modelo a tarefa realmente exige, isso define a ordem de grandeza do gasto mensal.

Preciso usar o modelo de IA mais potente para ter bom resultado?

Não. A maioria das tarefas empresariais, classificar, resumir, extrair dados, responder perguntas frequentes, é resolvida por modelos intermediários; o modelo de topo só se justifica em raciocínio longo, decisões com muita nuance ou onde o erro tem custo alto.

Quais controles básicos evitam surpresas na fatura de IA?

Definir teto de tamanho nas respostas, manter prompts enxutos, cachear instruções fixas quando possível, e configurar limite de tentativas e alerta de gasto diário para evitar erros rodando em loop.

Isto não é teoria. É o que já implementamos.

521 cases reais, todos com número aberto, e 159 soluções de IA prontas para empresas brasileiras.

Conhecer a plataforma · Falar com a Nina