Tokens de entrada e saída na IA e por que custam diferente

Tokens de entrada e saída na IA e por que custam diferente

Equipe Viver de IA · 2026-09-24

O output custa mais caro que o input, e quem entende isso reescreve o prompt e paga menos pela mesma resposta.

O essencial

  • Em operações de alto volume, respostas curtas e objetivas reduzem custo sem comprometer o resultado.
  • O histórico reenviado a cada mensagem em fluxos conversacionais é a principal causa silenciosa de inflação de input.
  • A decisão de investir ou comprimir a saída depende do caso de uso: o erro é deixar o formato da resposta no automático sem essa análise.

O output custa até o quíntuplo do input, e quase ninguém percebe

De todo mundo que começa a usar IA na empresa e olha a fatura no fim do mês, a maioria acha que paga por "pergunta feita". Não é bem assim. Você paga por dois bolsos separados: o que você MANDA pra IA (entrada) e o que ela te DEVOLVE (saída). E o segundo custa mais caro que o primeiro, quase sempre.

Quando a gente vai desenhar uma solução por dentro na Viver de IA, essa é uma das primeiras contas que a gente faz antes de escrever uma linha de prompt. Não porque somos economistas de token. Porque em operação de volume, essa diferença de preço decide se a automação paga a conta ou vira um ralo que você só descobre no boleto.

Vou te explicar o que são esses tokens, por que os preços são diferentes, e principalmente: o que muda no jeito de escrever o prompt quando você entende isso. Sem jargão de engenheiro.

O que são tokens de entrada e saída na IA

Token é o pedacinho de texto que a IA conta pra cobrar. Não é uma palavra inteira nem uma letra: é um fragmento. "Contabilidade" pode virar três ou quatro tokens. Em português, a regra de bolso é que uma palavra comum dá mais ou menos 1 a 2 tokens. Guarde só isso: quanto mais texto, mais tokens, mais custo.

Agora a parte que importa. Existem dois tipos:

  • Token de entrada (input): tudo que você envia pra IA. A sua pergunta, as instruções, o contexto que você cola junto (o PDF, o histórico da conversa, a planilha inteira que você jogou no prompt).
  • Token de saída (output): tudo que a IA escreve de volta. A resposta, o texto gerado, o resumo, o e-mail redigido.

Você escreve o promptIA conta os tokens de entradaIA processa e geraIA conta os tokens de saídaFatura soma os dois separados

Os dois entram na fatura com preço por 1.000 tokens (ou por milhão, dependendo de onde você olha). E aqui está o detalhe que muda tudo: o preço do token de saída é maior que o do token de entrada. Na maioria dos modelos de mercado, a saída custa de três a cinco vezes o valor da entrada. Não é regra universal e cada fornecedor mexe nisso, mas a direção é sempre a mesma: gerar sai mais caro que ler.

Por que a saída custa mais que a entrada

A resposta técnica é chata, então vou dar a versão de gestor. Ler o seu texto é barato porque a IA processa tudo de uma vez, num bloco só. Ela bate o olho no prompt inteiro em paralelo.

Gerar a resposta é diferente. A IA escreve um token de cada vez, e cada novo token depende de todos os anteriores. É trabalho sequencial, um pé na frente do outro. Isso consome muito mais processamento por unidade de texto. É por isso que o dono do modelo cobra mais caro pra devolver do que pra receber.

Na prática, o que isso quer dizer pra você: texto longo que você COLA é barato. Texto longo que a IA ESCREVE é caro. Um prompt gigante com um documento inteiro dentro pode custar menos que uma resposta de duas páginas bem produzida.

A maioria das pessoas raciocina ao contrário. Acha que economiza cortando o contexto que envia, e deixa a IA "despejar" resposta livremente. Aí a conta infla pelo lado errado.

O que muda no jeito de escrever o prompt

Entendida a assimetria de preço, três decisões de prompt mudam de imediato. Essas são as que a gente aplica direto nos projetos.

Peça respostas curtas quando o volume é alto

Se a IA vai rodar uma tarefa mil vezes por dia (classificar e-mail, resumir ticket, marcar um lead), cada palavra a mais na resposta é multiplicada por mil. Nesses casos a gente instrui a IA a responder no formato mais enxuto que resolve: uma palavra, um código, um JSON pequeno. "Responda só APROVADO ou REPROVADO" custa uma fração de "Explique detalhadamente sua análise sobre este caso".

Não é sovinice. É que numa operação de volume, resposta verborrágica é dinheiro queimado sem ninguém ler o texto que a IA escreveu.

Coloque o trabalho pesado na entrada, não na saída

Quer que a IA siga um padrão? Dê o exemplo pronto no prompt (isso é entrada barata) em vez de pedir pra ela inventar o formato do zero e ir corrigindo em várias rodadas (isso vira saída cara, repetida). Colar três exemplos bons no input sai mais em conta que pedir dez respostas até acertar o tom.

Corte a repetição de contexto em conversas longas

Esse é o erro silencioso. Em fluxos onde a IA mantém histórico (um agente de atendimento, por exemplo), a cada nova mensagem o sistema reenvia TODA a conversa anterior como entrada. A vigésima mensagem de um chat carrega as dezenove anteriores junto. O input incha sozinho, mensagem após mensagem, sem você mexer em nada.

Em conversa longa, o que engorda a conta não é a pergunta nova. É o histórico inteiro sendo reenviado a cada rodada, de novo e de novo.

A solução não é técnica demais: você resume o histórico de tempos em tempos, ou define quantas mensagens anteriores realmente precisam viajar junto. Quem monta o fluxo decide isso. Quem não decide, paga.

Onde essa conta aparece de verdade na operação

A teoria só vira dinheiro quando encontra volume. Vou passar por alguns cenários dos nossos projetos pra você ver o padrão, e reparar que em todos o custo real não estava onde o cliente achava.

Na Salus Brasil, a saída foi construir uma plataforma própria que centraliza várias IAs num ambiente só e direciona cada demanda pra IA mais adequada ao objetivo. Isso rendeu mais de R$ 20.000 em economia. O ponto de token aqui é direto: nem toda tarefa precisa do modelo mais caro. Roteirizar demanda pro modelo certo é, no fundo, escolher onde você paga input e output premium e onde paga o básico.

Na Carol e Thaís, a Nina faz recrutamento automatizado pelo WhatsApp: interage com candidato, confirma disponibilidade, agenda entrevista. Rendeu R$ 48.000 em economia anual. Repare que a maioria dessas interações são respostas curtas e objetivas. Não é a IA escrevendo redação. É exatamente o tipo de tarefa onde saída enxuta segura o custo enquanto o volume escala.

Na Corpus, a ferramenta lê perfil de vaga e critérios e gera um resumo dos currículos com insights de relevância de cada candidato, com R$ 12.600 de economia anual. Aqui o output é mais denso de propósito, porque o valor está no resumo bem-feito. É o caso oposto: vale pagar por uma saída mais rica porque ela substitui horas de leitura humana.

É o mesmo conceito puxando decisões diferentes. Em um, você aperta a saída. No outro, você investe nela de olho aberto. O que não pode é deixar no automático sem saber qual dos dois casos é o seu.

O erro mais comum: mirar economia no lugar errado

O padrão que a gente vê com mais frequência é gente cortando o contexto de entrada pra "economizar" e piorando o resultado. Corta o exemplo, corta a instrução, manda um prompt magro. Aí a IA erra, você refaz, refaz de novo, e cada refação gera nova saída cobrada. A economia de dois tokens de entrada vira gasto de dez rodadas de saída.

Input é barato. Use input à vontade pra guiar bem a IA. É na saída que mora o custo que escala.

O segundo erro é não medir. A conta de tokens só assusta quando você multiplica pelo volume real, e muita gente só olha o custo unitário de um teste isolado. Um prompt que custa alguns centavos por chamada parece nada. Multiplicado por 40 mil chamadas no mês, é uma linha na planilha de custos que ninguém previu.

Como estimar o custo antes de escalar?

Pegue o prompt real (com o contexto que ele vai carregar em produção, não a versão de teste), rode uma vez e anote quantos tokens de entrada e de saída ele consumiu. A maioria das plataformas mostra isso na resposta. Depois multiplique cada um pelo preço do seu fornecedor e pelo volume esperado no mês. Faça a conta dos dois bolsos separados: entrada e saída não têm o mesmo preço, então somar tudo junto na média esconde onde está o gasto que dá pra atacar.

Comprar isso pronto ou montar por dentro

Quando o assunto é gerenciar custo de token em escala, aparece a bifurcação de sempre. E ela tem três saídas, não duas.

CritérioFerramenta prontaConstruir do zeroImplementar por dentro
Controle sobre o promptBaixo, é caixa-fechadaTotalTotal, com método
Tempo até rodarRápidoLentoMédio
Custo de token otimizávelVocê paga o que o fornecedor cobraSim, mas depende de você saberSim, e você aprende a fazer
Onde fica o conhecimentoForaDentro, se der certoDentro, por construção

A ferramenta pronta resolve rápido, mas você fica refém do custo que ela repassa e não enxerga onde o token está sendo desperdiçado. Construir do zero te dá controle total, mas exige gente que já saiba essa conta, senão você reinventa a roda torto.

A terceira via é a que a gente recomenda na maioria dos casos: implementar por dentro, com método e plataforma, formando alguém da casa pra dominar isso. O trade-off é honesto. Exige um dono interno e rotina, alguém que vai olhar a fatura de token todo mês e ajustar prompt. Em troca, a capacidade de otimizar custo fica na empresa, não numa fatura de terceiro que você não controla. Se essa é a rota que faz sentido pro seu caso, dá pra ver como isso se estrutura nas soluções prontas que já saem com esse cuidado de custo embutido.

Um passo-a-passo pra botar isso em prática essa semana

Se você já tem alguma IA rodando na operação, dá pra atacar o custo de token sem projeto grande.

  1. Meça o real: rode o prompt de produção uma vez e anote tokens de entrada e de saída separados
  2. Ache o gargalo: veja qual bolso pesa mais, geralmente é a saída em respostas longas
  3. Enxugue a saída: instrua o formato mais curto que ainda resolve a tarefa
  4. Enriqueça a entrada: coloque exemplos e instruções no input pra reduzir refações
  5. Projete o volume: multiplique pelo número de chamadas do mês antes de escalar

Não precisa fazer nos cinco de uma vez. Comece medindo. Sem o número real de tokens do seu prompt em produção, todo o resto é chute.

O trade-off que fica

Entender token de entrada e saída te dá poder sobre a conta, mas cobra atenção. Você ganha a capacidade de desenhar prompt que custa menos pelo mesmo resultado, e de saber, antes de escalar, se a automação vai se pagar. Isso é real e mensurável.

O que você abre mão é da ingenuidade confortável de tratar IA como "uma assinatura fixa". A partir do momento que você mede token, cada fluxo vira uma decisão de custo: aperto a saída aqui, invisto nela ali, resumo o histórico acolá. Dá mais trabalho de projeto. Mas é esse trabalho que separa a automação que aparece como economia na planilha da que aparece como surpresa no boleto.

Uma coisa a gente não vai fingir que sabe: o preço exato de cada modelo muda toda hora, e quem te cravar um número fixo hoje provavelmente está desatualizado amanhã. O que não muda é o princípio. Saída custa mais que entrada. Desenhe o prompt sabendo disso.

Relacionados

Agentes de IA: o guia completo

Soluções de IA prontas para empresas

Mais de 500 cases reais de IA

O que é data pipeline para IA: do dado à resposta

Agente de IA no atendimento: onde ele entrega e onde trava

Perguntas frequentes

Por que minha fatura de IA é maior do que eu esperava?

Porque você paga dois bolsos separados: o texto que envia à IA (entrada) e o texto que ela gera de volta (saída), sendo que a saída custa de três a cinco vezes mais que a entrada na maioria dos modelos.

O que são tokens de entrada e saída?

Token de entrada é tudo que você manda para a IA (pergunta, instruções, documentos colados); token de saída é tudo que a IA escreve de volta. Ambos são cobrados separadamente por quantidade de texto.

Por que o token de saída custa mais caro que o de entrada?

Porque a IA lê o seu texto em paralelo de uma vez, mas gera a resposta um token de cada vez em sequência, consumindo muito mais processamento por unidade de texto produzida.

Como reduzir o custo de IA em operações de alto volume?

Instrua a IA a responder de forma enxuta (ex.: uma palavra ou código), coloque exemplos prontos no prompt em vez de pedir múltiplas tentativas, e limite o histórico de conversa reenviado a cada rodada.

Cortar o contexto que envio à IA é uma boa forma de economizar?

Não. Reduzir o contexto de entrada tende a piorar o resultado e gerar mais rodadas de correção, que por sua vez aumentam o custo de saída, o lado mais caro da conta.

Isto não é teoria. É o que já implementamos.

521 cases reais, todos com número aberto, e 159 soluções de IA prontas para empresas brasileiras.

Conhecer a plataforma · Falar com a Nina