Tokens de entrada e saída na IA e por que custam diferente

Equipe Viver de IA · 2026-09-24
O output custa mais caro que o input, e quem entende isso reescreve o prompt e paga menos pela mesma resposta.
O essencial
- Em operações de alto volume, respostas curtas e objetivas reduzem custo sem comprometer o resultado.
- O histórico reenviado a cada mensagem em fluxos conversacionais é a principal causa silenciosa de inflação de input.
- A decisão de investir ou comprimir a saída depende do caso de uso: o erro é deixar o formato da resposta no automático sem essa análise.
O output custa até o quíntuplo do input, e quase ninguém percebe
De todo mundo que começa a usar IA na empresa e olha a fatura no fim do mês, a maioria acha que paga por "pergunta feita". Não é bem assim. Você paga por dois bolsos separados: o que você MANDA pra IA (entrada) e o que ela te DEVOLVE (saída). E o segundo custa mais caro que o primeiro, quase sempre.
Quando a gente vai desenhar uma solução por dentro na Viver de IA, essa é uma das primeiras contas que a gente faz antes de escrever uma linha de prompt. Não porque somos economistas de token. Porque em operação de volume, essa diferença de preço decide se a automação paga a conta ou vira um ralo que você só descobre no boleto.
Vou te explicar o que são esses tokens, por que os preços são diferentes, e principalmente: o que muda no jeito de escrever o prompt quando você entende isso. Sem jargão de engenheiro.
O que são tokens de entrada e saída na IA
Token é o pedacinho de texto que a IA conta pra cobrar. Não é uma palavra inteira nem uma letra: é um fragmento. "Contabilidade" pode virar três ou quatro tokens. Em português, a regra de bolso é que uma palavra comum dá mais ou menos 1 a 2 tokens. Guarde só isso: quanto mais texto, mais tokens, mais custo.
Agora a parte que importa. Existem dois tipos:
- Token de entrada (input): tudo que você envia pra IA. A sua pergunta, as instruções, o contexto que você cola junto (o PDF, o histórico da conversa, a planilha inteira que você jogou no prompt).
- Token de saída (output): tudo que a IA escreve de volta. A resposta, o texto gerado, o resumo, o e-mail redigido.
Você escreve o prompt → IA conta os tokens de entrada → IA processa e gera → IA conta os tokens de saída → Fatura soma os dois separados
Os dois entram na fatura com preço por 1.000 tokens (ou por milhão, dependendo de onde você olha). E aqui está o detalhe que muda tudo: o preço do token de saída é maior que o do token de entrada. Na maioria dos modelos de mercado, a saída custa de três a cinco vezes o valor da entrada. Não é regra universal e cada fornecedor mexe nisso, mas a direção é sempre a mesma: gerar sai mais caro que ler.
Por que a saída custa mais que a entrada
A resposta técnica é chata, então vou dar a versão de gestor. Ler o seu texto é barato porque a IA processa tudo de uma vez, num bloco só. Ela bate o olho no prompt inteiro em paralelo.
Gerar a resposta é diferente. A IA escreve um token de cada vez, e cada novo token depende de todos os anteriores. É trabalho sequencial, um pé na frente do outro. Isso consome muito mais processamento por unidade de texto. É por isso que o dono do modelo cobra mais caro pra devolver do que pra receber.
Na prática, o que isso quer dizer pra você: texto longo que você COLA é barato. Texto longo que a IA ESCREVE é caro. Um prompt gigante com um documento inteiro dentro pode custar menos que uma resposta de duas páginas bem produzida.
A maioria das pessoas raciocina ao contrário. Acha que economiza cortando o contexto que envia, e deixa a IA "despejar" resposta livremente. Aí a conta infla pelo lado errado.
O que muda no jeito de escrever o prompt
Entendida a assimetria de preço, três decisões de prompt mudam de imediato. Essas são as que a gente aplica direto nos projetos.
Peça respostas curtas quando o volume é alto
Se a IA vai rodar uma tarefa mil vezes por dia (classificar e-mail, resumir ticket, marcar um lead), cada palavra a mais na resposta é multiplicada por mil. Nesses casos a gente instrui a IA a responder no formato mais enxuto que resolve: uma palavra, um código, um JSON pequeno. "Responda só APROVADO ou REPROVADO" custa uma fração de "Explique detalhadamente sua análise sobre este caso".
Não é sovinice. É que numa operação de volume, resposta verborrágica é dinheiro queimado sem ninguém ler o texto que a IA escreveu.
Coloque o trabalho pesado na entrada, não na saída
Quer que a IA siga um padrão? Dê o exemplo pronto no prompt (isso é entrada barata) em vez de pedir pra ela inventar o formato do zero e ir corrigindo em várias rodadas (isso vira saída cara, repetida). Colar três exemplos bons no input sai mais em conta que pedir dez respostas até acertar o tom.
Corte a repetição de contexto em conversas longas
Esse é o erro silencioso. Em fluxos onde a IA mantém histórico (um agente de atendimento, por exemplo), a cada nova mensagem o sistema reenvia TODA a conversa anterior como entrada. A vigésima mensagem de um chat carrega as dezenove anteriores junto. O input incha sozinho, mensagem após mensagem, sem você mexer em nada.
Em conversa longa, o que engorda a conta não é a pergunta nova. É o histórico inteiro sendo reenviado a cada rodada, de novo e de novo.
A solução não é técnica demais: você resume o histórico de tempos em tempos, ou define quantas mensagens anteriores realmente precisam viajar junto. Quem monta o fluxo decide isso. Quem não decide, paga.
Onde essa conta aparece de verdade na operação
A teoria só vira dinheiro quando encontra volume. Vou passar por alguns cenários dos nossos projetos pra você ver o padrão, e reparar que em todos o custo real não estava onde o cliente achava.
Na Salus Brasil, a saída foi construir uma plataforma própria que centraliza várias IAs num ambiente só e direciona cada demanda pra IA mais adequada ao objetivo. Isso rendeu mais de R$ 20.000 em economia. O ponto de token aqui é direto: nem toda tarefa precisa do modelo mais caro. Roteirizar demanda pro modelo certo é, no fundo, escolher onde você paga input e output premium e onde paga o básico.
Na Carol e Thaís, a Nina faz recrutamento automatizado pelo WhatsApp: interage com candidato, confirma disponibilidade, agenda entrevista. Rendeu R$ 48.000 em economia anual. Repare que a maioria dessas interações são respostas curtas e objetivas. Não é a IA escrevendo redação. É exatamente o tipo de tarefa onde saída enxuta segura o custo enquanto o volume escala.
Na Corpus, a ferramenta lê perfil de vaga e critérios e gera um resumo dos currículos com insights de relevância de cada candidato, com R$ 12.600 de economia anual. Aqui o output é mais denso de propósito, porque o valor está no resumo bem-feito. É o caso oposto: vale pagar por uma saída mais rica porque ela substitui horas de leitura humana.
É o mesmo conceito puxando decisões diferentes. Em um, você aperta a saída. No outro, você investe nela de olho aberto. O que não pode é deixar no automático sem saber qual dos dois casos é o seu.
O erro mais comum: mirar economia no lugar errado
O padrão que a gente vê com mais frequência é gente cortando o contexto de entrada pra "economizar" e piorando o resultado. Corta o exemplo, corta a instrução, manda um prompt magro. Aí a IA erra, você refaz, refaz de novo, e cada refação gera nova saída cobrada. A economia de dois tokens de entrada vira gasto de dez rodadas de saída.
Input é barato. Use input à vontade pra guiar bem a IA. É na saída que mora o custo que escala.
O segundo erro é não medir. A conta de tokens só assusta quando você multiplica pelo volume real, e muita gente só olha o custo unitário de um teste isolado. Um prompt que custa alguns centavos por chamada parece nada. Multiplicado por 40 mil chamadas no mês, é uma linha na planilha de custos que ninguém previu.
Como estimar o custo antes de escalar?
Pegue o prompt real (com o contexto que ele vai carregar em produção, não a versão de teste), rode uma vez e anote quantos tokens de entrada e de saída ele consumiu. A maioria das plataformas mostra isso na resposta. Depois multiplique cada um pelo preço do seu fornecedor e pelo volume esperado no mês. Faça a conta dos dois bolsos separados: entrada e saída não têm o mesmo preço, então somar tudo junto na média esconde onde está o gasto que dá pra atacar.
Comprar isso pronto ou montar por dentro
Quando o assunto é gerenciar custo de token em escala, aparece a bifurcação de sempre. E ela tem três saídas, não duas.
| Critério | Ferramenta pronta | Construir do zero | Implementar por dentro |
|---|---|---|---|
| Controle sobre o prompt | Baixo, é caixa-fechada | Total | Total, com método |
| Tempo até rodar | Rápido | Lento | Médio |
| Custo de token otimizável | Você paga o que o fornecedor cobra | Sim, mas depende de você saber | Sim, e você aprende a fazer |
| Onde fica o conhecimento | Fora | Dentro, se der certo | Dentro, por construção |
A ferramenta pronta resolve rápido, mas você fica refém do custo que ela repassa e não enxerga onde o token está sendo desperdiçado. Construir do zero te dá controle total, mas exige gente que já saiba essa conta, senão você reinventa a roda torto.
A terceira via é a que a gente recomenda na maioria dos casos: implementar por dentro, com método e plataforma, formando alguém da casa pra dominar isso. O trade-off é honesto. Exige um dono interno e rotina, alguém que vai olhar a fatura de token todo mês e ajustar prompt. Em troca, a capacidade de otimizar custo fica na empresa, não numa fatura de terceiro que você não controla. Se essa é a rota que faz sentido pro seu caso, dá pra ver como isso se estrutura nas soluções prontas que já saem com esse cuidado de custo embutido.
Um passo-a-passo pra botar isso em prática essa semana
Se você já tem alguma IA rodando na operação, dá pra atacar o custo de token sem projeto grande.
- Meça o real: rode o prompt de produção uma vez e anote tokens de entrada e de saída separados
- Ache o gargalo: veja qual bolso pesa mais, geralmente é a saída em respostas longas
- Enxugue a saída: instrua o formato mais curto que ainda resolve a tarefa
- Enriqueça a entrada: coloque exemplos e instruções no input pra reduzir refações
- Projete o volume: multiplique pelo número de chamadas do mês antes de escalar
Não precisa fazer nos cinco de uma vez. Comece medindo. Sem o número real de tokens do seu prompt em produção, todo o resto é chute.
O trade-off que fica
Entender token de entrada e saída te dá poder sobre a conta, mas cobra atenção. Você ganha a capacidade de desenhar prompt que custa menos pelo mesmo resultado, e de saber, antes de escalar, se a automação vai se pagar. Isso é real e mensurável.
O que você abre mão é da ingenuidade confortável de tratar IA como "uma assinatura fixa". A partir do momento que você mede token, cada fluxo vira uma decisão de custo: aperto a saída aqui, invisto nela ali, resumo o histórico acolá. Dá mais trabalho de projeto. Mas é esse trabalho que separa a automação que aparece como economia na planilha da que aparece como surpresa no boleto.
Uma coisa a gente não vai fingir que sabe: o preço exato de cada modelo muda toda hora, e quem te cravar um número fixo hoje provavelmente está desatualizado amanhã. O que não muda é o princípio. Saída custa mais que entrada. Desenhe o prompt sabendo disso.
Relacionados
Agentes de IA: o guia completo
Soluções de IA prontas para empresas
O que é data pipeline para IA: do dado à resposta
Agente de IA no atendimento: onde ele entrega e onde trava
Perguntas frequentes
Por que minha fatura de IA é maior do que eu esperava?
Porque você paga dois bolsos separados: o texto que envia à IA (entrada) e o texto que ela gera de volta (saída), sendo que a saída custa de três a cinco vezes mais que a entrada na maioria dos modelos.
O que são tokens de entrada e saída?
Token de entrada é tudo que você manda para a IA (pergunta, instruções, documentos colados); token de saída é tudo que a IA escreve de volta. Ambos são cobrados separadamente por quantidade de texto.
Por que o token de saída custa mais caro que o de entrada?
Porque a IA lê o seu texto em paralelo de uma vez, mas gera a resposta um token de cada vez em sequência, consumindo muito mais processamento por unidade de texto produzida.
Como reduzir o custo de IA em operações de alto volume?
Instrua a IA a responder de forma enxuta (ex.: uma palavra ou código), coloque exemplos prontos no prompt em vez de pedir múltiplas tentativas, e limite o histórico de conversa reenviado a cada rodada.
Cortar o contexto que envio à IA é uma boa forma de economizar?
Não. Reduzir o contexto de entrada tende a piorar o resultado e gerar mais rodadas de correção, que por sua vez aumentam o custo de saída, o lado mais caro da conta.
Isto não é teoria. É o que já implementamos.
521 cases reais, todos com número aberto, e 159 soluções de IA prontas para empresas brasileiras.