TokenRecargatokenrecarga
Blog

O que são tokens? Como as APIs de IA cobram (e como estimar seu custo)

30 de agosto de 2026 · fundamentos · custos

Toda API de modelo de linguagem — DeepSeek, GPT, Claude, Qwen — cobra pela mesma unidade: o token. Antes de estimar quanto a IA vai custar no seu produto, vale entender o que exatamente está sendo contado.

Token não é palavra

O modelo não lê palavras: lê pedaços de texto chamados tokens. Em português, uma palavra comum vira em média 1,5 a 2 tokens — palavras longas, acentos e termos raros fragmentam mais. Uma regra de bolso razoável para português: 1.000 tokens ≈ 650 a 750 palavras. Em inglês o texto rende um pouco mais por token; em código, depende da linguagem e da densidade de símbolos.

Entrada e saída têm preços diferentes

Toda chamada tem dois lados, e cada um tem seu preço por milhão de tokens (MTok):

  • Tokens de entrada (input): tudo o que você envia — instruções de sistema, histórico da conversa, documentos anexados, a pergunta do usuário.
  • Tokens de saída (output): o que o modelo gera. Costumam custar 3 a 5 vezes mais que os de entrada, porque gerar texto é mais caro do que lê-lo.
  • Entrada em cache: quando o mesmo prefixo de prompt se repete entre chamadas (instruções de sistema, por exemplo), muitos provedores cobram uma fração do preço normal pela parte repetida.

Fazendo a conta em reais

Suponha um assistente de atendimento que recebe em média 2.000 tokens de contexto e responde com 300 tokens. A conta por atendimento é:

custo = (2.000 / 1.000.000) × preço_input_MTok
      + (  300 / 1.000.000) × preço_output_MTok

Com um modelo econômico custando, digamos, R$ 1 por MTok de entrada e R$ 3,50 por MTok de saída, cada atendimento sai por cerca de R$ 0,003 — mil atendimentos por menos de R$ 3,50. O que muda a ordem de grandeza não costuma ser o preço unitário, e sim o tamanho do contexto que você envia a cada chamada.

Armadilhas comuns de estimativa

  • Esquecer o histórico: em conversas, o histórico inteiro é reenviado (e cobrado) a cada turno. Uma conversa de 20 turnos não custa 20 × uma chamada — custa bem mais, porque o contexto cresce.
  • Ignorar tokens de raciocínio: modelos com "reasoning" geram tokens internos de raciocínio que entram na conta de saída do provedor. O número reportado de completion_tokens já os inclui — não devem ser cobrados duas vezes.
  • Estimar em dólar e esquecer o câmbio: se você paga em moeda estrangeira, o custo real em reais varia com o câmbio do dia e taxas do meio de pagamento. Cotar direto em reais elimina essa variável.

Medindo o custo real, chamada a chamada

Estimativa é ponto de partida; medição é o que sustenta decisão. Na TokenRecarga, cada resposta da API vem com o cabeçalho x-mt-cost-brl informando quanto aquela chamada custou em reais, e o painel consolida o uso por chave e por modelo. Os preços por modelo estão publicados em nossa tabela de preços em reais, atualizada com o câmbio PTAX.