InícioFundamentos › Tokens explicados de forma simples
Fundamentos de IA

Tokens explicados de forma simples

Por Fábio Hallgren · Atualizado em 17 set 2026 · 4 min de leitura · 827 palavras

Em resumo

  • Um token é um pedaço de palavra, cerca de 3 a 4 caracteres em português.
  • Entrada e saída são cobradas separadamente.

A unidade que o modelo lê e que define custo e limite.

Um token é um pedaço de palavra, cerca de 3 a 4 caracteres em português.

Guia completo e atualizado

Quando recebi a primeira fatura de API, achei que tinha sido cobrado errado. Eram poucas mensagens. O que eu não tinha entendido é que cada mensagem carregava um prompt de sistema de duas páginas, e ele era cobrado toda vez. Entender tokens teria me poupado esse susto e alguns reais. Este artigo é a explicação que eu precisava.

Você vai entender o que é um token, por que ele define custo e limite, como estimar quantos tokens tem um texto e três hábitos que reduzem a conta.

O que é um token

Modelos de linguagem não leem letras nem palavras; leem tokens, pedaços de texto de tamanho variável. Em português, um token tem em média três a quatro caracteres. "Relatório" pode virar dois ou três tokens; "de" é um. Emojis, acentos e palavras raras costumam consumir mais tokens que o esperado.

A regra prática que uso: divida o número de caracteres por 3,5. Um texto de 1.000 palavras, com cerca de 6.000 caracteres, tem perto de 1.700 tokens. A calculadora deste site faz essa conta.

Leia também · Fundamentos

Janela de contexto: quanto o modelo lembra

O limite de texto que cabe em uma conversa e como usá-lo bem. →

Por que tokens importam

Dois motivos. Custo: a API cobra por tokens de entrada (o que você envia) e de saída (o que o modelo gera), com preços diferentes, e a saída costuma custar mais. Limite: cada modelo tem uma janela de contexto, o máximo de tokens que cabe em uma conversa, incluindo arquivos, respostas anteriores e o prompt de sistema. Quando estoura, o início é cortado ou a conversa é resumida.

Nos aplicativos de chat você não vê a conta, mas o limite de uso do plano também é, na prática, um limite de tokens. Conversas longas e arquivos grandes esgotam a cota mais rápido.

O custo escondido: o que se repete

Foi o meu erro. Se toda chamada envia o mesmo prompt de sistema de 2.000 tokens, e você faz 1.000 chamadas por mês, são 2 milhões de tokens só de repetição. A saída, que é o que você realmente quer, pode ser uma fração disso. O cache de prompt existe exatamente para isso: o contexto repetido é processado uma vez e reaproveitado por um período, a um custo menor.

Como estimar antes de construir

Tokens médios de entrada por pedido, mais tokens médios de saída, vezes o preço de cada um, vezes o volume mensal, mais 30% de margem para retentativas e crescimento. Faça a conta antes de escrever a primeira linha do sistema.

Três hábitos que reduzem a conta

Encurtar o prompt de sistema: cada frase deve pagar o próprio custo. Limitar a saída: defina o máximo de tokens de resposta; uma classificação não precisa de 500 tokens. Usar modelo menor para etapas simples: triagem, classificação e extração ficam bem em modelos pequenos, e o modelo grande entra só onde a qualidade exige.

No chat, o equivalente é: começar conversas novas por tema, resumir conversas longas e anexar só as partes relevantes de um arquivo grande.

Tokens em arquivos, imagens e PDFs

Arquivos anexados também viram tokens, e é aí que a conta surpreende. Um PDF de 40 páginas pode passar de 30 mil tokens; uma imagem consome uma quantidade que depende da resolução; uma planilha grande, se lida como texto, estoura a janela rápido. Por isso os assistentes processam arquivos grandes por código: só o resultado da análise entra na conversa, não as milhares de linhas.

Na prática: quando a pergunta é sobre uma parte do documento, envie a parte. Quando é sobre o todo, peça o agregado e o número de controle. E em conversas longas com vários anexos, abra um chat novo por tema; o histórico inteiro é reenviado a cada mensagem.

Tokens e qualidade

Mais tokens de entrada não significam resposta melhor. Contexto irrelevante piora a resposta, porque o modelo divide a atenção. O ideal é o mínimo de contexto que contém tudo que a tarefa exige. Peça o agregado, não a leitura linha a linha; envie a seção do contrato, não o contrato inteiro, quando a pergunta é sobre uma cláusula.

FHFábio Hallgren

O que mudou depois do susto

Cortei o prompt de sistema pela metade, ativei cache para a parte fixa, limitei a saída das etapas de classificação e passei a registrar tokens de entrada e saída de cada chamada. A conta mensal caiu para cerca de um terço, com a mesma qualidade. Hoje, antes de qualquer automação nova, faço a estimativa na calculadora e só depois escrevo o código.

Perguntas frequentes

Um token é uma palavra?

Não. É um pedaço de texto, em média três a quatro caracteres em português. Uma palavra pode ter um ou vários tokens.

Como sei quantos tokens tem meu prompt?

Use a calculadora deste site ou divida os caracteres por 3,5. As APIs também informam a contagem exata em cada resposta.

Entrada e saída custam o mesmo?

Não. A saída costuma custar várias vezes mais que a entrada. Por isso limitar o tamanho da resposta reduz a conta.

No app de chat eu pago por token?

Indiretamente. O limite de uso do plano é consumido mais rápido por conversas longas e arquivos grandes.

Fontes e método

  • Documentação de preços e cache de prompt da Anthropic
  • Registros próprios de consumo de API, 2025 e 2026