Pular para o conteúdo
Módulo 0216 min

Tokens, contexto e custo

Por que uma conversa longa fica mais cara e menos precisa, e o que fazer sobre isso.

No módulo anterior você viu que um modelo produz texto um pedaço de cada vez. Este módulo trata desse "pedaço" com precisão — porque é a partir dele que se entende custo, limite de conversa e por que colar um documento inteiro numa pergunta simples costuma sair pela culatra.

O que é um token

Token é a unidade que o modelo lê e escreve. Não é uma palavra, nem uma letra — é um pedaço de texto que o modelo aprendeu a tratar como unidade.

Em português, a conta que funciona na prática: cerca de 3 a 4 caracteres por token, em média. "Automação" pode virar dois ou três tokens. Um espaço geralmente gruda na palavra seguinte. Pontuação costuma ser um token à parte.

Não vale a pena decorar a regra exata — os tokenizadores variam entre modelos. Vale internalizar a ordem de grandeza: um parágrafo de cinco linhas gira em torno de 100 a 150 tokens.

A janela de contexto

Tudo que o modelo "vê" ao gerar uma resposta — sua instrução, o histórico da conversa, documentos colados, resultado de ferramentas — entra na janela de contexto. Ela tem um teto, medido em tokens.

Pense nela como a mesa de trabalho do modelo, não como a memória dele. O que está em cima da mesa, ele usa. O que não está, ele não tem — mesmo que pareça razoável imaginar que "deveria saber".

Essa é a diferença que separa contexto de conhecimento: conhecimento é o que ficou impregnado no treino, difuso e desatualizado a partir de uma certa data. Contexto é o que você colocou na mesa agora, específico e atual. Quando você precisa de precisão — política interna, número de contrato, estado atual de um sistema — isso tem que estar na mesa.

Por que isso custa dinheiro

Cobrança de modelos de IA é, quase sempre, por token — de entrada e de saída, com preços diferentes para cada um.

Duas implicações práticas:

O custo domina pela entrada quando você cola muita coisa. Enviar um manual de 80 páginas para tirar uma dúvida específica é caro, e — como você vai ver na próxima seção — não é nem o jeito mais eficaz de conseguir a resposta certa.

Uma conversa de chat cresce sozinha. Cada nova mensagem reenvia o histórico inteiro — é assim que o modelo "lembra" do que vocês conversaram. Uma conversa de quarenta mensagens está pagando, a cada nova pergunta, para reler as trinta e nove anteriores. Fica mais lenta e mais cara a cada rodada.

O efeito que ninguém espera: janela grande não é atenção boa

Modelos recentes anunciam janelas enormes — centenas de milhares de tokens. É tentador achar que, se cabe, pode jogar tudo lá dentro.

Não funciona bem assim. Informação enterrada no meio de uma entrada muito longa tende a receber menos peso do que informação no início ou no fim — um efeito bem documentado em avaliações de modelos de longo contexto. Colar um documento de cem páginas inteiro produz respostas piores do que colar os três parágrafos relevantes, mesmo que os cem coubessem confortavelmente.

Ou seja: caber não é o mesmo que ser bem usado. Selecionar o trecho certo — o que se chama de recuperação de informação — costuma valer mais do que aumentar o tamanho da entrada.

O que fazer com isso, esta semana

  • Não cole documentos inteiros por hábito. Extraia a seção relevante antes de colar. Se a ferramenta permite anexar arquivo em vez de colar texto, geralmente é mais eficiente — mas o princípio de "menos é mais preciso" continua valendo.
  • Em conversas longas, resuma e recomece. Em vez de arrastar quarenta mensagens, escreva um resumo do que importa e comece uma conversa nova com ele. Fica mais barato e mais preciso.
  • Coloque a instrução mais importante por último. A posição final da entrada tende a receber mais peso do modelo — é o lugar certo para a pergunta que você mais precisa que seja respondida com cuidado.
  • Se uma resposta ficou rasa num documento longo, suspeite de posição, não de capacidade. Antes de trocar de modelo, tente reduzir a entrada ao trecho relevante e testar de novo.

Exercício

Pegue uma conversa longa que você já teve com alguma IA — de preferência uma que passou de vinte mensagens.

  1. Volte ao início e resuma, em três frases, o que realmente importava chegar até aqui.
  2. Abra uma conversa nova e cole apenas esse resumo mais a pergunta que você faria em seguida.
  3. Compare a resposta com o que você teria obtido continuando a conversa antiga.

Na maioria dos casos, a resposta da conversa nova sai mais direta — porque a "mesa de trabalho" do modelo está com menos coisa espalhada em cima.

O que fica

  • Token é a unidade de leitura e escrita do modelo — não confunda com palavra.
  • Contexto é a mesa de trabalho, não a memória. Dado exato tem que estar nela.
  • Custo geralmente é por token, de entrada e saída — conversas longas encarecem sozinhas.
  • Janela grande não garante atenção boa: posição no texto importa, e recuperar o trecho certo vale mais que colar tudo.

No próximo módulo: os padrões de erro que se repetem entre ferramentas diferentes, e como reconhecer cada um antes de entregar o trabalho.

iLumera Learn · Fundamentos de IA

Continue pelo catálogo.

Você chegou ao fim dos módulos publicados deste curso. Outros cursos do catálogo já estão abertos também.