Tokens, Contexto e Memória
Três ideias destravam muitos momentos de "por que ele fez isso?": tokens, a janela de contexto e a memória. Entenda esses conceitos e você vai parar de se surpreender com desvios, esquecimentos e contas inesperadas.
- Ler o texto do jeito que um modelo lê — em tokens, não em palavras ou caracteres
- Imaginar a janela de contexto como uma mesa finita e prever quando as coisas caem dela
- Reconhecer o 'apodrecimento do contexto' — por que os modelos podem perder o meio de uma entrada longa
- Conhecer as quatro fontes reais de 'memória' e como fornecê-la de propósito
Tokens: a unidade em que os modelos pensam
Os modelos não leem caracteres nem palavras — eles leem tokens, pedaços de texto com cerca de ¾ de uma palavra em inglês. "Unbelievable" pode ser 3–4 tokens; palavras comuns são um cada; um espaço, uma vírgula ou um trecho de código também custam tokens. Tanto a sua entrada quanto a saída do modelo são contadas, e os tokens são exatamente o que preços e limites medem.
Você não precisa contar à mão, mas uma noção aproximada ajuda: ~750 palavras ≈ ~1.000 tokens. Digite algo e observe:
Apenas uma noção aproximada (~caracteres ÷ 4, ou palavras × 1.33). A contagem de tokens é específica de cada modelo — nunca use o tokenizador de outro modelo. Para números exatos, use o endpoint de contagem de tokens da Anthropic.
:::tip Por que a proporção muda Inglês simples fica perto de ¾ de palavra por token. Código, JSON, sistemas de escrita não latinos, URLs longas e palavras raras se dividem em mais tokens — então um arquivo de 500 linhas ou um parágrafo em chinês custa mais do que a contagem de palavras sugere. Quando uma conta ou um limite te surpreende, normalmente é por isso. :::
A janela de contexto: a memória de trabalho
A janela de contexto é o número máximo de tokens que o modelo consegue considerar de uma só vez — o seu system prompt, toda a conversa até agora, quaisquer arquivos anexados e a resposta que ele está escrevendo, tudo junto. Pense nela como a mesa do modelo: grande, mas finita. Os tamanhos de janela variam por modelo e continuam crescendo — veja Modelos e Preços para os números atuais, em vez de decorar um só.
Tudo o que o modelo "sabe" no momento vive nessa mesa:
Quando uma conversa cresce além da janela, o conteúdo mais antigo cai fora. É por isso que um chat muito longo pode parecer "esquecer" como começou ou se afastar da sua instrução original.
Apodrecimento do contexto: não é só cheio vs vazio
Um problema mais sutil: mesmo quando tudo ainda cabe, os modelos tendem a usar o começo e o fim de uma entrada longa de forma mais confiável do que o meio. Esconda a única frase que importa no centro de uma colagem de 50 páginas e ela pode ficar subvalorizada — uma falha frequentemente chamada de "perdido no meio."
- Coloque a instrução ou pergunta de verdade primeiro, antes de colar um documento longo — e não escondida depois dele.
- Repita a instrução-chave em uma linha depois do conteúdo longo. As posições inicial + final são as mais fortes.
- Descarte as seções irrelevantes. Menos ruído no meio significa que o sinal que sobra recebe mais atenção.
- Para entradas muito grandes, resuma ou divida em pedaços em vez de despejar tudo — ou comece um chat novo para uma nova subtarefa.
Aqui está o mesmo pedido, estruturado para que a instrução fique nas posições fortes:
Instrução primeiro, reafirmada por último
Tarefa: Encontre todos os pontos em que este contrato limita a nossa responsabilidade e cite a cláusula exata. [... cole o contrato completo de 40 páginas aqui ...] Lembrete da tarefa: liste apenas as cláusulas de limitação de responsabilidade, com citações exatas e números de seção. Ignore todo o resto.
:::tip No Claude Code Sessões longas de agente esbarram no mesmo teto. O Claude Code gerencia isso de propósito — compactando o histórico e deixando você controlar o que permanece à vista. Veja Gerenciamento de Contexto e Engenharia de Contexto. :::
Memória: não existe nenhuma, a menos que você a forneça
Por padrão, cada conversa é uma folha em branco. O modelo não lembra do seu último chat. Tudo o que parece memória é uma de quatro coisas:
| Fonte | O que é | Você controla por |
|---|---|---|
| Histórico reenviado | Os apps de chat reenviam a conversa a cada turno, até a janela encher | Começando chats novos; mantendo as threads focadas |
| Recursos de memória | Algumas superfícies do Claude carregam fatos entre chats | Configurações de Memória Entre Chats |
| Arquivos que você fornece | Contexto persistente que você anexa de propósito | Projects, CLAUDE.md |
| Seu próprio código | A API é stateless — você reenvia as mensagens anteriores | Primeira Chamada de API |
A ideia central: se você quer que o modelo lembre de algo, você tem que continuar colocando isso na mesa.
Por que isso importa
Quase todo problema do tipo "ele ignorou minha instrução anterior" ou "ele se perdeu" remonta a uma de três coisas: a janela encheu, uma nova sessão começou do zero, ou o detalhe-chave ficou no meio morto de uma colagem longa. Sabendo disso, você vai estruturar prompts e sessões para manter o que importa à vista.
Teste-se
Check yourself
0/3Termos-chave
:::note Pontos principais
- Os tokens são a unidade tanto do raciocínio quanto da cobrança — ~1.000 por 750 palavras em inglês, mais para código e outros sistemas de escrita.
- A janela de contexto é uma mesa finita; chats longos esquecem porque o conteúdo antigo cai dela.
- Mesmo dentro da janela, comece pela sua instrução e reafirme-a no final — o meio é subutilizado.
- Não há memória por padrão. Forneça-a de propósito com arquivos, Projects, CLAUDE.md ou reenviando o histórico. :::