Pular para o conteúdo principal

Tokens, Contexto e Memória

Iniciante

Três ideias destravam muitos momentos de "por que ele fez isso?": tokens, a janela de contexto e a memória. Entenda esses conceitos e você vai parar de se surpreender com desvios, esquecimentos e contas inesperadas.

What you'll learn
  • Ler o texto do jeito que um modelo lê — em tokens, não em palavras ou caracteres
  • Imaginar a janela de contexto como uma mesa finita e prever quando as coisas caem dela
  • Reconhecer o 'apodrecimento do contexto' — por que os modelos podem perder o meio de uma entrada longa
  • Conhecer as quatro fontes reais de 'memória' e como fornecê-la de propósito

Tokens: a unidade em que os modelos pensam

Os modelos não leem caracteres nem palavras — eles leem tokens, pedaços de texto com cerca de ¾ de uma palavra em inglês. "Unbelievable" pode ser 3–4 tokens; palavras comuns são um cada; um espaço, uma vírgula ou um trecho de código também custam tokens. Tanto a sua entrada quanto a saída do modelo são contadas, e os tokens são exatamente o que preços e limites medem.

Você não precisa contar à mão, mas uma noção aproximada ajuda: ~750 palavras ≈ ~1.000 tokens. Digite algo e observe:

11palavras
67caracteres
~1517tokens estimados

Apenas uma noção aproximada (~caracteres ÷ 4, ou palavras × 1.33). A contagem de tokens é específica de cada modelo — nunca use o tokenizador de outro modelo. Para números exatos, use o endpoint de contagem de tokens da Anthropic.

:::tip Por que a proporção muda Inglês simples fica perto de ¾ de palavra por token. Código, JSON, sistemas de escrita não latinos, URLs longas e palavras raras se dividem em mais tokens — então um arquivo de 500 linhas ou um parágrafo em chinês custa mais do que a contagem de palavras sugere. Quando uma conta ou um limite te surpreende, normalmente é por isso. :::

A janela de contexto: a memória de trabalho

A janela de contexto é o número máximo de tokens que o modelo consegue considerar de uma só vez — o seu system prompt, toda a conversa até agora, quaisquer arquivos anexados e a resposta que ele está escrevendo, tudo junto. Pense nela como a mesa do modelo: grande, mas finita. Os tamanhos de janela variam por modelo e continuam crescendo — veja Modelos e Preços para os números atuais, em vez de decorar um só.

Tudo o que o modelo "sabe" no momento vive nessa mesa:

Quando uma conversa cresce além da janela, o conteúdo mais antigo cai fora. É por isso que um chat muito longo pode parecer "esquecer" como começou ou se afastar da sua instrução original.

Apodrecimento do contexto: não é só cheio vs vazio

Um problema mais sutil: mesmo quando tudo ainda cabe, os modelos tendem a usar o começo e o fim de uma entrada longa de forma mais confiável do que o meio. Esconda a única frase que importa no centro de uma colagem de 50 páginas e ela pode ficar subvalorizada — uma falha frequentemente chamada de "perdido no meio."

Guided walkthrough1 of 4
  1. Coloque a instrução ou pergunta de verdade primeiro, antes de colar um documento longo — e não escondida depois dele.

Aqui está o mesmo pedido, estruturado para que a instrução fique nas posições fortes:

Instrução primeiro, reafirmada por último

Tarefa: Encontre todos os pontos em que este contrato limita a nossa responsabilidade e cite a cláusula exata.

[... cole o contrato completo de 40 páginas aqui ...]

Lembrete da tarefa: liste apenas as cláusulas de limitação de responsabilidade, com citações exatas e números de seção. Ignore todo o resto.

:::tip No Claude Code Sessões longas de agente esbarram no mesmo teto. O Claude Code gerencia isso de propósito — compactando o histórico e deixando você controlar o que permanece à vista. Veja Gerenciamento de Contexto e Engenharia de Contexto. :::

Memória: não existe nenhuma, a menos que você a forneça

Por padrão, cada conversa é uma folha em branco. O modelo não lembra do seu último chat. Tudo o que parece memória é uma de quatro coisas:

FonteO que éVocê controla por
Histórico reenviadoOs apps de chat reenviam a conversa a cada turno, até a janela encherComeçando chats novos; mantendo as threads focadas
Recursos de memóriaAlgumas superfícies do Claude carregam fatos entre chatsConfigurações de Memória Entre Chats
Arquivos que você forneceContexto persistente que você anexa de propósitoProjects, CLAUDE.md
Seu próprio códigoA API é stateless — você reenvia as mensagens anterioresPrimeira Chamada de API

A ideia central: se você quer que o modelo lembre de algo, você tem que continuar colocando isso na mesa.

Por que isso importa

Quase todo problema do tipo "ele ignorou minha instrução anterior" ou "ele se perdeu" remonta a uma de três coisas: a janela encheu, uma nova sessão começou do zero, ou o detalhe-chave ficou no meio morto de uma colagem longa. Sabendo disso, você vai estruturar prompts e sessões para manter o que importa à vista.

Teste-se

Check yourself

0/3
  1. Aproximadamente quantos tokens são 750 palavras de inglês simples?
  2. Um chat longo começa a 'esquecer' como começou. A causa mais provável é:
  3. Você precisa colar um documento enorme mais uma instrução-chave. Melhor posicionamento?

Termos-chave

Fixe o vocabulário
Pressione Enter ou Espaço para virar o cartão. Use as setas esquerda e direita para navegar entre os cartões.Termo exibido.
1 / 4

:::note Pontos principais

  • Os tokens são a unidade tanto do raciocínio quanto da cobrança — ~1.000 por 750 palavras em inglês, mais para código e outros sistemas de escrita.
  • A janela de contexto é uma mesa finita; chats longos esquecem porque o conteúdo antigo cai dela.
  • Mesmo dentro da janela, comece pela sua instrução e reafirme-a no final — o meio é subutilizado.
  • Não há memória por padrão. Forneça-a de propósito com arquivos, Projects, CLAUDE.md ou reenviando o histórico. :::

Próximo