Janela de contexto: o que é e como funciona
Entenda o que é a janela de contexto de um modelo de IA, como ela é preenchida, o que acontece quando estoura e por que maior nem sempre é melhor.

Resumo rápido
- Janela de contexto é a quantidade máxima de texto que um modelo de IA consegue considerar de uma vez, somando instruções, histórico, anexos e a resposta gerada.
- É medida em tokens, e quando o limite estoura, o conteúdo mais antigo costuma sair primeiro da conversa.
- Janela maior custa mais e é mais lenta, além de sofrer o efeito "perdido no meio", em que informação no meio de um contexto longo recebe menos atenção do modelo.
- Selecionar apenas os trechos relevantes de uma base de conhecimento costuma dar resultado melhor do que despejar todo o material disponível na janela.
A janela de contexto é a quantidade máxima de informação que um modelo de IA consegue considerar de uma vez, contando tudo: o que você escreveu, o histórico da conversa, documentos anexados e a resposta que está sendo gerada. Ela é medida em tokens, não em palavras ou em número de mensagens, e funciona como um limite físico de memória de trabalho do modelo.
Este guia é para quem já esbarrou num assistente de IA que "esqueceu" o começo de uma conversa longa e quer entender por que isso acontece, como esse limite funciona por dentro e o que fazer para não perder qualidade quando o assunto exige muito contexto.
O que é a janela de contexto
Pense na janela de contexto como a mesa de trabalho de um modelo de IA: tudo que ele consegue enxergar e usar para formular uma resposta precisa estar em cima dessa mesa ao mesmo tempo. Se um documento, uma instrução ou uma parte da conversa não cabe mais nessa mesa, o modelo simplesmente não tem acesso a ela, mesmo que ela tenha sido dita minutos antes.
Esse limite é definido pela arquitetura do modelo e varia de uma família para outra. O que é comum a todos: quanto mais texto entra na janela, menos espaço sobra para o restante da conversa e para a própria resposta que o modelo vai gerar.
Como a janela de contexto é preenchida
A janela soma, na ordem em que aparecem, várias fontes diferentes de texto:
- Instruções de sistema, que definem o papel e as regras do assistente antes da conversa começar.
- Histórico da conversa, com tudo que foi dito nas mensagens anteriores.
- Documentos e arquivos anexados, quando você envia um PDF, uma planilha ou um trecho de código.
- A resposta em geração, já que o modelo também precisa de espaço para escrever o que está produzindo.
Quando a soma dessas partes ultrapassa o limite da janela, alguma coisa precisa sair. A forma mais comum é o modelo (ou a aplicação que o envolve) descartar as mensagens mais antigas da conversa para abrir espaço para o que é mais recente.
O que acontece quando a janela de contexto estoura
Na prática, isso aparece como um assistente que parece "esquecer" uma instrução dada no início de uma conversa longa, ou que passa a responder de forma inconsistente com o que foi combinado antes. Não é uma falha de raciocínio: é que aquela informação simplesmente não está mais dentro da janela no momento da resposta.
Existem algumas estratégias comuns para lidar com isso: resumir o histórico da conversa periodicamente, comprimindo o que já foi dito em pontos-chave; janelas deslizantes, que mantêm sempre as mensagens mais recentes e descartam as mais antigas; e busca sob demanda, em que só o trecho de um documento relevante para a pergunta atual é trazido para dentro da janela, em vez do documento inteiro.
Janela grande não é sinônimo de resposta melhor
É tentador achar que uma janela de contexto maior resolve tudo, mas dois efeitos colaterais aparecem quando ela cresce demais. O primeiro é custo e velocidade: processar mais tokens exige mais capacidade de cálculo, o que deixa a resposta mais lenta e mais cara. O segundo é um efeito observado em pesquisas conhecido como "perdido no meio": modelos tendem a prestar mais atenção ao que está no início e no fim da janela, e a dar menos peso a informações que ficam soterradas no meio de um contexto muito longo.
Por isso, encher a janela com tudo que existe sobre um assunto costuma dar um resultado pior do que selecionar só os trechos realmente relevantes para a pergunta feita.
Por que isso importa para uma base de conhecimento
É exatamente esse o problema que uma boa base de conhecimento resolve: em vez de jogar toda a documentação da empresa dentro da janela de contexto, ela busca e traz apenas os trechos relevantes para a pergunta atual. Isso vale tanto para um assistente de IA comum quanto para uma skill configurada para seguir um processo específico: o que entra na janela precisa ser selecionado com critério, não despejado por inteiro.
Perguntas frequentes
A janela de contexto é a mesma coisa que a memória de longo prazo de um assistente?
Não. A janela de contexto é o limite de uma única conversa ou tarefa. Memória de longo prazo é um recurso separado, que grava informações fora da janela e as reinjeta quando relevante em conversas futuras.
Todo modelo de IA tem o mesmo tamanho de janela de contexto?
Não. Cada família de modelo define seu próprio limite, e esse limite também pode variar entre versões do mesmo modelo ao longo do tempo.
Enviar um documento inteiro sempre piora a resposta?
Não necessariamente, mas quanto maior e menos filtrado for o material enviado, maior a chance de informação relevante ficar diluída no meio do contexto e receber menos atenção do modelo.
Conclusão
A janela de contexto é o espaço de trabalho de um modelo de IA, e entender seus limites explica por que conversas longas perdem o fio e por que "jogar tudo" para dentro do contexto raramente é a melhor estratégia. O ganho real está em selecionar o que entra nessa janela, não em tentar caber o máximo possível nela.
Leve contexto ao time e aos agentes
Base viva, wiki, chat e artefatos — e o mesmo conhecimento exposto via MCP.