Janela de contexto (context window) é o limite total de tokens que um modelo aceita em uma chamada. É como a "memória de curto prazo" do modelo durante uma interação.
Limites na data da consulta, variam por variante/plano/endpoint. Entrada+saída podem compartilhar janela. Janela maior não garante recuperação, latência ou qualidade. Sempre confira a página oficial do provedor na data do seu projeto.
Limites observados por família em 2026
- GPT-5: Janela anunciada até 400 mil tokens; efetivo varia por variante/produto/endpoint. Separe main/thinking/mini/nano/Pro.
- Gemini 3/3.1 Pro e Flash: Limites por produto/plano: 32k gratuito, 128k Plus, até 1M Pro/Ultra, se confirmado na documentação oficial.
- Claude Sonnet 4 e sucessores: Sonnet 4 é referência legada 22/05/2025 com 200k; sucessão 4.5 29/09/2025, 4.6 17/02/2026, Sonnet 5 30/06/2026 atual com até 1M. Separe 200k legado de até 1M atual.
- Llama 4: Scout 17Bx16E até 10M e Maverick 17Bx128E até 1M, 05/04/2025. Behemoth pendente. VRAM depende de variante/endpoint.
O que muda na prática
Isso é uma revolução prática. Em 2022, GPT-3 tinha 4k de contexto, mal cabia uma conversa decente. Hoje você pode jogar relatórios anuais inteiros, repositórios de código completos, ou anos de e-mails de uma vez.
Atenção antes de estourar a janela
- A janela inclui entrada e saída: se você tem 200k de contexto e mandou 195k, sobram só 5k para a resposta.
- Preço sobe linearmente com input (e às vezes mais para output).
- Performance degrada em janelas muito longas: o famoso "lost in the middle". Modelos atendem melhor ao começo e ao fim.
- Latência cresce: prompts grandes demoram segundos a minutos para serem processados.
Casos de uso práticos para janelas grandes
- Análise de contratos: jogar o contrato inteiro e fazer perguntas.
- Code review: passar arquivos completos do projeto.
- Síntese de pesquisa: colocar 20 papers e pedir resumo crítico.
- Apoio jurídico: jurisprudência completa + caso específico.
- Atendimento de SAC: histórico completo do cliente + nova reclamação.
Para o profissional brasileiro, janelas grandes mudam o jogo: tarefas que antes precisavam de RAG sofisticado agora cabem inteiras no prompt. Para muitas empresas pequenas e médias, vale mais pagar por contexto longo do que montar pipeline de embeddings.
Mas para empresas com bases de conhecimento gigantes (milhões de documentos), RAG continua essencial, você não cabe a Wikipedia inteira em 1 milhão de tokens, e mesmo se coubesse, seria caro a cada chamada.