Pular para o conteúdo

Modelos de Linguagem (LLMs)

Janela de Contexto

Quantidade máxima de tokens que um modelo consegue processar de uma vez (entrada + saída).

Janela de contexto (context window) é o limite total de tokens que um modelo aceita em uma chamada. É como a "memória de curto prazo" do modelo durante uma interação.

Limites na data da consulta, variam por variante/plano/endpoint. Entrada+saída podem compartilhar janela. Janela maior não garante recuperação, latência ou qualidade. Sempre confira a página oficial do provedor na data do seu projeto.

Limites observados por família em 2026

  • GPT-5: Janela anunciada até 400 mil tokens; efetivo varia por variante/produto/endpoint. Separe main/thinking/mini/nano/Pro.
  • Gemini 3/3.1 Pro e Flash: Limites por produto/plano: 32k gratuito, 128k Plus, até 1M Pro/Ultra, se confirmado na documentação oficial.
  • Claude Sonnet 4 e sucessores: Sonnet 4 é referência legada 22/05/2025 com 200k; sucessão 4.5 29/09/2025, 4.6 17/02/2026, Sonnet 5 30/06/2026 atual com até 1M. Separe 200k legado de até 1M atual.
  • Llama 4: Scout 17Bx16E até 10M e Maverick 17Bx128E até 1M, 05/04/2025. Behemoth pendente. VRAM depende de variante/endpoint.

O que muda na prática

Isso é uma revolução prática. Em 2022, GPT-3 tinha 4k de contexto, mal cabia uma conversa decente. Hoje você pode jogar relatórios anuais inteiros, repositórios de código completos, ou anos de e-mails de uma vez.

Atenção antes de estourar a janela

  • A janela inclui entrada e saída: se você tem 200k de contexto e mandou 195k, sobram só 5k para a resposta.
  • Preço sobe linearmente com input (e às vezes mais para output).
  • Performance degrada em janelas muito longas: o famoso "lost in the middle". Modelos atendem melhor ao começo e ao fim.
  • Latência cresce: prompts grandes demoram segundos a minutos para serem processados.

Casos de uso práticos para janelas grandes

  • Análise de contratos: jogar o contrato inteiro e fazer perguntas.
  • Code review: passar arquivos completos do projeto.
  • Síntese de pesquisa: colocar 20 papers e pedir resumo crítico.
  • Apoio jurídico: jurisprudência completa + caso específico.
  • Atendimento de SAC: histórico completo do cliente + nova reclamação.

Para o profissional brasileiro, janelas grandes mudam o jogo: tarefas que antes precisavam de RAG sofisticado agora cabem inteiras no prompt. Para muitas empresas pequenas e médias, vale mais pagar por contexto longo do que montar pipeline de embeddings.

Mas para empresas com bases de conhecimento gigantes (milhões de documentos), RAG continua essencial, você não cabe a Wikipedia inteira em 1 milhão de tokens, e mesmo se coubesse, seria caro a cada chamada.

Termos relacionados

Continue aprendendo por R$49/mês

O glossário explica o termo. A escola mostra como usar Janela de Contexto no seu trabalho, com aulas, prompts e materiais de apoio.

Fazer matrícula, R$49/mês

Checkout seguro via Stripe, cancele quando quiser.

Próximos passos

Aplique Janela de Contexto com uma rota guiada

O glossário explica o conceito. Estas páginas mostram como praticar com cursos, comparar preços e garantir o acesso vitalício.

← Voltar ao glossárioExplorar cursos completos →

Da leitura para a prática

Agora transforme a ideia em algo que funciona.

Escolha uma trilha curta, aplique o método em uma tarefa real e guarde o resultado como parte do seu portfólio.

Help & support