Pular para o conteúdo

Modelos de Linguagem (LLMs)

Perplexidade

Métrica que mede quão 'surpreso' o modelo fica com um texto, menor é melhor previsão.

Perplexidade é a métrica clássica para avaliar modelos de linguagem. Mede o quanto o modelo "se surpreende" com cada token de um texto. Quanto menor a perplexidade, melhor o modelo previu o texto.

Tecnicamente, perplexidade = exp(entropia cruzada média). Em termos práticos: se um modelo tem perplexidade 10 num texto, é como se ele tivesse hesitado entre 10 opções igualmente prováveis a cada token.

Por que importa:

  • Treinamento: minimizar perplexidade no dataset é o objetivo do pré-treinamento.
  • Comparação de modelos: dois modelos no mesmo conjunto de teste, o de menor perplexidade prevê melhor.
  • Detecção de domínio: se um modelo tem perplexidade muito alta num texto, esse domínio é fora da distribuição de treino.
  • Detecção de texto gerado: perplexidade muito baixa pode indicar texto gerado por IA (modelos têm padrões previsíveis).

Faixas ilustrativas (não são fatos sobre um modelo específico):

  • Texto comum bem modelado: 5-30.
  • Domínio difícil ou raro: 100+.
  • Modelo aleatório: próximo ao tamanho do vocabulário (dezenas de milhares).

Limitações importantes:

  • Não captura qualidade humana: um modelo pode ter perplexidade baixa e ainda gerar texto chato, factualmente errado, ou inadequado.
  • Não captura raciocínio: prevê próximo token, não testa lógica.
  • Por isso surgiram outras métricas: BLEU, ROUGE, BERTScore, e benchmarks como MMLU, HumanEval, MT-Bench.

Para o profissional brasileiro, perplexidade não é algo que você usa no dia a dia se está consumindo LLMs via API. Mas aparece em:

  • Papers e blogs técnicos: comparam modelos por perplexidade.
  • Fine-tuning: você monitora perplexidade do modelo em validação para detectar overfitting.
  • Detecção de IA generativa: ferramentas como GPTZero usam variação de perplexidade.

Em 2026, com modelos tão bons, perplexidade se tornou métrica menos relevante para distinguir top performers. O que importa hoje é benchmark em tarefas reais (raciocínio, código, instrução, segurança) e avaliação humana.

Nota: números de perplexidade de modelos específicos (como GPT-3, GPT-5 ou Claude) só valem com fonte primária e data, sem isso, trate como ilustração, não como fato. Não mede qualidade humana nem raciocínio.

Termos relacionados

Continue aprendendo por R$49/mês

O glossário explica o termo. A escola mostra como usar Perplexidade no seu trabalho, com aulas, prompts e materiais de apoio.

Fazer matrícula, R$49/mês

Checkout seguro via Stripe, cancele quando quiser.

Próximos passos

Aplique Perplexidade com uma rota guiada

O glossário explica o conceito. Estas páginas mostram como praticar com cursos, comparar preços e garantir o acesso vitalício.

← Voltar ao glossárioExplorar cursos completos →

Da leitura para a prática

Agora transforme a ideia em algo que funciona.

Escolha uma trilha curta, aplique o método em uma tarefa real e guarde o resultado como parte do seu portfólio.

Help & support