Parâmetros são os pesos numéricos de uma rede neural, bilhões de números que codificam tudo que o modelo aprendeu. A OpenAI não divulgou o número de parâmetros do GPT-4. "1,8 trilhão" é estimativa não confirmada. Quando lemos "Llama 3 70B" (70 bilhões), estamos contando esses pesos declarados pelo fornecedor.
O que o número diz, e o que ele não diz
Conceitualmente, cada conexão entre neurônios artificiais tem um peso (parâmetro). Treinar é ajustar esses pesos para minimizar erro. Mais parâmetros costumam trazer mais capacidade para padrões complexos, mas também mais custo computacional. O número sozinho não garante qualidade: dados, treino, alinhamento e endpoint pesam tanto quanto.
Tamanhos típicos em 2026
- Pequenos (< 7B): Phi-3, Gemma 2B, Llama 3.1 8B. Rodam em laptop ou celular.
- Médios (7-70B): Mistral 7B, Llama 3.3 70B, Qwen 72B. Rodam em GPU dedicada.
- Grandes (70B+): GPT-5, Claude Sonnet 4, Gemini Pro. Rodam só em data centers.
- Mixture of Experts (MoE): GPT-4, Mixtral 8x22B. Têm muitos parâmetros no total mas ativam só uma fração por chamada.
Implicações práticas
- Memória: cada parâmetro ocupa 2-4 bytes. Llama 70B em FP16 ocupa cerca de 140GB de RAM/VRAM.
- Velocidade: mais parâmetros significam mais multiplicações e mais lentidão. Modelos pequenos respondem em milissegundos; grandes em segundos.
- Qualidade: em geral, mais parâmetros ajudam, mas com retornos decrescentes.
- Custo: API de modelo grande custa de 10 a 100 vezes mais por token que a de um modelo pequeno.
Como reduzir tamanho sem perder muito
- Quantização: reduzir precisão (FP16 → INT8 → INT4). Llama 70B quantizado para 4 bits cabe em cerca de 35GB.
- Distillation: treinar modelo pequeno para imitar grande.
- Pruning: remover pesos pouco usados.
- Mixture of Experts: ativar só os especialistas relevantes.
Como escolher no Brasil
- Para um chatbot simples de SAC: modelo pequeno quantizado, on-prem, custa centavos por atendimento.
- Para análise jurídica complexa: Claude Sonnet 4 ou GPT-5, via API, com revisão humana.
- Para classificação de tickets: modelo pequeno tipo BERT, fine-tunado, com resposta em milissegundos.
A regra de ouro continua: comece com o menor modelo que resolve seu problema. Modelo grande quase sempre funciona, mas custa caro e demora.