Llama é a família de modelos de linguagem da Meta (Facebook), liberada com pesos abertos sob licença permissiva. Foi divisor de águas em 2023, pela primeira vez, modelos com qualidade próxima a comerciais ficaram disponíveis para baixar e rodar localmente.
Em 2026, a linha Llama 4 usa arquitetura MoE. Scout 17Bx16E até 10M e Maverick 17Bx128E até 1M, 05/04/2025. Behemoth pendente. VRAM depende de variante/endpoint. LGPD-friendly não é conformidade automática. Confira a ficha oficial no Hugging Face e a documentação da Meta na data do seu projeto antes de dimensionar VRAM ou contexto.
Por que Llama é importante
- Open weights: você baixa e roda onde quiser, sem depender só de API externa.
- Dados na sua infra: ajuda no desenho de privacidade, mas LGPD-friendly não é conformidade automática.
- Customização total: fine-tunar à vontade.
- Custo de inferência: depois de comprar/alugar GPU, "ilimitado".
- Comunidade enorme: ferramentas, fine-tunes especializados, suporte.
Onde rodar Llama no Brasil
- Local: Mac M3/M4 com bastante RAM, ou PC com RTX 4090.
- Ollama, LM Studio: ferramentas que facilitam rodar local.
- Together AI, Fireworks, Replicate, Groq: hospedam Llama via API a custo baixo.
- AWS Bedrock: Llama disponível como serviço.
- Cloud Brazil: Magalu Cloud, IBM Cloud BR oferecem.
Casos de uso típicos
- Chatbots internos: dados sensíveis nunca saem.
- Pipelines de dados: classificação, extração em volume.
- Fine-tuning para domínio específico: jurídico brasileiro, médico, atendimento.
- Edge AI: rodar em dispositivos.
Limitações vs modelos fechados
- Multimodalidade ainda atrás: GPT, Claude, Gemini têm vantagem em multi.
- Tool use: precisa setup adicional (function calling não é tão polido).
- Janela e VRAM variam: Scout 17Bx16E até 10M e Maverick 17Bx128E até 1M, 05/04/2025; o tamanho efetivo depende de variante, quantização e endpoint.
- Suporte e docs menores que players comerciais.
Concorrentes open source
- Mistral / Mixtral: França, qualidade alta.
- Qwen (Alibaba): forte em multilíngue.
- DeepSeek: chinês, ótima performance/custo.
- Phi-3 / Phi-4 (Microsoft): pequenos e capazes.
- Gemma (Google): variante open de Gemini.
Para o Brasil em 2026, Llama é a escolha óbvia quando você precisa de:
- Soberania de dados (público, governo, jurídico).
- Volume alto sem pagar por token.
- Customização profunda para um domínio.
Quem domina Llama (deploy, fine-tuning, otimização) tem skill valioso e crescente no mercado brasileiro.