O pequeno virou grande
Há dois anos, a pergunta "qual modelo de IA local usar?" tinha resposta simples: quanto maior, melhor. Em 2026, a pergunta mudou de lugar. Modelos de 27B superam modelos de 70B da geração anterior em raciocínio e código; modelos de 30B com arquitetura MoE entregam velocidade de inferência equivalente a modelos muito menores; e a escolha correta depende menos do "melhor do mundo" e mais do que você precisa fazer, com qual hardware e em que contexto.
Este guia classifica os modelos abertos (pesos públicos, sem custo de API) na faixa de 8B a 70B — a faixa que roda em hardware de consumidor — e mostra, por classe, o que cada modelo faz de melhor, quanto VRAM ele exige e em que situações ele ganha.
Panorama por faixa
Classe 8–14B — o dia a dia A faixa mais acessível: cabe em qualquer GPU com 12+ GB de VRAM, roda a 30–50 tokens/segundo em hardware de entrada, e atende conversas, resumos e tarefas simples de classificação.
- Llama 3 8B Instruct (Meta, abr/2024) — o padrão da categoria; composto 69.2 no ranking Convly.
- Phi-4 14B (Microsoft, dez/2024) — o destaque: composto 77.8, supera sua categoria em raciocínio matemático e lógico; o melhor custo-benefício da faixa.
Classe 27–32B — o ponto de inflexão de 2026 A faixa que mais mudou em 2026. Modelos de 27B agora disputam com 70B da geração anterior em raciocínio, código e tarefas agênticas.
- Qwen3.8-27B (Alibaba, ago/2026) — o novo referência: nativo multimodal (imagem + vídeo), contexto 262K (estendível a 1M), MTP (Multi-Token Prediction), SWE-bench Pro 61.7 (supera Qwen3.7-Plus), GPQA Diamond 89.2, LiveCodeBench 90.3.
- Qwen3.5-27B (Alibaba, fev/2026) — a geração anterior: MMLU-Pro 86.1, GPQA Diamond 85.5, SWE-bench Verified 72.4; ainda forte em raciocínio e agêntico.
- Gemma 3 27B (Google, mar/2025) — o contraponto: multimodal (imagem), 140+ idiomas, otimizado para TPU/Google Cloud; perde para Qwen em benchmarks de raciocínio, mas ganha em ecossistema Google.
- Qwen 2.5 32B Instruct (Alibaba, set/2024) — ainda o "coringa" da faixa: composto 79.4, executa em GPU de 24 GB com quantização Q5; referência para coding assistido em hardware modesto.
- DeepSeek R1 Distill Qwen 32B — distilação do R1 em 32B; forte em raciocínio passo a passo.
Classe 70B — o teto do hardware de consumidor A faixa que exige GPU de 32 GB (RTX 5090) ou Mac M4 Max com 128 GB, e que ainda entrega a melhor qualidade "aberta" em muitas tarefas.
- Qwen 2.5 72B Instruct (Alibaba, set/2024) — o "melhor 70B" do ranking Convly: composto 83.7, supera Llama 3 70B na maioria dos benchmarks; melhor em contexto longo e multilíngue.
- Llama 3 70B Instruct (Meta, abr/2024) — composto 82.5; o padrão Meta da faixa.
- Mistral Medium 3.5 128B (Mistral, 2026) — fora da faixa 70B, mas relevante como próximo degrau; composto acima de 84.
Tabela-resumo (VRAM em Q4_K_M, contexto 8K)
| Classe | Modelo de referência | Parâmetros | VRAM (Q4_K_M) | Hardware mínimo | Melhor para |
|---|---|---|---|---|---|
| 8–14B | Llama 3 8B / Phi-4 14B | 8–14B | 5–8,5 GB | RTX 3060 12 GB | Conversa diária, tarefas simples |
| 27–32B | Qwen3.8-27B / Qwen 2.5 32B | 27–32B | 17–20 GB | RTX 4090 24 GB | Coding, raciocínio, agêntico |
| 70B | Qwen 2.5 72B / Llama 3 70B | 70–72B | 42–44 GB | RTX 5090 32 GB ou M4 Max 128 GB | Contexto longo, multilíngue, qualidade |
MoE vs denso: o tradeoff que muda a resposta
Modelos densos ativam todos os parâmetros por token; MoE (Mixture of Experts) ativam uma fração. Na prática:
- Densos (Qwen 27B/72B, Llama 70B): mais previsíveis em latência, exigem VRAM proporcional ao tamanho.
- MoE (DeepSeek V3 236B/21B ativos, Qwen3-Omni-30B-A3B, Nemotron 3.5 30B A3B): qualidade de modelo grande com velocidade de modelo pequeno, mas exigem mais memória total. O descarregamento de especialistas (llama.cpp
--n-cpu-moe) permite rodar MoE grande em GPU de 24 GB + RAM, com latência maior.
A escolha depende do caso: para produção multiusuário, denso em GPU dedicada; para uso individual com hardware modesto, MoE com descarregamento.
Quantização: quando vale o extra
- Q4_K_M — a recomendada: melhor equilíbrio entre tamanho e qualidade.
- Q5_K_M — ~1,17× a memória da Q4, ganho de 0,5–1% em qualidade. Vale a pena se houver margem.
- Q8_0 — qualidade indistinguível da FP16, ~1,6× a memória. Para quem quer o máximo.
- Q3_K_M / IQ2_XXS — queda de 4–25% na qualidade; apenas para emergência.
O runtime importa
O mesmo modelo, no mesmo hardware, entrega throughput muito diferente conforme o runtime:
- vLLM / SGLang — para concorrência e API multiusuário; mantêm a GPU saturada.
- llama.cpp / Ollama / LM Studio — para uso individual; flexibilidade, quantizações GGUF, descarregamento para RAM.
- MLX / Ollama (Apple Silicon) — exploram a memória unificada do Mac; o descarregamento é automático.
Recomendações por caso de uso
- Conversa diária / resumos → Llama 3 8B ou Phi-4 14B; qualquer GPU 12+ GB.
- Assistente de programação → Qwen3.8-27B ou Qwen 2.5 32B; RTX 4090 24 GB.
- Documentos longos (32K+ contexto) → Qwen 2.5 72B; RTX 5090 ou M4 Max.
- Multilíngue / tradução → Qwen 2.5 72B ou Gemma 3 27B.
- Matemática e raciocínio → Phi-4 14B (faixa 14B) ou Qwen3.8-27B (faixa 27B).
- Produção multiusuário → MoE (DeepSeek V3, Qwen3-Omni-30B) com vLLM/SGLang.
Como ler os rankings (e as limitações)
- Não existe "melhor" absoluto: cada benchmark (MMLU, SWE-bench, GPQA, LiveCodeBench) mede algo diferente; um modelo pode liderar em um e perder em outro.
- Datas de atualização importam: este guia usa fontes entre ago/2026 e set/2026. Modelos recentes (Qwen3.8-27B, ago/2026) ainda não aparecem em todos os rankings; alguns comparativos (Convly, atualizado 31/08/2026) ainda referenciam Qwen 2.5 72B como "melhor 70B".
- VRAM varia por quantização: a tabela usa Q4_K_M; em FP16 a memória dobra; em Q3_K_M cai, com perda de qualidade.
- Preços de hardware são referência: variam por região, disponibilidade e canal.
- Modelos fechados ainda lideram em raciocínio de ponta: GPT-5 e Claude Opus 4.7 permanecem à frente nas tarefas mais difíceis; a vantagem dos abertos é privacidade, custo e customização.
Contexto
A maturação dos modelos abertos em 2026 não é linear: é um salto de arquitetura (DeltaNet, MTP, MoE de nova geração) que permitiu a uma geração de 27B alcançar o que exigia 70B um ano antes. O resultado prático: a fronteira do "que roda no meu PC" subiu de 8B para 27–32B, e a fronteira do "que roda num setup de alto desempenho" subiu de 70B para 100B+. Para quem escolhe hoje, a pergunta correta não é "qual é o melhor?" — é "qual é o melhor para o que eu preciso, com o que eu tenho?"
Encontrou uma informação que precisa de correção? Fale com a redação.
