A tese: "pequeno" deixou de ser uma categoria útil
Em 2024, a pergunta "qual modelo local usar?" tinha uma resposta linear: quanto maior, melhor. Um 8B era o teto do acessível; um 70B era o luxo. Em 2026, essa escala linear colapsou. Modelos de 27B superam 70B da geração anterior em raciocínio e código. Modelos de 30B com 3B ativos (MoE) entregam qualidade de modelo grande com a latência de modelo pequeno. E a arquitetura que viabiliza isso — MoE, DeltaNet, MTP — mudou o que significa "cabe no meu PC".
Este artigo é uma análise/tendência: o que mudou na arquitetura dos modelos abertos em 2026, por que o MoE virou o padrão, e o que isso significa para quem monta um setup local.
O que mudou: três saltos de arquitetura
1. Gated DeltaNet + Qwen Sparse Attention (QSA) A atenção padrão (quadrática) é o gargalo de contexto longo. O Qwen3.8-Flash-Next (ago/2026) substitui a atenção densa por um híbrido: camadas de Gated DeltaNet (compressão linear do prefixo em estado fixo) + QSA (atenção esparsa em nível de micro-bloco). O resultado: contexto nativo de 262K (estendível a 1M) com latência drasticamente reduzida. O DeepSeek-V4 (abr/2026) faz o mesmo com Compressed Sparse Attention (CSA) + Heavily Compressed Attention (HCA) — 1M de contexto com apenas 27% dos FLOPs por token do V3.2.
2. Multi-Token Prediction (MTP) O MTP não é um truque de inferência — é um componente de arquitetura treinado junto com o modelo. O Qwen3.8-Flash-Next, o Nemotron 3.5 Lightning e o DeepSeek-V4 todos incluem camadas MTP que fazem decodificação especulativa nativa: o modelo prevê múltiplos tokens futuros, e o runtime valida em paralelo. O ganho: 2–4× de velocidade em decode sem perda de qualidade.
3. MoE de nova geração O Mixture-of-Experts deixou de ser um "truque de escala" para virar a arquitetura padrão. Mas a geração 2026 é diferente:
- Qwen3.8-Flash-Next (125B total / 6B ativos + 51B de embedding n-gram + 4B MTP): 512 especialistas, 10 roteados + 1 compartilhado por camada. O embedding n-gram é a inovação-chave: uma via de escala de parâmetros que exige menos compute e é mais amigável a offloading que o MoE clássico.
- DeepSeek-V4-Flash (284B total / 13B ativos): FP4 nos especialistas + FP8 no resto, 1M de contexto, contexto de agentic.
- Nemotron 3.5 Lightning (30B total / 3B ativos): híbrido Mamba-2 + MoE + Attention, 128 especialistas roteados + 1 compartilhado por camada, 6 ativados por token. 1M de contexto. Decodificação especulativa nativa via MTP.
MoE vs denso em 2026: o tradeoff real
| Modelo | Total | Ativos | Contexto | VRAM (Q4) | Latência |
|---|---|---|---|---|---|
| Qwen3.8-27B (denso) | 27B | 27B | 262K | ~16 GB | Média |
| Nemotron 3.5 Lightning | 30B | 3B | 1M | ~18 GB | Muito rápida |
| DeepSeek-V4-Flash | 284B | 13B | 1M | ~170 GB | Rápida (em GPU de data center) |
| Qwen3.8-Flash-Next | 125B | 6B | 262K→1M | ~80 GB | Rápida |
A leitura prática:
- Para uso individual (1–4 GPUs de 24 GB): o MoE com descarregamento de especialistas (llama.cpp
--n-cpu-moe) permite rodar 284B/13B ativos em ~170 GB de RAM+VRAM combinada. Latência maior que um 27B denso, mas qualidade de 70B+. - Para produção multiusuário (8× RTX 5090): o MoE é a escolha óbvia — saturação de GPU + baixa latência por token.
- Para mobile/embedded: o MobileMoE (mai/2026) mostra que MoE com 0.3–0.9B ativos e 1.3–5.3B total é viável em smartphones, com 2–4× menos FLOPs que modelos densos equivalentes.
O que isso significa para hardware de consumidor
A fronteira do "que roda no meu PC" subiu de 8B para 27–32B em 2026. As implicações:
GPU de 12 GB (RTX 3060/4060) — 8–14B densos com folga; 27B denso em Q3 (perda de qualidade). O MoE com descarregamento para RAM (27–30B/3–6B ativos) é a opção viável.
GPU de 24 GB (RTX 4090/5090) — 27–32B densos em Q4/Q5 com folga; 70B denso NÃO cabe (precisa ~40 GB). MoE com 10–15B ativos + descarregamento é o sweet spot.
GPU de 32 GB (RTX 5090 32GB) — 70B denso em Q4 com contexto curto; MoE com 20–30B ativos sem descarregamento.
Mac M4/M5 Max (128 GB unificado) — 70B denso em Q4 com ~12–15 tok/s; MoE com 50B+ ativos é viável. A memória unificada é a vantagem: não há "descarregamento", tudo é compartilhado.
CPU-only (16–64 GB RAM) — 3–8B densos; MoE com 3B ativos (Nemotron 3.5) é viável em 32 GB RAM com ~10–20 tok/s.
Preços (set/2026): a escassez de GDDR7 empurrou a RTX 5090 para US$ 4.300–5.000+. A RX 9070 XT (16 GB GDDR6, ~US$ 690–740) é a opção custo-benefício.
O que vem em 2026–2027
- MoE com 1M de contexto — já é realidade (Qwen3.8, DeepSeek-V4, Nemotron 3.5); em 2027, será o padrão.
- Multimodal nativo — Qwen3.8-27B já é multimodal (imagem + vídeo) em 27B; em 2027, será o padrão até 30B.
- MTP em todos os modelos — a decodificação especulativa nativa vai do topo de linha até modelos de 7B.
- MoE em mobile — o MobileMoE (2026) é o primeiro passo; em 2027, smartphones rodarão MoE com qualidade de 30B em 2025.
- FP4 em produção — o DeepSeek-V4 usa FP4 nos especialistas; em 2027, será o padrão para inferência em data center.
Limitações
- Rankings variam por benchmark e quantização — não existe "melhor" absoluto.
- Defasagem de dados — modelos de ago/2026 (Qwen3.8) ainda não aparecem em todos os rankings; alguns comparativos ainda referenciam Qwen 2.5 72B como "melhor 70B".
- Preços de hardware são referência — variam por região, disponibilidade e canal.
- VRAM varia por quantização — a tabela usa Q4_K_M; em FP16 a memória dobra.
- Modelos fechados ainda lideram em raciocínio de ponta — GPT-5 e Claude Opus 4.7 permanecem à frente nas tarefas mais difíceis; a vantagem dos abertos é privacidade, custo e customização.
Contexto
A maturação dos modelos abertos em 2026 não é linear: é um salto de arquitetura (DeltaNet, MTP, MoE de nova geração) que permitiu a uma geração de 27B alcançar o que exigia 70B um ano antes. O resultado prático: a fronteira do "que roda no meu PC" subiu de 8B para 27–32B, e a fronteira do "que roda num setup de alto desempenho" subiu de 70B para 100B+. Para quem escolhe hoje, a pergunta correta não é "qual é o melhor?" — é "qual é o melhor para o que eu preciso, com o que eu tenho?"
Fontes e referências
- Hugging Face — Qwen3.8-Flash-Next (Model Card) ↗
- arXiv — On the Design of Qwen3.8-Next Architecture ↗
- Hugging Face — DeepSeek-V4-Pro (README) ↗
- Hugging Face Blog — DeepSeek-V4: a million-token context that agents can actually use ↗
- NVIDIA NIM — Nemotron 3.5 Lightning 30B-A3B (Model Card) ↗
- arXiv — MobileMoE: Scaling On-Device Mixture of Experts ↗
- PromptQuorum — Local LLM Hardware Guide 2026 ↗
- GitHub — Nemotron 3.5 Lightning Pretrain Docs ↗
Encontrou uma informação que precisa de correção? Fale com a redação.
