A tese: "pequeno" deixou de ser uma categoria útil

Em 2024, a pergunta "qual modelo local usar?" tinha uma resposta linear: quanto maior, melhor. Um 8B era o teto do acessível; um 70B era o luxo. Em 2026, essa escala linear colapsou. Modelos de 27B superam 70B da geração anterior em raciocínio e código. Modelos de 30B com 3B ativos (MoE) entregam qualidade de modelo grande com a latência de modelo pequeno. E a arquitetura que viabiliza isso — MoE, DeltaNet, MTP — mudou o que significa "cabe no meu PC".

Este artigo é uma análise/tendência: o que mudou na arquitetura dos modelos abertos em 2026, por que o MoE virou o padrão, e o que isso significa para quem monta um setup local.

O que mudou: três saltos de arquitetura

1. Gated DeltaNet + Qwen Sparse Attention (QSA) A atenção padrão (quadrática) é o gargalo de contexto longo. O Qwen3.8-Flash-Next (ago/2026) substitui a atenção densa por um híbrido: camadas de Gated DeltaNet (compressão linear do prefixo em estado fixo) + QSA (atenção esparsa em nível de micro-bloco). O resultado: contexto nativo de 262K (estendível a 1M) com latência drasticamente reduzida. O DeepSeek-V4 (abr/2026) faz o mesmo com Compressed Sparse Attention (CSA) + Heavily Compressed Attention (HCA) — 1M de contexto com apenas 27% dos FLOPs por token do V3.2.

2. Multi-Token Prediction (MTP) O MTP não é um truque de inferência — é um componente de arquitetura treinado junto com o modelo. O Qwen3.8-Flash-Next, o Nemotron 3.5 Lightning e o DeepSeek-V4 todos incluem camadas MTP que fazem decodificação especulativa nativa: o modelo prevê múltiplos tokens futuros, e o runtime valida em paralelo. O ganho: 2–4× de velocidade em decode sem perda de qualidade.

3. MoE de nova geração O Mixture-of-Experts deixou de ser um "truque de escala" para virar a arquitetura padrão. Mas a geração 2026 é diferente:

  • Qwen3.8-Flash-Next (125B total / 6B ativos + 51B de embedding n-gram + 4B MTP): 512 especialistas, 10 roteados + 1 compartilhado por camada. O embedding n-gram é a inovação-chave: uma via de escala de parâmetros que exige menos compute e é mais amigável a offloading que o MoE clássico.
  • DeepSeek-V4-Flash (284B total / 13B ativos): FP4 nos especialistas + FP8 no resto, 1M de contexto, contexto de agentic.
  • Nemotron 3.5 Lightning (30B total / 3B ativos): híbrido Mamba-2 + MoE + Attention, 128 especialistas roteados + 1 compartilhado por camada, 6 ativados por token. 1M de contexto. Decodificação especulativa nativa via MTP.

MoE vs denso em 2026: o tradeoff real

Modelo Total Ativos Contexto VRAM (Q4) Latência
Qwen3.8-27B (denso) 27B 27B 262K ~16 GB Média
Nemotron 3.5 Lightning 30B 3B 1M ~18 GB Muito rápida
DeepSeek-V4-Flash 284B 13B 1M ~170 GB Rápida (em GPU de data center)
Qwen3.8-Flash-Next 125B 6B 262K→1M ~80 GB Rápida

A leitura prática:

  • Para uso individual (1–4 GPUs de 24 GB): o MoE com descarregamento de especialistas (llama.cpp --n-cpu-moe) permite rodar 284B/13B ativos em ~170 GB de RAM+VRAM combinada. Latência maior que um 27B denso, mas qualidade de 70B+.
  • Para produção multiusuário (8× RTX 5090): o MoE é a escolha óbvia — saturação de GPU + baixa latência por token.
  • Para mobile/embedded: o MobileMoE (mai/2026) mostra que MoE com 0.3–0.9B ativos e 1.3–5.3B total é viável em smartphones, com 2–4× menos FLOPs que modelos densos equivalentes.

O que isso significa para hardware de consumidor

A fronteira do "que roda no meu PC" subiu de 8B para 27–32B em 2026. As implicações:

GPU de 12 GB (RTX 3060/4060) — 8–14B densos com folga; 27B denso em Q3 (perda de qualidade). O MoE com descarregamento para RAM (27–30B/3–6B ativos) é a opção viável.

GPU de 24 GB (RTX 4090/5090) — 27–32B densos em Q4/Q5 com folga; 70B denso NÃO cabe (precisa ~40 GB). MoE com 10–15B ativos + descarregamento é o sweet spot.

GPU de 32 GB (RTX 5090 32GB) — 70B denso em Q4 com contexto curto; MoE com 20–30B ativos sem descarregamento.

Mac M4/M5 Max (128 GB unificado) — 70B denso em Q4 com ~12–15 tok/s; MoE com 50B+ ativos é viável. A memória unificada é a vantagem: não há "descarregamento", tudo é compartilhado.

CPU-only (16–64 GB RAM) — 3–8B densos; MoE com 3B ativos (Nemotron 3.5) é viável em 32 GB RAM com ~10–20 tok/s.

Preços (set/2026): a escassez de GDDR7 empurrou a RTX 5090 para US$ 4.300–5.000+. A RX 9070 XT (16 GB GDDR6, ~US$ 690–740) é a opção custo-benefício.

O que vem em 2026–2027

  • MoE com 1M de contexto — já é realidade (Qwen3.8, DeepSeek-V4, Nemotron 3.5); em 2027, será o padrão.
  • Multimodal nativo — Qwen3.8-27B já é multimodal (imagem + vídeo) em 27B; em 2027, será o padrão até 30B.
  • MTP em todos os modelos — a decodificação especulativa nativa vai do topo de linha até modelos de 7B.
  • MoE em mobile — o MobileMoE (2026) é o primeiro passo; em 2027, smartphones rodarão MoE com qualidade de 30B em 2025.
  • FP4 em produção — o DeepSeek-V4 usa FP4 nos especialistas; em 2027, será o padrão para inferência em data center.

Limitações

  • Rankings variam por benchmark e quantização — não existe "melhor" absoluto.
  • Defasagem de dados — modelos de ago/2026 (Qwen3.8) ainda não aparecem em todos os rankings; alguns comparativos ainda referenciam Qwen 2.5 72B como "melhor 70B".
  • Preços de hardware são referência — variam por região, disponibilidade e canal.
  • VRAM varia por quantização — a tabela usa Q4_K_M; em FP16 a memória dobra.
  • Modelos fechados ainda lideram em raciocínio de ponta — GPT-5 e Claude Opus 4.7 permanecem à frente nas tarefas mais difíceis; a vantagem dos abertos é privacidade, custo e customização.

Contexto

A maturação dos modelos abertos em 2026 não é linear: é um salto de arquitetura (DeltaNet, MTP, MoE de nova geração) que permitiu a uma geração de 27B alcançar o que exigia 70B um ano antes. O resultado prático: a fronteira do "que roda no meu PC" subiu de 8B para 27–32B, e a fronteira do "que roda num setup de alto desempenho" subiu de 70B para 100B+. Para quem escolhe hoje, a pergunta correta não é "qual é o melhor?" — é "qual é o melhor para o que eu preciso, com o que eu tenho?"

Fontes e referências

Eric
Eric

Editor responsável pela Gbyte News.

Mais deste colunista ↗

Encontrou uma informação que precisa de correção? Fale com a redação.