A Conway Research, por trás do assistente local Underdog, publicou Saluki 27B sob licença Apache 2.0: um quantizado 2-bit (misto) do Qwen3.8-27B que ocupa 7.89 GB em formato GGUF — contra 54 GB da versão BF16 completa. O ponto central do lançamento: o modelo comprimido vence o original em tool calling (88 a 84 no Underdog Bench) e nas chamadas paralelas de ferramentas (42 vs 35).

O que é

  • Base: Qwen3.8-27B (27B denso, 64 camadas, Gated DeltaNet + gated attention, 262,144 tokens nativos)
  • Pipeline de compressão em 3 camadas: base → GSQ-RCO (ISTA-DASLab) → passe final da Underdog (arquivo IQ2-mix com imatrix)
  • Roda em: llama.cpp padrão, Ollama, LM Studio, com offload total para GPU
  • Visão opcional: add-on de 629 MB ou 928 MB
  • Licença: Apache 2.0

Desempenho

No mesmo harness (BFCL v4, 120 tarefas congeladas):

Métrica Saluki 27B Qwen3.8-27B (full) Bonsai 2 (PrismML)
Underdog Bench 88 84 70
Parallel tool calls 42 35 —
SWE-bench Verified (50 issues) 30 corrigidos 33 corrigidos —

Comparação com pontuações públicas do modelo completo:

Benchmark Saluki 27B Qwen3.8-27B (público)
IFEval 93.5 91.5
IFBench 72.7 71.0
MBPP+ 78.0 83.9
MuSR 67.5 79.6
AIME 2025 (avg@4) 79.2 96.7
AIME 2026 (avg@4) 80.0 94.6

A retenção média declarada é de 96% em 9 benchmarks. O ponto mais fraco é matemática de competição (AIME cai de 96.7 para 79.2, retenção ~82%) e raciocínio multi-etapa (MuSR 67.5 vs 79.6).

Por que importa

  • Agentes locais em hardware modesto: um modelo de classe 27B com tool calling forte rodando em menos de 8 GB abre espaço para laptops e minis com 16–32 GB de RAM.
  • Compatibilidade real: ao contrário do Bonsai 2 (5.95 GB, 1.75 b/w, 98.2% de retenção em 14 benchmarks), que exige o fork da llama.cpp da PrismML, o Saluki roda no llama.cpp padrão.
  • Trade-off honesto: matemática e raciocínio longo pagam a conta da compressão; tool calling e instrução seguem fortes.

Contexto

A Underdog posiciona o Saluki como o "underdog" da categoria: não é o menor arquivo (Bonsai 2 é menor) nem o mais fiel (Bonsai 2 reporta maior retenção), mas é o que funciona em runtime padrão e supera o modelo completo em agent tools.

O modelo está disponível em Hugging Face e na página de lançamento da Underdog.

Fontes e referências

Eric
Eric

Editor responsável pela Gbyte News.

Mais deste colunista ↗

Encontrou uma informação que precisa de correção? Fale com a redação.