A Conway Research, por trás do assistente local Underdog, publicou Saluki 27B sob licença Apache 2.0: um quantizado 2-bit (misto) do Qwen3.8-27B que ocupa 7.89 GB em formato GGUF — contra 54 GB da versão BF16 completa. O ponto central do lançamento: o modelo comprimido vence o original em tool calling (88 a 84 no Underdog Bench) e nas chamadas paralelas de ferramentas (42 vs 35).
O que é
- Base: Qwen3.8-27B (27B denso, 64 camadas, Gated DeltaNet + gated attention, 262,144 tokens nativos)
- Pipeline de compressão em 3 camadas: base → GSQ-RCO (ISTA-DASLab) → passe final da Underdog (arquivo
IQ2-mixcom imatrix) - Roda em: llama.cpp padrão, Ollama, LM Studio, com offload total para GPU
- Visão opcional: add-on de 629 MB ou 928 MB
- Licença: Apache 2.0
Desempenho
No mesmo harness (BFCL v4, 120 tarefas congeladas):
| Métrica | Saluki 27B | Qwen3.8-27B (full) | Bonsai 2 (PrismML) |
|---|---|---|---|
| Underdog Bench | 88 | 84 | 70 |
| Parallel tool calls | 42 | 35 | — |
| SWE-bench Verified (50 issues) | 30 corrigidos | 33 corrigidos | — |
Comparação com pontuações públicas do modelo completo:
| Benchmark | Saluki 27B | Qwen3.8-27B (público) |
|---|---|---|
| IFEval | 93.5 | 91.5 |
| IFBench | 72.7 | 71.0 |
| MBPP+ | 78.0 | 83.9 |
| MuSR | 67.5 | 79.6 |
| AIME 2025 (avg@4) | 79.2 | 96.7 |
| AIME 2026 (avg@4) | 80.0 | 94.6 |
A retenção média declarada é de 96% em 9 benchmarks. O ponto mais fraco é matemática de competição (AIME cai de 96.7 para 79.2, retenção ~82%) e raciocínio multi-etapa (MuSR 67.5 vs 79.6).
Por que importa
- Agentes locais em hardware modesto: um modelo de classe 27B com tool calling forte rodando em menos de 8 GB abre espaço para laptops e minis com 16–32 GB de RAM.
- Compatibilidade real: ao contrário do Bonsai 2 (5.95 GB, 1.75 b/w, 98.2% de retenção em 14 benchmarks), que exige o fork da llama.cpp da PrismML, o Saluki roda no llama.cpp padrão.
- Trade-off honesto: matemática e raciocínio longo pagam a conta da compressão; tool calling e instrução seguem fortes.
Contexto
A Underdog posiciona o Saluki como o "underdog" da categoria: não é o menor arquivo (Bonsai 2 é menor) nem o mais fiel (Bonsai 2 reporta maior retenção), mas é o que funciona em runtime padrão e supera o modelo completo em agent tools.
O modelo está disponível em Hugging Face e na página de lançamento da Underdog.
Fontes e referências
Encontrou uma informação que precisa de correção? Fale com a redação.
