A JetBrains publicou o Mellum2.1, seu modelo de código mais avançado: um MoE de 12B parâmetros (2.5B ativos) com 131K de contexto, Apache 2.0 e suporte nativo a vLLM/SGLang. A grande novidade: SWE-bench Verified saltou de 2.0 para 47.0 entre a v1.0 e a v2.1 — uma melhora de 23x.
O que é
- Arquitetura: Mixture of Experts — 12B parâmetros totais, 2.5B ativos por token
- Contexto: 131K tokens
- Licença: Apache 2.0
- Runtime: vLLM, SGLang, GGUF (desde 7 GB)
- Foco: agentes de código (SWE-bench, LiveCodeBench)
Desempenho
| Benchmark | Mellum2.1 | Mellum1.0 | Qwen3.5-9B (ref) |
|---|---|---|---|
| SWE-bench Verified | 47.0 | 2.0 | — |
| LiveCodeBench v6 | 82.0 | — | — |
| HarmBench (baixo = bom) | 8.5 | 21.5 | — |
Throughput: ~2x mais rápido que Qwen3.5-9B em H200, graças à arquitetura MoE que ativa apenas 2.5B parâmetros por token.
Por que importa
- Custo de inferência: MoE 12B/2.5B ativos oferece desempenho próximo de modelos densos 12B com custo de um modelo 3B — ideal para pipelines de agentes de código em escala
- Segurança: HarmBench 8.5 (vs 21.5 na v1.0) mostra que a JetBrains investiu em alinhamento, não apenas em capacidade
- Ecossistema aberto: Apache 2.0 + vLLM/SGLang + GGUF elimina dependência de runtime proprietário
- Evolução agressiva: 2.0 → 47.0 no SWE-bench entre versões é uma das maiores melhoras já reportadas em um modelo de código
Contexto
O Mellum2.1 posiciona a JetBrains como um dos poucos players com modelo de código proprietário competitivo na faixa 10B+ — abaixo do GPT-6 Luna e do Claude Haiku 5.5 em tamanho, mas com licença aberta e throughput 2x superior a Qwen3.5-9B.
O modelo está disponível em Hugging Face e no hub da JetBrains.
Fontes e referências
Encontrou uma informação que precisa de correção? Fale com a redação.
