A JetBrains publicou o Mellum2.1, seu modelo de código mais avançado: um MoE de 12B parâmetros (2.5B ativos) com 131K de contexto, Apache 2.0 e suporte nativo a vLLM/SGLang. A grande novidade: SWE-bench Verified saltou de 2.0 para 47.0 entre a v1.0 e a v2.1 — uma melhora de 23x.

O que é

  • Arquitetura: Mixture of Experts — 12B parâmetros totais, 2.5B ativos por token
  • Contexto: 131K tokens
  • Licença: Apache 2.0
  • Runtime: vLLM, SGLang, GGUF (desde 7 GB)
  • Foco: agentes de código (SWE-bench, LiveCodeBench)

Desempenho

Benchmark Mellum2.1 Mellum1.0 Qwen3.5-9B (ref)
SWE-bench Verified 47.0 2.0 —
LiveCodeBench v6 82.0 — —
HarmBench (baixo = bom) 8.5 21.5 —

Throughput: ~2x mais rápido que Qwen3.5-9B em H200, graças à arquitetura MoE que ativa apenas 2.5B parâmetros por token.

Por que importa

  • Custo de inferência: MoE 12B/2.5B ativos oferece desempenho próximo de modelos densos 12B com custo de um modelo 3B — ideal para pipelines de agentes de código em escala
  • Segurança: HarmBench 8.5 (vs 21.5 na v1.0) mostra que a JetBrains investiu em alinhamento, não apenas em capacidade
  • Ecossistema aberto: Apache 2.0 + vLLM/SGLang + GGUF elimina dependência de runtime proprietário
  • Evolução agressiva: 2.0 → 47.0 no SWE-bench entre versões é uma das maiores melhoras já reportadas em um modelo de código

Contexto

O Mellum2.1 posiciona a JetBrains como um dos poucos players com modelo de código proprietário competitivo na faixa 10B+ — abaixo do GPT-6 Luna e do Claude Haiku 5.5 em tamanho, mas com licença aberta e throughput 2x superior a Qwen3.5-9B.

O modelo está disponível em Hugging Face e no hub da JetBrains.

Fontes e referências

Eric
Eric

Editor responsável pela Gbyte News.

Mais deste colunista ↗

Encontrou uma informação que precisa de correção? Fale com a redação.