Mellum 2.1: JetBrains libera modelo aberto de 12B para agentes de código

A JetBrains lançou em 8 de outubro de 2026 o Mellum 2.1, a nova versão do modelo aberto de código que a empresa colocou sob licença Apache 2.0 em junho. A arquitetura não mudou: continua um mixture-of-experts de 12 bilhões de parâmetros, com 2,5 bilhões ativos. O que mudou, segundo o anúncio oficial, foi o pós-treinamento.

O Mellum 2 era rápido, mas a JetBrains diz que não operava dentro de um repositório no nível desejado. Depois de um verão de reinforcement learning em ambientes reais, com milhões de execuções em sandbox, a empresa afirma que o 2.1 passa a explorar a base de código, editar arquivos e conferir as próprias alterações.

O que a JetBrains mudou

Quase todo o trabalho desta versão foi para o pós-treinamento, sobretudo reinforcement learning. A empresa descreve três eixos:

  • o RL deixou de ser uma etapa curta no fim e passou a ser a parte principal do treinamento;
  • entraram tarefas novas de matemática, programação competitiva, ciência, uso de ferramentas e engenharia de software, com filtragem de dados abertos que vinham com testes quebrados ou tarefas inviáveis;
  • a infraestrutura interna rodou milhares de ambientes e lançou milhões de sandboxes ao longo do treino.

Nas comparações internas, a JetBrains mediu o Mellum 2.1 contra o Mellum 2 e contra dois modelos abertos de classe parecida, Qwen3.5-9B e Gemma 4 E4B, no mesmo protocolo. O maior avanço declarado está em coding agentivo. A empresa também relata ganhos em programação, matemática, chamada de ferramentas e conhecimento geral. Esses números são da própria JetBrains, não de um ranking independente.

Velocidade e onde roda

Como o pós-treinamento não alterou a arquitetura, a velocidade de base permanece a do Mellum 2. Com multi-token prediction, a JetBrains diz que, sob carga alta, o 2.1 é o mais rápido do grupo comparado e serve quase o dobro de tokens do Qwen3.5-9B. Em um pedido isolado, o MTP deixaria o modelo cerca de 1,6 vez mais rápido.

Os usos que a empresa destaca são subagente dentro de sistemas agentivos, assistente geral fora do código e implantação privada, local ou em infraestrutura própria. Os pesos estão no Hugging Face. Builds GGUF para llama.cpp, Ollama e LM Studio, além da cabeça de multi-token prediction para speculative decoding no vLLM, foram anunciados como próximos, ainda sem data.

Para quem monta agentes de código, o ponto prático é o tamanho: um modelo de 12B com 2,5B ativos cabe em hardware bem mais modesto do que os modelos de fronteira na nuvem, com a ressalva de que o salto de qualidade agentiva ainda precisa ser medido fora do benchmark da fabricante.

Fontes

Transparência: Este conteúdo foi criado, editado ou revisado com auxílio de inteligência artificial. As informações foram cruzadas com publicações públicas no X e fontes disponíveis na internet. Consulte as fontes originais para verificar o contexto completo.

Por GeekikiBot