Am 8. Oktober 2026 hat JetBrains Mellum 2.1 veröffentlicht, die neue Version des offenen Coding-Modells, das das Unternehmen im Juni unter der Apache-2.0-Lizenz gestellt hat. Die Architektur ist unverändert: ein Mixture-of-Experts mit 12 Milliarden Parametern, davon 2,5 Milliarden aktiv. Geändert hat sich laut offizieller Ankündigung das Post-Training.
Mellum 2 war schnell, arbeitete aber nach Angaben von JetBrains nicht auf dem gewünschten Niveau in einem Repository. Nach einem Sommer Reinforcement Learning in echten Umgebungen, mit Millionen Sandbox-Läufen, soll 2.1 Codebasen erkunden, Dateien bearbeiten und die eigenen Änderungen prüfen.
Was JetBrains geändert hat
Fast die gesamte Arbeit an dieser Version steckt im Post-Training, vor allem im Reinforcement Learning. Das Unternehmen nennt drei Linien:
- RL ist von einer kurzen Endphase zum Hauptteil des Trainings geworden;
- neue Aufgaben in Mathematik, Competitive Programming, Wissenschaft, Tool-Nutzung und Softwareentwicklung kamen hinzu, mit Filterung offener Daten, die defekte Tests oder unlösbare Aufgaben enthielten;
- die interne Infrastruktur ließ Tausende Umgebungen laufen und startete während des Trainings Millionen Sandboxes.
In internen Vergleichen hat JetBrains Mellum 2.1 gegen Mellum 2 und gegen zwei offene Modelle ähnlicher Klasse, Qwen3.5-9B und Gemma 4 E4B, mit demselben Protokoll gemessen. Der größte genannte Fortschritt liegt im agentischen Coding. Das Unternehmen berichtet auch Gewinne bei Programmierung, Mathematik, Tool-Calling und Allgemeinwissen. Diese Zahlen stammen von JetBrains, nicht von einem unabhängigen Ranking.
Tempo und wo es läuft
Weil das Post-Training die Architektur nicht angefasst hat, bleibt die Grundgeschwindigkeit die von Mellum 2. Mit Multi-Token-Prediction ist 2.1 laut JetBrains unter hoher Last das schnellste Modell der Vergleichsgruppe und liefert fast doppelt so viele Tokens wie Qwen3.5-9B. Bei einer einzelnen Anfrage soll MTP das Modell etwa 1,6-mal schneller machen.
Hervorgehobene Einsätze sind Worker in agentischen Systemen, allgemeiner Assistent jenseits von Code und privates Deployment, lokal oder auf eigener Infrastruktur. Die Gewichte liegen auf Hugging Face. GGUF-Builds für llama.cpp, Ollama und LM Studio sowie der Multi-Token-Prediction-Kopf für Speculative Decoding in vLLM wurden als demnächst angekündigt, noch ohne Datum.
Für den Bau von Coding-Agenten ist die Größe der praktische Punkt: ein 12B-Modell mit 2,5B aktiven Parametern passt auf deutlich bescheidenere Hardware als Frontier-Modelle in der Cloud. Der Qualitätssprung bei agentischer Arbeit muss aber noch außerhalb des Hersteller-Benchmarks gemessen werden.
Quellen
Transparenz: Dieser Inhalt wurde mit Hilfe künstlicher Intelligenz erstellt, bearbeitet oder geprüft. Die Angaben wurden mit öffentlichen Beiträgen auf X und im Internet verfügbaren Quellen abgeglichen. Prüfen Sie die Originalquellen für den vollständigen Kontext.
Von GeekikiBot