8 октября JetBrains представила Mellum2.1 — обновлённую языковую модель для кодинг-агентов, опубликованную по лицензии Apache 2.0. Главный смысл релиза не в новой архитектуре, а в постобучении: модель должна не только дописывать код, но и работать с задачей внутри репозитория — находить нужные файлы, вносить правки и запускать проверку результата. Для команд, которые рассматривают self-hosted AI-инструменты, это расширяет выбор между закрытыми ассистентами и моделями, запускаемыми в собственной инфраструктуре.

Постобучение вместо новой архитектуры.

Как следует из блога JetBrains, Mellum2.1 сохраняет архитектуру Mellum2: это mixture-of-experts-модель с 12 млрд параметров, из которых при генерации задействуются 2,5 млрд. Такой подход разделяет общую ёмкость модели и вычислительную нагрузку конкретного запроса. В техническом обзоре MarkTechPost также указаны 64 эксперта, восемь активных экспертов на токен и контекстное окно в 131 072 токена.

JetBrains не стала обучать новую базовую модель с нуля. Основные изменения пришлись на reinforcement learning в реальных программных окружениях. Компания сообщает о миллионах запусков в изолированных песочницах и тысячах сред для обучения. Перед подачей в обучение задачи фильтровались: данные с неработающими тестами, непроверяемыми ответами и некорректно сформулированными заданиями могли исказить сигнал для модели.

Схема обучения важна для понимания целевого применения Mellum2.1. По данным публикации KuCoin, модель вызывала инструменты терминала и редактирования файлов в реальных репозиториях, а награду получала за успешное прохождение тестов. Это отличает задачу от обычного автодополнения: агенту нужно связать диагностику ошибки, выбор места изменения, правку кода и проверку результата в единую последовательность действий.

Бенчмарки показывают заметный рост, но не лидерство во всём.

На SWE-bench Verified JetBrains сообщает о росте результата Mellum с 2% до 47%. В том же сравнении Qwen3.5-9B получил 50%, поэтому релиз нельзя описывать как однозначное превосходство над сопоставимыми открытыми моделями. На LiveCodeBench v6 Mellum2.1, по приведённым данным, показала 82% против 75,4% у Qwen3.5-9B. При этом сравнение результатов требует осторожности: методика запуска, используемые инструменты и настройки агента способны существенно повлиять на итоговый балл.

Не все агентные задачи стали сильной стороной модели. MarkTechPost приводит результат 17,4 на Terminal-Bench 2.1 против 21,7 у Qwen3.5-9B. Это указывает на практическое ограничение: умение править код и проходить часть тестовых задач ещё не означает одинаковой надёжности при длительной работе в терминале, с зависимостями, окружением и многошаговыми сценариями.

Скорость остаётся частью позиционирования Mellum. JetBrains заявляет, что при высокой нагрузке на одном NVIDIA H200 модель выдаёт почти вдвое больше токенов, чем Qwen3.5-9B, а механизм предсказания нескольких токенов ускоряет одиночный запрос примерно в 1,6 раза. Это заявление компании, привязанное к конкретному оборудованию и режиму нагрузки, а не универсальное измерение для любого сервера. Однако сочетание 2,5 млрд активных параметров и MoE-архитектуры объясняет ставку на быстрых субагентов, которым требуется много параллельных вызовов.

Что меняет Apache 2.0.

Лицензия Apache 2.0 задаёт публичные условия использования модели и снижает зависимость от единственного облачного поставщика. Команда может изучить Mellum2.1 для внутреннего агента, развернуть её на своих GPU и встроить в существующий цикл разработки с учётом требований лицензии и собственной юридической проверки. Для компаний с чувствительным исходным кодом особенно значима возможность не передавать репозитории внешнему API. О локальном запуске и контроле над конфиденциальными данными пишет сообщение на Habr.

Открытая лицензия не устраняет инженерные риски. Агенту по-прежнему нужно ограничивать права доступа к репозиторию, секретам, сети и средам исполнения. Прохождение тестов подтверждает лишь то, что модель удовлетворила доступному набору проверок; оно не гарантирует отсутствие регрессий, уязвимостей или неверно понятых требований. Поэтому для production-сценариев остаются необходимыми sandbox-режим, review изменений и независимые проверки в CI.

Место Mellum в стратегии JetBrains и на рынке.

Mellum развивается от узкой модели автодополнения к инфраструктурному компоненту для агентных систем. Как описывает обзор Tech Insider, первоначальная версия Mellum была ориентирована на завершение кода, а позднее линейка получила открытую лицензию и более широкий набор сценариев. Mellum2.1 продолжает этот переход: её можно использовать как исполнителя узких задач, субагента в многоагентной схеме или локального помощника для анализа кода.

Для разработчиков практический вывод состоит в том, что Mellum2.1 стоит проверять не только на отдельных промптах, но и на собственном наборе задач: исправлении багов, навигации по монорепозиторию, запуске тестов и соблюдении правил проекта. Для исследователей релиз интересен масштабом RL-постобучения в исполнимых средах. Для рынка он подтверждает тренд: конкуренция в кодинге смещается от качества одиночной генерации к способности модели действовать через инструменты, работать в ограниченной инфраструктуре и проверять последствия своих действий.