Исследовательская команда NVIDIA представила Nemotron-Cascade-2-30B-A3B — открытую модель, для которой заявлены результаты уровня золотой медали на IMO 2025 и IOI 2025, а также на финале ICPC. Значение новости не сводится к олимпиадным баллам: разработчики демонстрируют, что компактная по активной части MoE-модель может достигать высокого уровня в сложном рассуждении за счёт специализации после базового обучения, а не только за счёт дальнейшего наращивания размера.

Что именно показала Nemotron-Cascade 2.

Согласно технической работе NVIDIA, Nemotron-Cascade-2-30B-A3B набрала 35 из 42 баллов на IMO 2025 — это соответствует золотому уровню. Авторы также сообщают о gold-level результатах на IOI и ICPC World Finals того же года. В работе модель названа второй open-weight LLM после DeepSeek-V3.2-Speciale-671B-A37B, достигшей такого уровня одновременно в математике и алгоритмическом программировании.

Маркировка 30B-A3B означает архитектуру Mixture-of-Experts с 30 млрд параметров всего и примерно 3 млрд активных параметров на один запуск. Как пишет VentureBeat, именно это сочетание размера и активной части стало одним из центральных пунктов релиза. В сравнении, приведённом авторами исследования, модель имеет примерно в 20 раз меньше параметров, чем DeepSeek-V3.2-Speciale, с которым её сопоставляют по олимпиадному результату.

Почему размер модели не объясняет результат сам по себе.

Nemotron-Cascade 2 — не базовая модель, проверенная на олимпиадных задачах без дополнительной подготовки. Её рецепт включает supervised fine-tuning, Cascade RL и многодоменную on-policy distillation. В такой схеме модель обучают не только выдавать ответ, но и выстраивать траекторию поиска, получать сигнал о качестве решения и улучшать поведение на нескольких типах задач. Это отличает систему от универсального чат-бота, чьи способности к программированию или доказательствам формируются главным образом как побочный эффект общего обучения.

Существенную роль играют и вычисления во время инференса. Для математических задач в работе используется цикл generate-verify-refine: модель строит доказательство, проверяет его и дорабатывает вариант. Такой подход повышает вероятность найти корректное решение, но не делает ответ автоматически надёжным. В олимпиадной математике итоговые решения Nemotron-Cascade 2 оценивал эксперт-человек, тогда как программные решения проверялись через OnlineJudge с официальными тестами. Эти процедуры измеряют разные свойства: убедительность доказательства и прохождение конечного набора тестов.

Две специализации внутри одного семейства.

Результаты по IMO и IOI не следует трактовать как достижение одного универсального чекпойнта во всех сценариях. В более позднем направлении для соревновательного программирования NVIDIA обучала отдельные варианты Nemotron. По данным CCTest, для этой линии было отобрано 22 тыс. задач, а подготовка сочетала синтетические цепочки рассуждений, SFT, RL и метод GenCorrect, который создаёт, оценивает и исправляет несколько кандидатов уже во время решения.

В этой ветке различаются и тренировочные рецепты. Nano-CC с конфигурацией 30B-A3B проходила SFT и RL, тогда как Ultra-CC с 550B-A55B — только SFT. AlphaSignal сообщает, что Nemotron-3-Ultra-CC получила 535,4 балла из 600 на IOI 2026, превысив результат лучшего участника-люди при одинаковых условиях состязания: ограничении времени, отсутствии интернета и общей платформе отправки решений. Это отдельный результат специализированной системы, а не прямое подтверждение возможностей Cascade 2.

Математическая специализация также развивается отдельно. В разборе эксперимента Nemotron на IMO 2026 описаны два специализированных чекпойнта, работающих с доказательствами на естественном языке без формальных пруверов, внешних инструментов и доступа к интернету. Для обучения использовались длинные траектории построения, проверки и исправления доказательств. Заявленные 30 из 42 баллов иллюстрируют тот же принцип: качество определяется не названием семейства, а связкой данных, постобучения и процедуры поиска.

Что это меняет для команд и рынка.

Для разработчиков главный вывод состоит не в том, что олимпийская модель готова заменить инженерную команду. Олимпиадные задания имеют чёткие критерии, ограниченную предметную область и допускают дорогой поиск нескольких решений. В прикладных продуктах важны также работа с неполными требованиями, интеграция с кодовой базой, безопасность, стоимость задержки и устойчивость на новых данных. Само NVIDIA-ориентированное освещение релиза указывает, что Cascade 2 оптимизирована прежде всего под глубокое рассуждение и следование инструкциям, а не под общий поиск знаний или сложные многошаговые агентные сценарии.

При этом кейс меняет практический фокус. Открытые веса, данные обучения и пайплайн Cascade RL, о публикации которых сообщал VentureBeat, позволяют исследовательским и корпоративным командам изучать воспроизводимость подхода. Наиболее полезная стратегия здесь — не переносить олимпиадные метрики в продукт напрямую, а проверять, помогает ли специализированное постобучение с верификацией на собственной задаче: например, в анализе кода, формальной документации или внутренних математических расчётах. Nemotron показывает, что для таких задач всё большую ценность получает не только базовая модель, но и весь контур её подготовки и контроля ответа.