Cloudflare представила открытые модели Clef и Clef-Flash, рассчитанные на классификацию и маршрутизацию в агентных системах. Их значение не в замене универсальных LLM, а в выделении отдельного слоя, который быстро выбирает следующее действие по тексту, JSON и визуальному контексту. Согласно описанию запуска Clef, модели доступны в Workers AI и опубликованы под лицензией Apache 2.0, что позволяет запускать их локально и адаптировать под прикладные сценарии.

От генерации текста к выбору действия.

Decision model принимает состояние задачи и возвращает не развёрнутый ответ, а ограниченное структурированное решение: например, выбранную категорию, маршрут запроса, оценку риска или вероятность для каждого варианта. Такой подход подходит для этапов, где агенту нужно определить, какой инструмент вызвать, передать ли задачу человеку, применить ли правило модерации или направить запрос к более дорогой модели.

Cloudflare описывает этот класс как низколатентную альтернативу генеративным моделям для классификации и routing-задач. В практической архитектуре decision model может стоять перед LLM: сначала определить намерение, тип документа или состояние интерфейса, затем передать уже отобранную задачу генеративной модели. Это сокращает число случаев, когда большая модель вызывается для простого выбора из заранее известных вариантов.

Название d1 в этой дискуссии требует отдельной оговорки. Модель d1 от Liquid AI также относится к decision models, однако в карточке d1 на OpenRouter указаны текстовый вход и структурированные решения на выходе. Контекстное окно составляет 65 536 токенов. Следовательно, d1 сопоставима с Clef по идее специализированного слоя решений, но приведённая фактура не подтверждает для неё мультимодальный ввод или открытые веса.

Мультимодальность становится частью маршрутизации.

У Clef есть vision encoder, а в сравнительном обзоре модели описываются как способные работать с текстом, JSON, изображениями и видео. Это расширяет набор задач, которые можно передать в слой быстрых решений: от определения типа скриншота или документа до выбора дальнейшего шага в интерфейсе. В сравнительной таблице decision models Clef-Flash указан как вариант на 9 млрд параметров, а Clef — на 27 млрд; для них приведён контекст в 64 тыс. токенов.

Другой пример открытой мультимодальной модели — pplx-decider-v1-27b от Perplexity. В каталоге decision models она описана как Apache-2.0-модель, дообученная на базе Qwen3.8-27B и возвращающая распределение вероятностей по фиксированным вариантам ответа. В подборке сообщений о запуске Perplexity Decisions API компания также заявляет о мультимодальности, контексте до 250 тыс. токенов и среднем результате 85,71% на 11 бенчмарках. Эти показатели стоит рассматривать как заявления разработчика, пока не появятся независимые сопоставимые проверки.

Edge — это не только размер модели.

Переход к edge-инференсу в данном случае связан не только с возможностью скачать веса. Cloudflare делает ставку на GPU в своей инфраструктуре, чтобы уменьшить сетевую задержку для приложений, использующих Workers AI. Для локального запуска потребуются отдельно оценивать модель оборудования, формат весов, квантование, доступные runtime и требования к памяти. Открытая лицензия снимает часть юридических ограничений, но сама по себе не гарантирует, что модель поместится на ноутбук, мобильное устройство или промышленный контроллер.

Исследовательский контекст показывает, почему эта задача остаётся инженерной. В обзоре edge-мультимодальных моделей среди направлений оптимизации названы сжатие, ускорение инференса и архитектуры последовательностного моделирования с линейной, а не квадратичной сложностью. Для сценариев с визуальными данными ограничением становятся не только вычисления модели, но и подготовка кадров, передача контекста и допустимая задержка на всём пути принятия решения.

Как оценивать модели для продукта.

Разработчикам не стоит сводить выбор к одному результату бенчмарка. Метрики Clef, Perplexity и других моделей могут быть получены на разных наборах задач и при разных способах измерения калибровки. Для decision model особенно важны не только точность выбора, но и вероятность ошибки, поведение на нераспознанных входах, устойчивость к смене формата данных и возможность задать порог передачи задачи человеку или LLM.

Открытые веса дают командам контроль над данными и развёртыванием, но не отменяют разрыв с крупными закрытыми моделями в сложном многошаговом рассуждении и работе с неоднозначными изображениями. Как отмечается в обзоре выбора между open-weight и закрытыми моделями, этот разрыв особенно заметен в продвинутой мультимодальности и трудных сценариях следования инструкциям. Поэтому практичный стек выглядит гибридным: decision model обслуживает частые и формализуемые развилки, а LLM получает случаи, где требуется объяснение, генерация или сложное рассуждение.

Появление Clef, pplx-decider-v1-27b и других открытых моделей показывает формирование отдельного рынка компонентов для AI-агентов. Конкурировать здесь будут не только размером и скоростью, но и качеством вероятностных оценок, лицензией, поддержкой мультимодальных состояний и удобством встраивания в инфраструктуру. Для продукта ключевой вопрос — не способна ли такая модель заменить LLM целиком, а какую конкретную развилку она способна стабильно и дёшево закрыть.