Дешевая попытка может быть дорогой задачей
Модель с низкой ценой входных и выходных токенов выглядит естественным выбором для массового агента. Но одна задача может потребовать три повторных запуска, лишние обращения к инструментам и передачу сложной ветки более сильной модели. Цена первой попытки остается низкой, а цена подтвержденного результата растет.
Поэтому сравнение тарифов не отвечает на рабочий вопрос. Нужна стоимость успешной задачи: все вызовы моделей, промахи кеша, инструменты, повторы и время инфраструктуры делятся на число результатов, которые прошли конечную проверку.
Если модель стоит в четыре раза дешевле, но выполняет только половину задач и часто оставляет систему в неопределенном состоянии, она может проиграть дорогой модели. Обратный случай тоже распространен: сильная модель тратится на механическое форматирование, которое более компактная выполняет с тем же результатом.
Маршрутизатор Cursor учится на реальных запросах
Cursor Router классифицирует каждый запрос по контексту, сложности и области, затем выбирает модель. Классификатор обучен более чем на 600 тысячах рабочих запросов и проверен в опытах на миллионах запросов. Есть три режима с разным компромиссом между качеством и расходами.
Cursor сообщает о снижении расходов на 30-50% у первых корпоративных клиентов и до 60% в сетевых сравнениях. Для одного изменения кода компания приводит стоимость 6,76 доллара в режиме максимального качества и 4,63 доллара в сбалансированном режиме против 12,69 и 7,34 доллара у двух отдельных моделей.
Эти цифры нельзя переносить в другой продукт напрямую. Cursor оптимизировал удовлетворенность пользователя и долю кода, оставшегося в репозитории. Это хорошие рабочие сигналы, но не детерминированная проверка выполнения задачи. Пользователь может принять правдоподобное изменение, которое сломается позже.
Еще одна полезная деталь: расчет учитывает промахи кеша при переключении моделей. Маршрутизация происходит внутри разговора, а смена модели может заставить заново обработать большой контекст. Экономия на тарифе исчезает, если каждый переход уничтожает пользу кеширования.
Малые модели стали полноценными исполнителями
Новые цены и возможности делают маршрутизацию практичнее. Google выпустила Gemini 3.6 Flash и 3.5 Flash-Lite как быстрые модели с инструментами.
Для 3.6 Flash заявлена цена 1,50 доллара за миллион входных и 7,50 доллара за миллион выходных токенов. Google сообщает о снижении объема ответа на 17% относительно предыдущей версии и росте DeepSWE с 37% до 49%, а MLE-Bench - с 49,7% до 63,9%.
Flash-Lite стоит 0,30 и 2,50 доллара за миллион входных и выходных токенов соответственно, выдает около 350 токенов в секунду и поддерживает управление глубиной рассуждения. На Terminal-Bench 2.1 заявлен рост с 31% до 54%.
Все сравнения принадлежат Google. Они показывают кандидатов для роли дешевого исполнителя, а не победителя собственной рабочей оценки.
OpenAI одновременно снизила цену GPT-5.6 Luna на 80%. Luna стоит 0,20 доллара за миллион входных и 1,20 доллара за миллион выходных токенов. Terra стоит 2 и 12 долларов. Ускоренный режим Sol дает до 2,5 раза большую скорость по двойной цене без изменения заявленного качества.
Сдвиг здесь экономический. Дешевый исполнитель теперь умеет вызывать инструменты и проходить многошаговый процесс. Но заявления о качестве и стоимости задачи исходят от поставщика и его клиентов. Маршрут нужно строить на собственных проверках.
Единица оценки должна заканчиваться проверкой
Для каждой группы задач собирается небольшой устойчивый набор: исправление ошибки, изменение интерфейса, анализ документа, работа с терминалом, поиск и вызов внешнего сервиса. У каждого задания есть проверяемое конечное состояние.
Запуск сохраняет успешность, время до первого токена, полное время, входные и выходные токены, попадание в кеш, число вызовов инструментов, повторов и передач другой модели. Стоимость ошибки учитывается отдельно: неудачный черновик и неверный платеж нельзя усреднять одинаково.
После этого простейший маршрутизатор может быть таблицей. Рутинные задачи идут самой дешевой модели, которая проходит установленный порог. Неопределенные, длинные и дорогие по ошибке задачи сразу получает сильная модель. Передача наверх происходит по наблюдаемым признакам: повторная ошибка инструмента, неразрешенный конфликт, исчерпанный бюджет или провал проверки.
Маршрутизатор тоже создает расходы и ошибки. Нужно измерять неверные назначения: когда дешевая модель получила слишком сложную задачу и когда дорогая была вызвана без необходимости. Отдельная доля показывает задачи, где переключение произошло слишком поздно и уже потратило большую часть бюджета.
Уверенность самого маршрутизатора полезно калибровать отдельно. При слабой уверенности безопаснее сразу выбрать более сильную модель или запустить короткую диагностическую попытку без изменений внешнего состояния. Иначе классификатор экономит несколько центов на выборе и создает дорогой повтор после частично выполненной операции.
Цена токена остается входным параметром
Тариф нужен для расчета, но не должен быть целевой метрикой. Важнее стоимость подтвержденного изменения, обработанного документа или завершенного заказа. Для задержкочувствительного голосового процесса к ней добавляется стоимость времени: медленная правильная реплика может прийти после того, как клиент перебил агента.
Полезный маршрутизатор не ищет одну лучшую модель. Он фиксирует, какая модель дешевле доводит конкретный класс работы до проверенного состояния, и меняет решение после каждого нового измерения.