Все материалы
Обучение агентов4 мин чтения

Синтетическая среда может обучить агента неправильному миру

Масштабирование искусственных задач помогает только тогда, когда среда сохраняет причинную логику, проверяющий читает настоящее состояние, а ошибки самой среды исправляются.

Read in English

Больше задач может сделать агента хуже

Для обучения экранного или терминального агента нужны приложения, которые можно менять, ломать и возвращать в исходное состояние. Рабочие сервисы для этого неудобны: они закрыты авторизацией, содержат настоящие данные и плохо переносят тысячи пробных действий. Поэтому команды строят искусственные копии.

Проблема появляется, когда копия воспроизводит внешний вид, но не причинную логику. Агент быстро учится проходить проверяющего в игрушечной среде и переносит неверную стратегию в настоящий сервис.

Echoverse дает прямое измерение этого эффекта. Система преобразует спецификации в приложения с состоянием, создает задачи и проверяет результат по собственной базе данных приложения. Каждая выполненная траектория используется дважды: для обучения модели и для ремонта среды, заданий и проверяющего.

Модель на 9 млрд параметров после обучения на 12 средах выросла с 36,5% до 67,1% на 14 проверочных срезах. Но поверхностные среды снизили точность на настоящих сайтах с 80% до 75%. Более глубокие подняли ее с 80% до 85% в одной постановке и с 48% до 65% в другой. Исправление одной ошибочной среды увеличило результат обученной на ней модели с 16,2% до 38,5%.

Количество сред в этом эксперименте не предсказывает перенос. Предсказывает то, насколько точно они воспроизводят последствия действия.

Глубина означает скрытое состояние, а не красивый экран

Глубокая среда хранит связи, которые встречаются в рабочем процессе. Созданный заказ появляется в списке, влияет на остаток, сохраняется после перезагрузки и может быть отменен только допустимым способом. Ошибочная операция меняет базу, а не только текст уведомления.

Поверхностная копия часто связывает кнопку с заранее подготовленным сообщением об успехе. Агент учится находить короткий путь к сообщению. На настоящем сайте этот путь не создает заказ, не проверяет разрешения и не переживает обновление страницы.

Проверяющий должен читать внутреннее состояние независимо от интерфейса. Если задача требует добавить пользователя с ограниченной ролью, проверяются запись, роль, область доступа и отсутствие лишних прав. Финальный снимок нужен для диагностики, но не является источником истины.

Среда также должна содержать отрицательные ветки: просроченное согласие, недостаточные права, конфликт версий, повторный запрос и частичный отказ внешнего сервиса. Именно они отделяют знание процесса от запоминания успешного маршрута.

Сложные задачи можно синтезировать с проверкой

Другая работа, Recursive Synthesis for Long-Horizon Terminal Tasks, решает проблему масштаба для терминала. Прямое сочинение задания большой моделью часто рассогласует четыре части: инструкцию, окружение, эталонное решение и проверяющий сценарий.

RST начинает с проверенного задания. На каждом раунде система удлиняет эталонное решение, затем заново согласует инструкцию и проверку с новым процессом. Кандидат запускается в свежей изолированной среде. Только прошедшие проверку задания становятся основой следующего раунда.

За 15 раундов авторы получили 37 484 задачи примерно по 0,05 доллара за одну. Медианная длина эталонного решения выросла с 67 до 374 строк, число команд - с 40 до 244. Успешность DeepSeek-V4-Pro при четырех попытках упала с 90% на первом раунде до 2,5% на пятнадцатом.

Дообучение Qwen3.5 на отобранных траекториях дало до 10 процентных пунктов прироста на трех наборах терминальных задач. Эти результаты пока принадлежат авторам. Особенно важно проверить, не появились ли повторяющиеся шаблоны, по которым синтетические задания распознаются без решения.

Проверяющий и среда должны развиваться вместе

Исправлять только модель недостаточно. Новый агент находит состояния, которых не достигали прежние версии, и обнаруживает ошибки симуляции. Если такие траектории просто пометить как провал агента, обучение закрепит обход сломанного мира.

Каждый необычный результат нужно разложить. Агент нарушил условие? Проверяющий прочитал не то состояние? В приложении отсутствует нужная причинная связь? Сама задача невозможна? После ремонта среды старые траектории запускаются повторно, чтобы отделить изменение оценки от изменения способности.

Для голосовых процессов это означает полноценную модель бизнеса за разговором. Недостаточно сгенерировать реалистичные реплики клиента. Сценарий должен хранить заказ, согласие, лимит, доступные временные окна и последствия каждого вызова. Проверяется конечное деловое состояние, а не совпадение фраз.

Перед обучением нужна проверка переноса

Новая среда сначала проходит несколько контрольных испытаний вручную. Одинаковое действие через интерфейс и прямой системный запрос должно приводить к одному состоянию. Перезагрузка не стирает результат. Повтор операции ведет себя так же, как в рабочем сервисе. Запрещенная ветка действительно недостижима.

Затем базовую модель оценивают отдельно на синтетической и настоящей выборке. Если обучение улучшает искусственную среду и ухудшает настоящий процесс, выпуск останавливается, даже если общая обучающая награда растет.

Полезно держать матрицу расхождений по отдельным механизмам: авторизация, сохранение состояния, повтор операции, ошибки сети, редкие элементы интерфейса и длинные зависимости. Она показывает, чему именно учит искусственный мир. Один общий результат легко скрывает, что модель стала лучше нажимать кнопки и хуже соблюдать правила доступа. Новая версия среды принимается только после повторного прохождения старых причинных проверок.

Синтетические данные дешевы только после появления надежной проверки. Без нее массовое масштабирование быстрее учит агента закономерностям, которых в рабочем мире вообще нет.

Автор / руководитель исследованийДмитрий / R&D Club

Принесите задачу, у которой нет очевидного пути реализации.

hello@rnd.club ↗