Тексты из работы, а не контент о работе.
Исследовательские позиции, инженерные решения, невыжившие гипотезы и системы, выдержавшие встречу с продакшеном.
Опубликованные материалы
У изолированной среды агента есть настоящая карта атак
Запрет прямого интернета не изолирует агента, если остаются прокси пакетов, общие кеши, учетные данные и пути в соседнюю инфраструктуру.
Распознанный текст должен уметь меняться
Потоковая расшифровка речи не является готовым документом. Поздние слова меняют смысл ранних, а безусловная очистка способна удалить важное условие.
Снимок экрана не доказывает успех агента
Экран может выглядеть правильно, пока файл не сохранен, настройка не применилась или проверяющая модель приняла промежуточный кадр за итоговый.
Маршрутизацию моделей надо считать по стоимости успешной задачи
Цена миллиона токенов не учитывает повторы, кеш, инструменты и долю провалов. Маршрутизатор должен выбирать модель по измеренному результату конкретной работы.
Больше агентов не создают независимую проверку
Несколько одинаково устроенных агентов могут копировать одну ошибку, терять данные при передаче и выдавать согласие за подтверждение.
Промпт не заменяет механизм контроля правил
Длинный регламент в системном сообщении не удерживает агента в допустимом процессе. Проверки, переходы и запреты нужно исполнять программно.
Самоулучшающемуся агенту нужен лучший подтвержденный результат
Последняя итерация обучения, набора данных или файла навыка часто хуже предыдущей. Без контрольной выборки, остановки и отката улучшение превращается в регрессию.
SKILL.md - исполняемая зависимость в цепочке поставки
Агент-разработчик читает SKILL.md как рабочую инструкцию и выполняет ее со своими правами. Обычная проверка кода и статический сканер видят только часть атаки.
Синтетическая среда может обучить агента неправильному миру
Масштабирование искусственных задач помогает только тогда, когда среда сохраняет причинную логику, проверяющий читает настоящее состояние, а ошибки самой среды исправляются.
Программный контур является частью агента
Одна и та же модель показывает разное качество в зависимости от сборки контекста, порядка инструментов, повторов и проверок. Сравнивать только названия моделей недостаточно.
Голосовой агент должен понимать, когда промолчать
Обнаружить речь недостаточно. Агенту нужно отличать обращение к нему от разговора в стороне, продолжения мысли и отмены прежнего намерения.
Большая часть AI R&D — просто дорогая интеграция API
Интеграция может быть полезной. Исследование начинается там, где путь реализации не очевиден, а доказательства могут изменить направление.