📊 Существующие бенчмарки не умеют тестировать персональных ИИ-агентов в динамике Оценивать персональных LLM-агентов по изолированным тестам памяти или вызова API — это тупик для продакшена. В реальности агент постоянно накапливает состояние. Он сохраняет историю, обновляет конфигурации инструментов и подстраивается под привычки конкретного пользователя. Исследование, опубликованное на arXiv, показывает критический разрыв между синтетическими тестами и реальной эксплуатацией. Авторы провели проверку популярных бенчмарков по четырем критериям: наличие временных изменений, сохранение состояния, перекрестные ошибки и вариативность профилей. Результат неутешительный: ни один из существующих протоколов не проверяет, как агент справляется с изменениями в динамике. В русскоязычном ML-сообществе при создании сложных агентов разработчики регулярно сталкиваются с этой проблемой, пытаясь адаптировать готовые решения под долгосрочные сценарии. → Проверенные бенчмарки: 0 соответствий полному набору требований из четырех условий → Главная уязвимость: распространение ошибок между компонентами (cross-dimensional failure propagation) → Дата препринта: 20 июля 2026 года В продакшене мы постоянно наступаем на эти грабли: агент отлично проходит тесты на чистом старте, но «сходит с ума» на третий день работы из-за замусоренной памяти или устаревшего конфига. Пора признать, что агент — это не просто большая языковая модель, а сложная система с состоянием. Тестировать её старыми методами — всё равно что проверять надежность СУБД по скорости выполнения одного простого запроса. #LLM #agents #benchmarks #evaluation