🧠 Дайджест недели: главное в ИИ На этой неделе разговоры об агентах перешли от демо к инженерным деталям: чем измерить надёжность, как не разориться на токенах, где пролегает граница безопасности. Вместо очередной «революции» — набор конкретных проблем и несколько решений, пока на уровне исследований. Исследователи показали, что популярные бенчмарки не оценивают персональных ИИ-агентов в динамике: статические тесты не ловят деградацию при длинных цепочках действий. Разработчикам пока не на что опереться, кроме собственных симуляций, — готовых метрик для агентов нет. Positive Technologies развернула полигон из четырёх атакующих агентов против собственной MaxPatrol O2. Самым опасным оказался HexStrike на базе GLM 5.1 — эксперимент напоминает, что даже защищённые системы уязвимы перед ИИ-атаками, но результаты получены в одной среде и не обязательно воспроизведутся у других. Теневой рынок прокси-токенов — кто-то перепродаёт доступ к API через свои ключи, выставляя счёт конечному разработчику. Для стартапов это прямой удар по бюджету, а для платформ — риск утечки данных; отследить цепочку практически невозможно. FlowEvo предлагает агентам накапливать опыт в виде навыков и переиспользовать их, что снижает расход токенов до двух раз. Пока только на бумаге, но сам подход интересен: вместо того чтобы каждый раз генерировать план с нуля, агент помнит, что уже работало. Kimi K3 заявлена как самая мощная открытая модель с нативной поддержкой инструментов и планирования. Если бенчмарки не приукрашены, разработчики получат конкурентный стек для агентов без замыкания на одно облако — но независимых подтверждений пока нет. То, что LLM не различают источник инструкции, — не баг, а следствие архитектуры без встроенной аутентификации. Для агентов, работающих с конфиденциальными данными, это фундаментальная дыра: любой вложенный промпт может переопределить поведение. Агентная неделя без громких релизов оказалась полезнее иного анонса: вскрылись настоящие ограничения, которые будут определять, взлетят ли агенты в проде или останутся дорогой игрушкой. Особенно выделяется разрыв между демо-возможностями и отсутствием стандартов оценки — пока мы меряем агентов старыми бенчмарками, мы не знаем, что именно покупаем. #ИИ #дайджест #нейросети #агенты #безопасность