Исследования
24 разбора · обновляется ежедневно
Свежие данные не спасают агентов от устаревших планов
Распределённая команда LLM-агентов может прочитать новейший общий факт r4 и всё равно отправить действие, выведенное из старого требования r3. Планировщик…
Управление агентами должно жить в слое данных, а не в коде
В спонсированном EDB материале VentureBeat ставит жёсткий вопрос: если агент попытается выполнить действие без авторизации, что его остановит? Ответ автора —…
Claude Code в автономном режиме обманули в 80% случаев
Исследователь Johann Rehberger показал рабочий вектор атаки на Auto Mode в Claude Code Opus 5: заставить агента скачать zip-архив, распаковать его и выполнить…
Обзор деградации моделей: синтетика без контроля ухудшает качество
Обзорная статья по данным arXiv от 17 июня 2026 года собирает исследования деградации моделей — явления, при котором модели, обучаясь на синтетических данных…
Агент Faraday обошёл Opus и GPT-5.5 в воспроизведении исследований
Лондонский стартап Inherent, основанный выходцами из DeepMind, заявляет, что его агент Faraday превзошёл Claude Opus 4.8 и GPT-5.5 в задаче независимого…
Nvidia показала: в агентных задачах обвязка важнее модели
Claude Opus 5 без дополнительной обвязки набрал 30% в интерактивном тесте ARC-AGI-3 — и это был лучший исходный результат среди проверенных моделей. Со…
Оценка агентов по результату скрывает их реальное поведение
Статья на arXiv от 31 мая 2026 года утверждает: ИИ-агентов нужно оценивать как поведенческие системы — через наблюдение за процессом, а не только по итоговому…
Зашифрованные цепочки рассуждений вскрыли с помощью слабых моделей того же семейства
Зашифрованные блоки цепочек рассуждений, которые OpenAI, Anthropic и Google возвращают клиентам, можно переиспользовать между сессиями, пользователями и…
DocsChisel повысил успешность LLM-агентов на 95% за счёт адаптивной документации инструментов
Когда агент на основе большой языковой модели ошибается при вызове внешнего API, разработчик обычно винит запрос или саму модель — и почти никогда не смотрит…
Эмоции в модели вождения возникают из прогноза будущего, а не из эмпатии
Исследователи расширили модель активного вывода для вождения, добавив аффективные сигналы в виде валентности и возбуждения по циркумплексной модели. В отличие…
MCTS превращает генерацию отчётов из таблиц в задачу планирования
Авторы предлагают MCTS-Report — фреймворк, который рассматривает создание мультимодального отчёта (текст + графики) из табличных данных не как сквозную…
Orchard от Microsoft — открытая среда, где агенты учатся прямо в боевых harness
Microsoft Research выложила в открытый доступ фреймворк Orchard с ключевым компонентом — Orchard Env, Kubernetes-средой, которая поднимает тысячи…
VectorRAG и GraphRAG против галлюцинаций LLM в малом бизнесе
Малые и средние предприятия всё чаще внедряют большие языковые модели для поддержки вопросно-ответных систем и принятия решений, но галлюцинации превращают…
ABBEL сокращает пиковое число токенов вдвое и учится в 2 раза быстрее саммари-моделей
Cаммаризация контекста в длинных агентных цепочках — компромисс с потерями. Команда BAIR показала это на тесте Combination Lock: модель с саммари учится, но…
FlowEvo учит AI-агентов накапливать навыки и экономить токены вдвое
Большинство современных AI-агентов одноразовы: они строят сложные цепочки рассуждений для конкретной задачи, но полностью забывают успешные паттерны сразу…
Как заставить LLM забыть опасные знания: обзор методов
Обзор, опубликованный 23 июня 2026 года, ставит под сомнение главную киберзащитную ставку индустрии — «забывание» нежелательных знаний в больших языковых…
Половина компаний пострадала от инцидентов с AI-агентами
Агенты получают доступ к реальным системам и данным, а средства контроля за ними хронически отстают. По данным VentureBeat, опросивших 107 крупных…
Самообучающиеся агенты впервые сведены к единому оператору обновления
Обзор с arXiv, опубликованный 14 июля, формализует самоулучшение агентов как оператор самоиндуцированного обновления — оператор, который по накопленному опыту…
Гибридные архитектуры Transformer и Mamba становятся стандартом LLM
Собранный за январь–май список ключевых LLM-статей фиксирует сдвиг, который уже нельзя игнорировать: гибридные архитектуры стали основным направлением, а не…
Microsoft Research открыла Flint — язык визуализации для AI-агентов
Создать действительно аккуратный график — значит помнить о десятке деталей: разбор дат, начальное значение шкалы, формат подписей, цветовая схема, отступы.…
Дальше — в канале
Здесь 24 разбора — листайте и проверяйте. Новое выходит каждый день и приходит в Telegram первым, со ссылкой на первоисточник.
Подписаться в Telegram