Рубрика

Исследования

24 разбора · обновляется ежедневно

RSS
05.09.2026 Исследования

Свежие данные не спасают агентов от устаревших планов

Распределённая команда LLM-агентов может прочитать новейший общий факт r4 и всё равно отправить действие, выведенное из старого требования r3. Планировщик…

arxiv_cs_ai
30.08.2026 Исследования

Управление агентами должно жить в слое данных, а не в коде

В спонсированном EDB материале VentureBeat ставит жёсткий вопрос: если агент попытается выполнить действие без авторизации, что его остановит? Ответ автора —…

venturebeat_ai
29.08.2026 Исследования

Claude Code в автономном режиме обманули в 80% случаев

Исследователь Johann Rehberger показал рабочий вектор атаки на Auto Mode в Claude Code Opus 5: заставить агента скачать zip-архив, распаковать его и выполнить…

simon_willison
26.08.2026 Исследования

Обзор деградации моделей: синтетика без контроля ухудшает качество

Обзорная статья по данным arXiv от 17 июня 2026 года собирает исследования деградации моделей — явления, при котором модели, обучаясь на синтетических данных…

arxiv_cs_ai
24.08.2026 Исследования

Агент Faraday обошёл Opus и GPT-5.5 в воспроизведении исследований

Лондонский стартап Inherent, основанный выходцами из DeepMind, заявляет, что его агент Faraday превзошёл Claude Opus 4.8 и GPT-5.5 в задаче независимого…

techcrunch_ai
22.08.2026 Исследования

Nvidia показала: в агентных задачах обвязка важнее модели

Claude Opus 5 без дополнительной обвязки набрал 30% в интерактивном тесте ARC-AGI-3 — и это был лучший исходный результат среди проверенных моделей. Со…

techcrunch_ai
20.08.2026 Исследования

Оценка агентов по результату скрывает их реальное поведение

Статья на arXiv от 31 мая 2026 года утверждает: ИИ-агентов нужно оценивать как поведенческие системы — через наблюдение за процессом, а не только по итоговому…

arxiv_cs_ai
14.08.2026 Исследования

Зашифрованные цепочки рассуждений вскрыли с помощью слабых моделей того же семейства

Зашифрованные блоки цепочек рассуждений, которые OpenAI, Anthropic и Google возвращают клиентам, можно переиспользовать между сессиями, пользователями и…

simon_willison
13.08.2026 Исследования

DocsChisel повысил успешность LLM-агентов на 95% за счёт адаптивной документации инструментов

Когда агент на основе большой языковой модели ошибается при вызове внешнего API, разработчик обычно винит запрос или саму модель — и почти никогда не смотрит…

arxiv_cs_lg
12.08.2026 Исследования

Эмоции в модели вождения возникают из прогноза будущего, а не из эмпатии

Исследователи расширили модель активного вывода для вождения, добавив аффективные сигналы в виде валентности и возбуждения по циркумплексной модели. В отличие…

arxiv_cs_ai
06.08.2026 Исследования

MCTS превращает генерацию отчётов из таблиц в задачу планирования

Авторы предлагают MCTS-Report — фреймворк, который рассматривает создание мультимодального отчёта (текст + графики) из табличных данных не как сквозную…

arxiv_cs_ai
06.08.2026 Исследования

Orchard от Microsoft — открытая среда, где агенты учатся прямо в боевых harness

Microsoft Research выложила в открытый доступ фреймворк Orchard с ключевым компонентом — Orchard Env, Kubernetes-средой, которая поднимает тысячи…

microsoft_research
06.08.2026 Исследования

VectorRAG и GraphRAG против галлюцинаций LLM в малом бизнесе

Малые и средние предприятия всё чаще внедряют большие языковые модели для поддержки вопросно-ответных систем и принятия решений, но галлюцинации превращают…

arxiv_cs_ai
01.08.2026 Исследования

ABBEL сокращает пиковое число токенов вдвое и учится в 2 раза быстрее саммари-моделей

Cаммаризация контекста в длинных агентных цепочках — компромисс с потерями. Команда BAIR показала это на тесте Combination Lock: модель с саммари учится, но…

bair_blog
28.07.2026 Исследования

FlowEvo учит AI-агентов накапливать навыки и экономить токены вдвое

Большинство современных AI-агентов одноразовы: они строят сложные цепочки рассуждений для конкретной задачи, но полностью забывают успешные паттерны сразу…

arxiv_cs_ai
22.07.2026 Исследования

Как заставить LLM забыть опасные знания: обзор методов

Обзор, опубликованный 23 июня 2026 года, ставит под сомнение главную киберзащитную ставку индустрии — «забывание» нежелательных знаний в больших языковых…

arxiv_cs_lg
20.07.2026 Исследования

Половина компаний пострадала от инцидентов с AI-агентами

Агенты получают доступ к реальным системам и данным, а средства контроля за ними хронически отстают. По данным VentureBeat, опросивших 107 крупных…

venturebeat_ai
17.07.2026 Исследования

Самообучающиеся агенты впервые сведены к единому оператору обновления

Обзор с arXiv, опубликованный 14 июля, формализует самоулучшение агентов как оператор самоиндуцированного обновления — оператор, который по накопленному опыту…

arxiv_cs_ai
12.07.2026 Исследования

Гибридные архитектуры Transformer и Mamba становятся стандартом LLM

Собранный за январь–май список ключевых LLM-статей фиксирует сдвиг, который уже нельзя игнорировать: гибридные архитектуры стали основным направлением, а не…

ahead_of_ai
11.07.2026 Исследования

Microsoft Research открыла Flint — язык визуализации для AI-агентов

Создать действительно аккуратный график — значит помнить о десятке деталей: разбор дат, начальное значение шкалы, формат подписей, цветовая схема, отступы.…

microsoft_research

Дальше — в канале

Здесь 24 разбора — листайте и проверяйте. Новое выходит каждый день и приходит в Telegram первым, со ссылкой на первоисточник.

Подписаться в Telegram