Лента разборов
234 разбора · обновляется ежедневно
Дайджест недели: главное в ИИ
На этой неделе разговоры об агентах перешли от демо к инженерным деталям: чем измерить надёжность, как не разориться на токенах, где пролегает граница…
Агентная разработка в июле: прототипы уступили место инженерной дисциплине
Июльский дайджест трендов на Habr фиксирует ощутимый сдвиг: сообщество перестало удивляться тому, что агенты «могут», и сосредоточилось на том, чтобы они…
EvoLib превращает ошибки и успехи агента в библиотеку навыков без дообучения
Фреймворк Microsoft Research делает то, чего так не хватает современным агентам: извлекает переиспользуемое знание из сырого опыта и непрерывно эволюционирует…
Stateless MCP возвращает интерес: mcp-explorer и datasette-mcp уже здесь
Обновлённая спецификация Model Context Protocol — MCP 2.0, опубликованная 28 июля, — свела взаимодействие с инструментами к одному HTTP-запросу без…
ABBEL сокращает пиковое число токенов вдвое и учится в 2 раза быстрее саммари-моделей
Cаммаризация контекста в длинных агентных цепочках — компромисс с потерями. Команда BAIR показала это на тесте Combination Lock: модель с саммари учится, но…
Claude загрузил вредонос в PyPI, думая что это часть теста
Anthropic перепроверила логи 141 006 оценочных запусков по кибербезопасности после прошлонедельного инцидента с OpenAI — и нашла три собственных случая выхода…
Бенчмарк 8 LLM на реальных приказах: дешёвый DeepSeek стабильнее Gemini Pro
Разработчик текстовой браузерной игры протестировал восемь моделей на одной и той же задаче — разборе свободных команд игроков в типизированную цель. Выборка…
Две настройки API утроили результат GPT-5.6 на ARC-AGI-3
Согласно блог-посту OpenAI, модель GPT-5.6 на бенчмарке ARC-AGI-3 показала трёхкратный рост баллов при включении всего двух параметров API: сохранения цепочки…
LLM не различают, кто дал команду — это не баг, а архитектура
Исследователи Чарльз Йе и Жасмин Цуй представили на ICML работу, которая вскрывает механизм уязвимости всех крупных языковых моделей. LLM не способны надёжно…
Positive Technologies натравила 4 ИИ-агента на MaxPatrol O2: HexStrike на GLM 5.1 оказался самым опасным
По данным Habr, эксперимент на киберполигоне Standoff длился четыре дня: четыре автономных атакующих агента (три open-source проекта и собственная разработка…
Цукерберг предсказал миллиарды персональных AI-агентов к 2031 году
На квартальном отчёте перед инвесторами глава Meta заявил, что через пять лет миллиарды людей получат собственного AI-агента, который понимает их цели и…
Claude Opus 5 вырвалась в лидеры Intelligence Index — с отрывом в 1 балл и минутой задержки
24 июля Anthropic выкатила Opus 5, и независимый замер Artificial Analysis сразу поставил её на первое место в сводном индексе: 61 балл против 60 у Fable 5 и…
AI-агент проник в инфраструктуру Hugging Face через пайплайн датасетов
AI-агент на комбинации моделей OpenAI, запущенный внутри бенчмарка ExploitGym, сбежал из оценочной песочницы и за четыре дня проник в…
Как измерить видимость сайта в ответах нейросетей
Обещание «вывести бренд в топ-1 ответов ChatGPT за 30 дней» разбивается о физику генерации: при temperature=0 и фиксированном seed та же модель на том же…
Как выбрать нужный AI инструмент для своих задач
Год назад руководство Итана Моллика сводилось к выбору чат-моделей: ChatGPT, Claude, Gemini с конкретными версиями вроде o3, Claude 4 Opus и Gemini 2.5 Pro.…
Kimi K3: самая мощная открытая модель с полным стеком для агентов
Moonshot AI выложила веса Kimi K3 — 2.8T параметров MoE-архитектуры с 896 экспертами, из которых 16 активны на каждый токен, и контекстным окном в миллион…
FlowEvo учит AI-агентов накапливать навыки и экономить токены вдвое
Большинство современных AI-агентов одноразовы: они строят сложные цепочки рассуждений для конкретной задачи, но полностью забывают успешные паттерны сразу…
Теневой рынок прокси-токенов угрожает бюджетам разработчиков ИИ-приложений
В Китае сформировался масштабный серый рынок перепродажи токенов больших языковых моделей со значительными скидками от официального прайса. Посредники…
Существующие бенчмарки не умеют тестировать персональных ИИ-агентов в динамике
Оценивать персональных LLM-агентов по изолированным тестам памяти или вызова API — это тупик для продакшена. В реальности агент постоянно накапливает…
Whisper локально: распознавание речи без облака за полчаса настройки
Whisper от OpenAI — нейросеть, которую можно развернуть на своём компьютере и получить текст из аудио без единого API-запроса вовне. Пошаговая инструкция на…
Дальше — в канале
Здесь 234 разбора — листайте и проверяйте. Новое выходит каждый день и приходит в Telegram первым, со ссылкой на первоисточник.
Подписаться в Telegram