Лента разборов
234 разбора · обновляется ежедневно
Вышла Kimi K3 с открытыми весами и 2.8 трлн параметров
Moonshot AI выпустила Kimi K3 — мультимодальную модель с контекстным окном в миллион токенов, которая, по собственным оценкам компании, уступает только Claude…
OpenAI вырастила LLM-хакера GPT-Red через самоигру моделей
Исследователи OpenAI построили внутреннюю модель GPT-Red, которая автоматизирует красное тестирование — поиск уязвимостей в других LLM. Обучение шло через…
Компания xAI открыла исходный код Grok Build
15 июля xAI выложила под лицензией Apache 2.0 весь код терминального агента Grok Build — через несколько часов после скандала с загрузкой содержимого рабочих…
Самообучающиеся агенты впервые сведены к единому оператору обновления
Обзор с arXiv, опубликованный 14 июля, формализует самоулучшение агентов как оператор самоиндуцированного обновления — оператор, который по накопленному опыту…
Не агенты, а петли и навыки: главные тренды AI Engineering 2026
AI Engineer World's Fair 2026 зафиксировал сдвиг, который зрел три года: инженерия агентов уступила инженерии систем вокруг них. Лилиан Венг из Thinking…
ChatGPT быстро теряет источники цитирования за месяц
Двухмесячный замер выживаемости одних и тех же доменов в ответах ИИ-поисковиков показал, что единой скорости забывания источников не существует. По данным…
Inkling: новая открытая мультимодальная модель на 975 миллиардов параметров
Thinking Machines Lab (Thinky) представила Inkling — первую полностью открытую модель лаборатории под лицензией Apache 2.0. Это смесь экспертов на 975 млрд…
Российские LLM отстают от Sonnet в контексте и коде
Сравнение пяти моделей из одного ценового сегмента — Claude Sonnet 5, Sonnet 4.6, Sonnet 4.5, GigaChat 2 MAX и YandexGPT Pro 5.1 — вскрыло разрыв, который не…
OpenAI предлагает измерять не цену токена, а полезную работу на доллар
Предприятиям пора сменить метрику оценки AI-инвестиций, утверждает OpenAI в новой рекомендации по управлению расходами в агентную эпоху. Вместо сравнения цены…
ИИ ускорил разработку. Почему продакшен стал ломаться чаще
Код, сгенерированный Copilot или Cursor, выглядит аккуратно и проходит тесты — до тех пор, пока в два часа ночи не выясняется, что он тихо ронял часть заказов…
Разбор промптов: почему «сделай красиво» не работает для презентаций
Автор на Habr за два дня до выступления пересобрала презентацию и на практике подтвердила правило, знакомое каждому, кто поручал дизайн одной нейросети:…
Как отследить трафик из нейросетей в Яндекс.Метрике
Разбор на живом счётчике с 634 визитами за 90 дней показывает: метод реферальных доменов физически не видит переходы из ChatGPT и чатового интерфейса Алисы.…
GATS: 100% успех в планировании агентов без единого вызова LLM
Новый фреймворк GATS (Graph-Augmented Tree Search) отказывается от LLM в цикле принятия решений и заменяет их детерминированным поиском с трёхслойной моделью…
Агенты ИИ теряют эффективность на длительных задачах
Исследователи представили Long-Horizon-Terminal-Bench — набор из 46 реальных терминальных задач, требующих от агентов сотен последовательных шагов, отладки и…
Claude Code проверяет палитру скриптом, а форму графика — эвристикой
В начале июля в Claude Code появился встроенный скилл `/dataviz`, и внутри он устроен гораздо интереснее, чем обычный генератор диаграмм. Процедура из семи…
ИИ точно ставит диагнозы, но проваливает дифференциальную диагностику
Два крупных исследования 2026 года показали: языковые модели обходят врачей по точности финального диагноза, но их клиническое мышление не выдерживает…
Fable 5 вернулась, но административный рубильник остался
1 июля Anthropic вернула Fable 5 — спустя 19 дней после того, как 12 июня Министерство торговли США фактически выключило модель по всему миру. Ограничения…
Выбираем лучшую нейросеть для видео 2026
Сравнение пяти генеративных видео-моделей середины 2026 года, которое провели на Habr, показало: явный лидер по качеству — Sora 2 Pro от OpenAI. Она…
Шесть компонентов кодинг-агента: почему обвязка важнее модели
Себастьян Рашка в Ahead of AI разбирает внутреннее устройство кодинг-агентов вроде Claude Code или Codex. Ключевое наблюдение: разница между голой LLM и…
Claude нашёл баг с каскадными внешними ключами в sqlite-utils 4.1.1
12 июля Саймон Уиллисон выпустил точечный патч для своего инструмента — ошибку в `table.transform()` выявил обычный чат с Claude, когда модель отвечала на…
Дальше — в канале
Здесь 234 разбора — листайте и проверяйте. Новое выходит каждый день и приходит в Telegram первым, со ссылкой на первоисточник.
Подписаться в Telegram