Архив

Лента разборов

234 разбора · обновляется ежедневно

RSS
18.07.2026 Релизы моделей

Вышла Kimi K3 с открытыми весами и 2.8 трлн параметров

Moonshot AI выпустила Kimi K3 — мультимодальную модель с контекстным окном в миллион токенов, которая, по собственным оценкам компании, уступает только Claude…

habr_ai
18.07.2026 Релизы моделей

OpenAI вырастила LLM-хакера GPT-Red через самоигру моделей

Исследователи OpenAI построили внутреннюю модель GPT-Red, которая автоматизирует красное тестирование — поиск уязвимостей в других LLM. Обучение шло через…

mit_tech_review_ai
17.07.2026 AI-инструменты

Компания xAI открыла исходный код Grok Build

15 июля xAI выложила под лицензией Apache 2.0 весь код терминального агента Grok Build — через несколько часов после скандала с загрузкой содержимого рабочих…

simon_willison
17.07.2026 Исследования

Самообучающиеся агенты впервые сведены к единому оператору обновления

Обзор с arXiv, опубликованный 14 июля, формализует самоулучшение агентов как оператор самоиндуцированного обновления — оператор, который по накопленному опыту…

arxiv_cs_ai
17.07.2026 Дайджесты

Не агенты, а петли и навыки: главные тренды AI Engineering 2026

AI Engineer World's Fair 2026 зафиксировал сдвиг, который зрел три года: инженерия агентов уступила инженерии систем вокруг них. Лилиан Венг из Thinking…

latent_space
17.07.2026 Дайджесты

ChatGPT быстро теряет источники цитирования за месяц

Двухмесячный замер выживаемости одних и тех же доменов в ответах ИИ-поисковиков показал, что единой скорости забывания источников не существует. По данным…

habr_ai
16.07.2026 Релизы моделей

Inkling: новая открытая мультимодальная модель на 975 миллиардов параметров

Thinking Machines Lab (Thinky) представила Inkling — первую полностью открытую модель лаборатории под лицензией Apache 2.0. Это смесь экспертов на 975 млрд…

latent_space
16.07.2026 Релизы моделей

Российские LLM отстают от Sonnet в контексте и коде

Сравнение пяти моделей из одного ценового сегмента — Claude Sonnet 5, Sonnet 4.6, Sonnet 4.5, GigaChat 2 MAX и YandexGPT Pro 5.1 — вскрыло разрыв, который не…

habr_ai
16.07.2026 Рынок и инвестиции

OpenAI предлагает измерять не цену токена, а полезную работу на доллар

Предприятиям пора сменить метрику оценки AI-инвестиций, утверждает OpenAI в новой рекомендации по управлению расходами в агентную эпоху. Вместо сравнения цены…

openai_news
16.07.2026 Дайджесты

ИИ ускорил разработку. Почему продакшен стал ломаться чаще

Код, сгенерированный Copilot или Cursor, выглядит аккуратно и проходит тесты — до тех пор, пока в два часа ночи не выясняется, что он тихо ронял часть заказов…

habr_ai
16.07.2026 Дайджесты

Разбор промптов: почему «сделай красиво» не работает для презентаций

Автор на Habr за два дня до выступления пересобрала презентацию и на практике подтвердила правило, знакомое каждому, кто поручал дизайн одной нейросети:…

habr_ai
15.07.2026 Рынок и инвестиции

Как отследить трафик из нейросетей в Яндекс.Метрике

Разбор на живом счётчике с 634 визитами за 90 дней показывает: метод реферальных доменов физически не видит переходы из ChatGPT и чатового интерфейса Алисы.…

habr_ai
15.07.2026 Релизы моделей

GATS: 100% успех в планировании агентов без единого вызова LLM

Новый фреймворк GATS (Graph-Augmented Tree Search) отказывается от LLM в цикле принятия решений и заменяет их детерминированным поиском с трёхслойной моделью…

arxiv_cs_ai
15.07.2026 Бенчмарки

Агенты ИИ теряют эффективность на длительных задачах

Исследователи представили Long-Horizon-Terminal-Bench — набор из 46 реальных терминальных задач, требующих от агентов сотен последовательных шагов, отладки и…

arxiv_cs_ai
15.07.2026 Релизы моделей

Claude Code проверяет палитру скриптом, а форму графика — эвристикой

В начале июля в Claude Code появился встроенный скилл `/dataviz`, и внутри он устроен гораздо интереснее, чем обычный генератор диаграмм. Процедура из семи…

habr_ai
14.07.2026 Дайджесты

ИИ точно ставит диагнозы, но проваливает дифференциальную диагностику

Два крупных исследования 2026 года показали: языковые модели обходят врачей по точности финального диагноза, но их клиническое мышление не выдерживает…

habr_ai
14.07.2026 Релизы моделей

Fable 5 вернулась, но административный рубильник остался

1 июля Anthropic вернула Fable 5 — спустя 19 дней после того, как 12 июня Министерство торговли США фактически выключило модель по всему миру. Ограничения…

habr_ai
14.07.2026 Дайджесты

Выбираем лучшую нейросеть для видео 2026

Сравнение пяти генеративных видео-моделей середины 2026 года, которое провели на Habr, показало: явный лидер по качеству — Sora 2 Pro от OpenAI. Она…

habr_ai
14.07.2026 Релизы моделей

Шесть компонентов кодинг-агента: почему обвязка важнее модели

Себастьян Рашка в Ahead of AI разбирает внутреннее устройство кодинг-агентов вроде Claude Code или Codex. Ключевое наблюдение: разница между голой LLM и…

ahead_of_ai
13.07.2026 AI-инструменты

Claude нашёл баг с каскадными внешними ключами в sqlite-utils 4.1.1

12 июля Саймон Уиллисон выпустил точечный патч для своего инструмента — ошибку в `table.transform()` выявил обычный чат с Claude, когда модель отвечала на…

simon_willison

Дальше — в канале

Здесь 234 разбора — листайте и проверяйте. Новое выходит каждый день и приходит в Telegram первым, со ссылкой на первоисточник.

Подписаться в Telegram