Лента разборов
236 разборов · обновляется ежедневно
Google запустила двойное слепое тестирование ИИ-тестов
27 августа Google DeepMind объявила о пробном запуске первого в мире двойного слепого оценивания закрытой передовой модели — Gemini Flash Lite. По данным…
IBM Granite 4.2: три открытые модели с агентным обучением
IBM открыла веса трёх плотных моделей Granite 4.2 — 3B, 8B и 30B — с явным рассуждением и переключателем между режимами рассуждения и обычной работы. По…
100 ИИ-репозиториев собрали 7,5 млн звёзд: разбираю реальный минимум
7,52 млн звёзд на 100 репозиториев — в среднем 75 тысяч на проект, но верхушка тянет всё на себе. В подборке по данным Habr первые десять репозиториев…
Qwen3.8-Flash-Next: предварительная версия Qwen4 с открытыми весами
Qwen представила мультимодальную MoE-модель с открытыми весами Qwen3.8-Flash-Next, которую позиционирует как раннюю версию архитектуры Qwen4. По данным Simon…
Кто построит персонального ИИ? Новая гонка OpenAI, Apple, Яндекса и Meta
В августе 2026 OpenAI, если верить утечкам, собирает устройство размером с хоккейную шайбу без экрана — но все крупные игроки решают одну задачу: как вывести…
LLM с уверенностью 80% выдают ложные прямые причинные связи
В свежей работе на arXiv проверили 12 дообученных на инструкциях моделей с открытыми весами на шести причинных графах, пяти вариантах формулировки запросов и…
Fable сломала бесплатный апгрейд: инженеры снова выбирают модель под задачу
Drew Breunig описывает сдвиг, который знаком каждому, кто собирал рабочие конвейеры в последние два года: до Fable оптимизировать инструменты для написания…
NVIDIA покупает HuggingFace за $13 млрд — в 80 раз больше выручки
Сделка подтверждена: NVIDIA приобретает HuggingFace за $13 млрд, оценка в 80 раз превышает годовой доход площадки ($150M ARR), а клиентская база за 2026 год…
Чип Jalapeño от OpenAI обходит Blackwell по скорости вывода
На Hot Chips 25 августа OpenAI впервые показала результаты тестирования чипа Jalapeño для вывода моделей. В InferenceX от SemiAnalysis он выдаёт больше…
Агентный ИИ в цепочках поставок: 80% верят, 12% внедрили
По данным Habr, агентная оркестрация сокращает обработку клиентского заказа с двух часов до пары минут. Но Hackett Group фиксирует разрыв: 80% руководителей…
Обзор деградации моделей: синтетика без контроля ухудшает качество
Обзорная статья по данным arXiv от 17 июня 2026 года собирает исследования деградации моделей — явления, при котором модели, обучаясь на синтетических данных…
Профиль GigaChat для Deep Agents: +9,8 пункта и двукратная экономия токенов
Простая задача «переименуй oldname.txt в newname.txt» без профиля заняла у GigaChat-3-Ultra 213 секунд и 80 вызовов инструментов, пока агент не упёрся в лимит…
Обновление llm-anthropic переводит инструмент на httpx2
24 августа 2026 года вышел llm-anthropic 0.27 — обновление плагина для LLM, которое приводит его в соответствие с anthropic v1.0.0. Главное здесь не новые…
KVBoost обходит кэширование префиксов, ускоряя предварительную обработку в 4,5 раза
KVBoost — система повторного использования KV-кэша на уровне блоков для декодеров, совместимых с HuggingFace, описанная в arXiv. В отличие от кэширования…
OpenAI превращает Codex в агента для всех — но цена доверия высока
OpenAI представила ChatGPT Work — агентный слой поверх Codex для офисных сотрудников за $20 в месяц, с доступом к почте, Slack, Notion и Figma. Внутри…
Агенты ломаются на задачах, которые не стоило автоматизировать
На третьем фестивале True Tech Friends от МТС 21 августа обсуждали не абстрактные возможности агентов, а конкретные ошибки внедрения. Участники из «Яндекс…
NVIDIA забирает команду Poolside за $12 млрд, основатели остаются
Сделку на $12 млрд разбирает Latent Space: NVIDIA лицензирует Model Factory и нанимает 109 из примерно 115 технических сотрудников Poolside. Основатели…
Обвязка Hermes и DeepSeek превращает статьи об атаках в доказательства
Автор на Habr собрал агентную обвязку для безопасности ИИ: она читает публикации об уязвимостях, ранжирует их и автоматически воспроизводит атаки в…
Агентам для написания кода нужен не построчный просмотр, а проверка целостности
По данным Simon Willison, ключевой навык продуктивной работы с агентами для написания кода — не чтение каждой строки изменений, а умение уверенно давать…
Агент Faraday обошёл Opus и GPT-5.5 в воспроизведении исследований
Лондонский стартап Inherent, основанный выходцами из DeepMind, заявляет, что его агент Faraday превзошёл Claude Opus 4.8 и GPT-5.5 в задаче независимого…
Дальше — в канале
Здесь 236 разборов — листайте и проверяйте. Новое выходит каждый день и приходит в Telegram первым, со ссылкой на первоисточник.
Подписаться в Telegram