Архив

Лента разборов

236 разборов · обновляется ежедневно

RSS
28.08.2026 Бенчмарки

Google запустила двойное слепое тестирование ИИ-тестов

27 августа Google DeepMind объявила о пробном запуске первого в мире двойного слепого оценивания закрытой передовой модели — Gemini Flash Lite. По данным…

deepmind_blog
28.08.2026 Релизы моделей

IBM Granite 4.2: три открытые модели с агентным обучением

IBM открыла веса трёх плотных моделей Granite 4.2 — 3B, 8B и 30B — с явным рассуждением и переключателем между режимами рассуждения и обычной работы. По…

huggingface_blog
28.08.2026 AI-инструменты

100 ИИ-репозиториев собрали 7,5 млн звёзд: разбираю реальный минимум

7,52 млн звёзд на 100 репозиториев — в среднем 75 тысяч на проект, но верхушка тянет всё на себе. В подборке по данным Habr первые десять репозиториев…

habr_ai
27.08.2026 Релизы моделей

Qwen3.8-Flash-Next: предварительная версия Qwen4 с открытыми весами

Qwen представила мультимодальную MoE-модель с открытыми весами Qwen3.8-Flash-Next, которую позиционирует как раннюю версию архитектуры Qwen4. По данным Simon…

simon_willison
27.08.2026 Дайджесты

Кто построит персонального ИИ? Новая гонка OpenAI, Apple, Яндекса и Meta

В августе 2026 OpenAI, если верить утечкам, собирает устройство размером с хоккейную шайбу без экрана — но все крупные игроки решают одну задачу: как вывести…

habr_ai
27.08.2026 Релизы моделей

LLM с уверенностью 80% выдают ложные прямые причинные связи

В свежей работе на arXiv проверили 12 дообученных на инструкциях моделей с открытыми весами на шести причинных графах, пяти вариантах формулировки запросов и…

arxiv_cs_lg
27.08.2026 Релизы моделей

Fable сломала бесплатный апгрейд: инженеры снова выбирают модель под задачу

Drew Breunig описывает сдвиг, который знаком каждому, кто собирал рабочие конвейеры в последние два года: до Fable оптимизировать инструменты для написания…

simon_willison
27.08.2026 Дайджесты

NVIDIA покупает HuggingFace за $13 млрд — в 80 раз больше выручки

Сделка подтверждена: NVIDIA приобретает HuggingFace за $13 млрд, оценка в 80 раз превышает годовой доход площадки ($150M ARR), а клиентская база за 2026 год…

latent_space
26.08.2026 Бенчмарки

Чип Jalapeño от OpenAI обходит Blackwell по скорости вывода

На Hot Chips 25 августа OpenAI впервые показала результаты тестирования чипа Jalapeño для вывода моделей. В InferenceX от SemiAnalysis он выдаёт больше…

techcrunch_ai
26.08.2026 Дайджесты

Агентный ИИ в цепочках поставок: 80% верят, 12% внедрили

По данным Habr, агентная оркестрация сокращает обработку клиентского заказа с двух часов до пары минут. Но Hackett Group фиксирует разрыв: 80% руководителей…

habr_ai
26.08.2026 Исследования

Обзор деградации моделей: синтетика без контроля ухудшает качество

Обзорная статья по данным arXiv от 17 июня 2026 года собирает исследования деградации моделей — явления, при котором модели, обучаясь на синтетических данных…

arxiv_cs_ai
26.08.2026 Бенчмарки

Профиль GigaChat для Deep Agents: +9,8 пункта и двукратная экономия токенов

Простая задача «переименуй oldname.txt в newname.txt» без профиля заняла у GigaChat-3-Ultra 213 секунд и 80 вызовов инструментов, пока агент не упёрся в лимит…

habr_ai
25.08.2026 AI-инструменты

Обновление llm-anthropic переводит инструмент на httpx2

24 августа 2026 года вышел llm-anthropic 0.27 — обновление плагина для LLM, которое приводит его в соответствие с anthropic v1.0.0. Главное здесь не новые…

simon_willison
25.08.2026 Релизы моделей

KVBoost обходит кэширование префиксов, ускоряя предварительную обработку в 4,5 раза

KVBoost — система повторного использования KV-кэша на уровне блоков для декодеров, совместимых с HuggingFace, описанная в arXiv. В отличие от кэширования…

arxiv_cs_ai
25.08.2026 Дайджесты

OpenAI превращает Codex в агента для всех — но цена доверия высока

OpenAI представила ChatGPT Work — агентный слой поверх Codex для офисных сотрудников за $20 в месяц, с доступом к почте, Slack, Notion и Figma. Внутри…

techcrunch_ai
25.08.2026 Дайджесты

Агенты ломаются на задачах, которые не стоило автоматизировать

На третьем фестивале True Tech Friends от МТС 21 августа обсуждали не абстрактные возможности агентов, а конкретные ошибки внедрения. Участники из «Яндекс…

habr_ai
24.08.2026 Дайджесты

NVIDIA забирает команду Poolside за $12 млрд, основатели остаются

Сделку на $12 млрд разбирает Latent Space: NVIDIA лицензирует Model Factory и нанимает 109 из примерно 115 технических сотрудников Poolside. Основатели…

latent_space
24.08.2026 Релизы моделей

Обвязка Hermes и DeepSeek превращает статьи об атаках в доказательства

Автор на Habr собрал агентную обвязку для безопасности ИИ: она читает публикации об уязвимостях, ранжирует их и автоматически воспроизводит атаки в…

habr_ai
24.08.2026 Релизы моделей

Агентам для написания кода нужен не построчный просмотр, а проверка целостности

По данным Simon Willison, ключевой навык продуктивной работы с агентами для написания кода — не чтение каждой строки изменений, а умение уверенно давать…

simon_willison
24.08.2026 Исследования

Агент Faraday обошёл Opus и GPT-5.5 в воспроизведении исследований

Лондонский стартап Inherent, основанный выходцами из DeepMind, заявляет, что его агент Faraday превзошёл Claude Opus 4.8 и GPT-5.5 в задаче независимого…

techcrunch_ai

Дальше — в канале

Здесь 236 разборов — листайте и проверяйте. Новое выходит каждый день и приходит в Telegram первым, со ссылкой на первоисточник.

Подписаться в Telegram