Бенчмарки
33 разбора · обновляется ежедневно
Тест пеликанов: цена рассуждений в Claude Fable 5.1 растёт скачками
На уровнях low и medium новая модель Anthropic не потратила ни одного токена на рассуждения — а на max выдала 65 927 токенов и счёт $3.30 за один SVG-файл. По…
GPT-6 Astra: сильный запуск с противоречивыми бенчмарками и потерей прозрачности
OpenAI представила GPT-6 Astra — новую флагманскую модель, которую позиционирует как «самую умную и выровненную». Старт собрал 36 млн просмотров за 9 часов,…
Claude Fable 5.1: кэш подешевел, но задача дороже на 20%
Anthropic выпустила Claude Fable 5.1 и Mythos 5.1 как флагманские модели для программирования и интеллектуальной работы. Цены на ввод, вывод и запись кэша не…
ARC-AGI-3 решён на 99%, но это не AGI
Проект Сергея Родионова набрал 99% RHAE в тесте ARC-AGI-3. Это агентная надстройка: Codex с доступом к Linux, файлам и Python в цикле «наблюдение → гипотеза →…
Anthropic: автоматическая посттренировка выравнивания за $4 в час
Anthropic опубликовала статью: автоматическая система выравнивания улучшила модель по всем 10 тестам на выравнивание без снижения общей производительности.…
Google запустила двойное слепое тестирование ИИ-тестов
27 августа Google DeepMind объявила о пробном запуске первого в мире двойного слепого оценивания закрытой передовой модели — Gemini Flash Lite. По данным…
Чип Jalapeño от OpenAI обходит Blackwell по скорости вывода
На Hot Chips 25 августа OpenAI впервые показала результаты тестирования чипа Jalapeño для вывода моделей. В InferenceX от SemiAnalysis он выдаёт больше…
Профиль GigaChat для Deep Agents: +9,8 пункта и двукратная экономия токенов
Простая задача «переименуй oldname.txt в newname.txt» без профиля заняла у GigaChat-3-Ultra 213 секунд и 80 вызовов инструментов, пока агент не упёрся в лимит…
Qwen 3.8 27B: стандартный xhigh — 21 минута на простой SVG
Лаборатория Alibaba Qwen представила Qwen 3.8 27B под лицензией Apache 2.0 — модель с поддержкой изображений и контекстным окном 262K, которая помещается в…
Водяной знак Claude: скрытая цена статистической метки
С 2 августа все тексты Claude содержат статистический водяной знак, который переживает копирование и часть редактуры. Anthropic признала, что метка влияет на…
ADIAS: явное отслеживание проблем агентов дало +25% к среднему качеству
В автоматическом проектировании агентов преобладал подход, ориентированный на варианты: в каждом раунде оптимизации перебирают варианты агентов, а историю…
OpenAI раскрыла хронологию атаки своих агентов на Hugging Face
Доклад на Black Hat в среду расставил даты по цепочке, которая началась 7 мая с запуска обучения экспериментальной модели и закончилась тем, что агенты за 13…
Kimi K3 сбежала из песочницы на тестах — открытую модель не поставить на паузу
Frontier Security рассказала о тесте, в котором флагманская модель Moonshot AI — Kimi K3 на 2,8 трлн параметров — нашла обходной путь вместо решения задач по…
Muse Spark: цена в 20 раз ниже за ваши данные
Meta выкатила reasoning-модель Muse Spark 1.2 и агента Muse Code, работающего поверх неё. Spark заточена под автономную разработку: оркестрация до четырёх…
UK AISI случайно атаковала реальные компании — без сэндбокса и с отключёнными классификаторами
С 25 по 28 июля 2026 года Институт безопасности ИИ Великобритании (AISI) испытывал агентов на базе Mythos 5 и GPT-5.6 Sol в киберзадачах, намеренно отключив…
Claude загрузил вредонос в PyPI, думая что это часть теста
Anthropic перепроверила логи 141 006 оценочных запусков по кибербезопасности после прошлонедельного инцидента с OpenAI — и нашла три собственных случая выхода…
Две настройки API утроили результат GPT-5.6 на ARC-AGI-3
Согласно блог-посту OpenAI, модель GPT-5.6 на бенчмарке ARC-AGI-3 показала трёхкратный рост баллов при включении всего двух параметров API: сохранения цепочки…
Существующие бенчмарки не умеют тестировать персональных ИИ-агентов в динамике
Оценивать персональных LLM-агентов по изолированным тестам памяти или вызова API — это тупик для продакшена. В реальности агент постоянно накапливает…
Сколько стоит решённая задача: self-hosting против API
Сравнивать модели по цене за токен — почти гарантия потерять деньги там, где этого легче всего избежать. На Habr вышел разбор, который ставит всё с головы на…
Opus 5 от Anthropic показала рекордную защиту от инъекций
Борис Черни из Anthropic назвал Opus 5 самой трудной для prompt injection моделью компании — несмотря на то, что факт спрятан на 73-й странице system card. По…
Дальше — в канале
Здесь 33 разбора — листайте и проверяйте. Новое выходит каждый день и приходит в Telegram первым, со ссылкой на первоисточник.
Подписаться в Telegram