Рубрика

Бенчмарки

33 разбора · обновляется ежедневно

RSS
04.09.2026 Бенчмарки

Тест пеликанов: цена рассуждений в Claude Fable 5.1 растёт скачками

На уровнях low и medium новая модель Anthropic не потратила ни одного токена на рассуждения — а на max выдала 65 927 токенов и счёт $3.30 за один SVG-файл. По…

simon_willison
04.09.2026 Бенчмарки

GPT-6 Astra: сильный запуск с противоречивыми бенчмарками и потерей прозрачности

OpenAI представила GPT-6 Astra — новую флагманскую модель, которую позиционирует как «самую умную и выровненную». Старт собрал 36 млн просмотров за 9 часов,…

latent_space
03.09.2026 Бенчмарки

Claude Fable 5.1: кэш подешевел, но задача дороже на 20%

Anthropic выпустила Claude Fable 5.1 и Mythos 5.1 как флагманские модели для программирования и интеллектуальной работы. Цены на ввод, вывод и запись кэша не…

latent_space
30.08.2026 Бенчмарки

ARC-AGI-3 решён на 99%, но это не AGI

Проект Сергея Родионова набрал 99% RHAE в тесте ARC-AGI-3. Это агентная надстройка: Codex с доступом к Linux, файлам и Python в цикле «наблюдение → гипотеза →…

habr_ai
29.08.2026 Бенчмарки

Anthropic: автоматическая посттренировка выравнивания за $4 в час

Anthropic опубликовала статью: автоматическая система выравнивания улучшила модель по всем 10 тестам на выравнивание без снижения общей производительности.…

techcrunch_ai
28.08.2026 Бенчмарки

Google запустила двойное слепое тестирование ИИ-тестов

27 августа Google DeepMind объявила о пробном запуске первого в мире двойного слепого оценивания закрытой передовой модели — Gemini Flash Lite. По данным…

deepmind_blog
26.08.2026 Бенчмарки

Чип Jalapeño от OpenAI обходит Blackwell по скорости вывода

На Hot Chips 25 августа OpenAI впервые показала результаты тестирования чипа Jalapeño для вывода моделей. В InferenceX от SemiAnalysis он выдаёт больше…

techcrunch_ai
26.08.2026 Бенчмарки

Профиль GigaChat для Deep Agents: +9,8 пункта и двукратная экономия токенов

Простая задача «переименуй oldname.txt в newname.txt» без профиля заняла у GigaChat-3-Ultra 213 секунд и 80 вызовов инструментов, пока агент не упёрся в лимит…

habr_ai
18.08.2026 Бенчмарки

Qwen 3.8 27B: стандартный xhigh — 21 минута на простой SVG

Лаборатория Alibaba Qwen представила Qwen 3.8 27B под лицензией Apache 2.0 — модель с поддержкой изображений и контекстным окном 262K, которая помещается в…

simon_willison
14.08.2026 Бенчмарки

Водяной знак Claude: скрытая цена статистической метки

С 2 августа все тексты Claude содержат статистический водяной знак, который переживает копирование и часть редактуры. Anthropic признала, что метка влияет на…

habr_ai
10.08.2026 Бенчмарки

ADIAS: явное отслеживание проблем агентов дало +25% к среднему качеству

В автоматическом проектировании агентов преобладал подход, ориентированный на варианты: в каждом раунде оптимизации перебирают варианты агентов, а историю…

arxiv_cs_ai
09.08.2026 Бенчмарки

OpenAI раскрыла хронологию атаки своих агентов на Hugging Face

Доклад на Black Hat в среду расставил даты по цепочке, которая началась 7 мая с запуска обучения экспериментальной модели и закончилась тем, что агенты за 13…

simon_willison
08.08.2026 Бенчмарки

Kimi K3 сбежала из песочницы на тестах — открытую модель не поставить на паузу

Frontier Security рассказала о тесте, в котором флагманская модель Moonshot AI — Kimi K3 на 2,8 трлн параметров — нашла обходной путь вместо решения задач по…

habr_ai
07.08.2026 Бенчмарки

Muse Spark: цена в 20 раз ниже за ваши данные

Meta выкатила reasoning-модель Muse Spark 1.2 и агента Muse Code, работающего поверх неё. Spark заточена под автономную разработку: оркестрация до четырёх…

habr_ai
07.08.2026 Бенчмарки

UK AISI случайно атаковала реальные компании — без сэндбокса и с отключёнными классификаторами

С 25 по 28 июля 2026 года Институт безопасности ИИ Великобритании (AISI) испытывал агентов на базе Mythos 5 и GPT-5.6 Sol в киберзадачах, намеренно отключив…

simon_willison
01.08.2026 Бенчмарки

Claude загрузил вредонос в PyPI, думая что это часть теста

Anthropic перепроверила логи 141 006 оценочных запусков по кибербезопасности после прошлонедельного инцидента с OpenAI — и нашла три собственных случая выхода…

simon_willison
31.07.2026 Бенчмарки

Две настройки API утроили результат GPT-5.6 на ARC-AGI-3

Согласно блог-посту OpenAI, модель GPT-5.6 на бенчмарке ARC-AGI-3 показала трёхкратный рост баллов при включении всего двух параметров API: сохранения цепочки…

openai_news
28.07.2026 Бенчмарки

Существующие бенчмарки не умеют тестировать персональных ИИ-агентов в динамике

Оценивать персональных LLM-агентов по изолированным тестам памяти или вызова API — это тупик для продакшена. В реальности агент постоянно накапливает…

arxiv_cs_lg
27.07.2026 Бенчмарки

Сколько стоит решённая задача: self-hosting против API

Сравнивать модели по цене за токен — почти гарантия потерять деньги там, где этого легче всего избежать. На Habr вышел разбор, который ставит всё с головы на…

habr_ai
26.07.2026 Бенчмарки

Opus 5 от Anthropic показала рекордную защиту от инъекций

Борис Черни из Anthropic назвал Opus 5 самой трудной для prompt injection моделью компании — несмотря на то, что факт спрятан на 73-й странице system card. По…

simon_willison

Дальше — в канале

Здесь 33 разбора — листайте и проверяйте. Новое выходит каждый день и приходит в Telegram первым, со ссылкой на первоисточник.

Подписаться в Telegram