Рубрика

Бенчмарки

33 разбора · обновляется ежедневно

RSS
24.07.2026 Бенчмарки

Открытая модель Poolside Laguna S 2.1 в конкуренции США и Китая

Poolside, стартап бывшего CTO GitHub, выложил в открытый доступ модель Laguna S 2.1 для агентного программирования. 118 млрд параметров при 8 млрд активных на…

habr_ai
23.07.2026 Бенчмарки

65% продуктовых PR в Anthropic теперь закрывает Claude Tag

Команда Claude Code рассказала Саймону Уиллисону, что их внутренняя Slack-интеграция Claude Tag закрывает 65% всех PR продуктовых инженеров. Агент работает…

simon_willison
21.07.2026 Бенчмарки

DocOCR-Eval: выбор OCR-движка без разметки и аннотаций

Распознавание текста на сканах — базовая операция для извлечения ключевой информации или ответов на вопросы по документу. Но подобрать OCR-движок или…

arxiv_cs_lg
20.07.2026 Бенчмарки

Cura 1T: медицинская модель с циклом самоэволюции сохранила общие способности

15 июля 2026 года на arXiv появилась статья о Cura 1T — специализированной LLM для здравоохранения, охватывающей консультации пациентов, клинические…

arxiv_cs_ai
18.07.2026 Бенчмарки

Kimi K3 показала лучший результат в бенчмарке Pelican

Moonshot AI анонсировала самую большую модель в открытом доступе — Kimi K3 на 2.8 триллиона параметров, и сразу выставила ценник уровня закрытых конкурентов.…

simon_willison
15.07.2026 Бенчмарки

Агенты ИИ теряют эффективность на длительных задачах

Исследователи представили Long-Horizon-Terminal-Bench — набор из 46 реальных терминальных задач, требующих от агентов сотен последовательных шагов, отладки и…

arxiv_cs_ai
13.07.2026 Бенчмарки

GLM-5.2 запустили на ноутбуке с 25 ГБ памяти

Разработчик-одиночка JustVugg выкатил движок Colibri — 1300 строк на чистом C, которые запускают 744-миллиардную GLM-5.2 от Z.ai на ноутбуке с 25 ГБ…

habr_ai
12.07.2026 Бенчмарки

Muse Spark 1.1 вышла с API и заговорила сама с собой

9 июля Meta открыла API для Muse Spark 1.1 — первой модели линейки Spark с публичным доступом. Предыдущая версия, вышедшая в апреле, работала без API. По…

simon_willison
11.07.2026 Бенчмарки

SWE-Bench Pro показал проблемы с надёжностью оценки кода

Новый анализ OpenAI вскрывает проблемы в SWE-Bench Pro — одном из главных бенчмарков для оценки способности моделей решать реальные задачи программной…

openai_news
10.07.2026 Бенчмарки

Вывод моделей подешевел в 50 раз — узким местом стали системы данных

По данным BAIR, стоимость GPT-4-уровня рухнула с $30 до менее чем $1 за миллион токенов с начала 2023 года, а медианный темп падения цен на вывод моделей —…

bair_blog
10.07.2026 Бенчмарки

GPT-5.6: три модели, ставка на агентные цепочки и спорный бенчмарк

OpenAI выпустила линейку GPT-5.6 — Luna, Terra и Sol — с агрессивным позиционированием для длинных агентных задач. Главный козырь, по данным Simon Willison, —…

simon_willison
07.07.2026 Бенчмарки

Аудит бенчмарков хрупок: пять невидимых сбоев, искажающих выводы

По данным свежего препринта на arXiv, проверки корректности бенчмарков, построенные на пертурбациях, сами страдают от скрытых дефектов. Исследователи провели…

arxiv_cs_lg
07.07.2026 Бенчмарки

OpenAI представила GeneBench-Pro — бенчмарк ИИ в реальной геномике

OpenAI выпустила GeneBench-Pro — набор тестов, оценивающий модели на комплексных научных данных из биологии, геномики и смежных дисциплин. От обычных…

openai_news

Дальше — в канале

Здесь 33 разбора — листайте и проверяйте. Новое выходит каждый день и приходит в Telegram первым, со ссылкой на первоисточник.

Подписаться в Telegram