Бенчмарки
33 разбора · обновляется ежедневно
Открытая модель Poolside Laguna S 2.1 в конкуренции США и Китая
Poolside, стартап бывшего CTO GitHub, выложил в открытый доступ модель Laguna S 2.1 для агентного программирования. 118 млрд параметров при 8 млрд активных на…
65% продуктовых PR в Anthropic теперь закрывает Claude Tag
Команда Claude Code рассказала Саймону Уиллисону, что их внутренняя Slack-интеграция Claude Tag закрывает 65% всех PR продуктовых инженеров. Агент работает…
DocOCR-Eval: выбор OCR-движка без разметки и аннотаций
Распознавание текста на сканах — базовая операция для извлечения ключевой информации или ответов на вопросы по документу. Но подобрать OCR-движок или…
Cura 1T: медицинская модель с циклом самоэволюции сохранила общие способности
15 июля 2026 года на arXiv появилась статья о Cura 1T — специализированной LLM для здравоохранения, охватывающей консультации пациентов, клинические…
Kimi K3 показала лучший результат в бенчмарке Pelican
Moonshot AI анонсировала самую большую модель в открытом доступе — Kimi K3 на 2.8 триллиона параметров, и сразу выставила ценник уровня закрытых конкурентов.…
Агенты ИИ теряют эффективность на длительных задачах
Исследователи представили Long-Horizon-Terminal-Bench — набор из 46 реальных терминальных задач, требующих от агентов сотен последовательных шагов, отладки и…
GLM-5.2 запустили на ноутбуке с 25 ГБ памяти
Разработчик-одиночка JustVugg выкатил движок Colibri — 1300 строк на чистом C, которые запускают 744-миллиардную GLM-5.2 от Z.ai на ноутбуке с 25 ГБ…
Muse Spark 1.1 вышла с API и заговорила сама с собой
9 июля Meta открыла API для Muse Spark 1.1 — первой модели линейки Spark с публичным доступом. Предыдущая версия, вышедшая в апреле, работала без API. По…
SWE-Bench Pro показал проблемы с надёжностью оценки кода
Новый анализ OpenAI вскрывает проблемы в SWE-Bench Pro — одном из главных бенчмарков для оценки способности моделей решать реальные задачи программной…
Вывод моделей подешевел в 50 раз — узким местом стали системы данных
По данным BAIR, стоимость GPT-4-уровня рухнула с $30 до менее чем $1 за миллион токенов с начала 2023 года, а медианный темп падения цен на вывод моделей —…
GPT-5.6: три модели, ставка на агентные цепочки и спорный бенчмарк
OpenAI выпустила линейку GPT-5.6 — Luna, Terra и Sol — с агрессивным позиционированием для длинных агентных задач. Главный козырь, по данным Simon Willison, —…
Аудит бенчмарков хрупок: пять невидимых сбоев, искажающих выводы
По данным свежего препринта на arXiv, проверки корректности бенчмарков, построенные на пертурбациях, сами страдают от скрытых дефектов. Исследователи провели…
OpenAI представила GeneBench-Pro — бенчмарк ИИ в реальной геномике
OpenAI выпустила GeneBench-Pro — набор тестов, оценивающий модели на комплексных научных данных из биологии, геномики и смежных дисциплин. От обычных…
Дальше — в канале
Здесь 33 разбора — листайте и проверяйте. Новое выходит каждый день и приходит в Telegram первым, со ссылкой на первоисточник.
Подписаться в Telegram