Бенчмарки
13 разборов · обновляется ежедневно
Открытая модель Poolside Laguna S 2.1 в конкуренции США и Китая
🚀 Открытая модель Poolside Laguna S 2.1 в конкуренции США и Китая Poolside, стартап бывшего CTO GitHub, выложил в открытый доступ модель Laguna S 2.1 для…
65% продуктовых PR в Anthropic теперь закрывает Claude Tag
🛠 65% продуктовых PR в Anthropic теперь закрывает Claude Tag Команда Claude Code рассказала Саймону Уиллисону, что их внутренняя Slack-интеграция Claude Tag…
DocOCR-Eval: выбор OCR-движка без разметки и аннотаций
📊 DocOCR-Eval: выбор OCR-движка без разметки и аннотаций Распознавание текста на сканах — базовая операция для извлечения ключевой информации или ответов на…
Cura 1T: медицинская модель с циклом самоэволюции сохранила общие способности
🧠 Cura 1T: медицинская модель с циклом самоэволюции сохранила общие способности 15 июля 2026 года на arXiv появилась статья о Cura 1T — специализированной LLM…
Kimi K3 показала лучший результат в бенчмарке Pelican
🚀 Kimi K3 показала лучший результат в бенчмарке Pelican Moonshot AI анонсировала самую большую модель в открытом доступе — Kimi K3 на 2.8 триллиона…
Агенты ИИ теряют эффективность на длительных задачах
📊 Агенты ИИ теряют эффективность на длительных задачах Исследователи представили Long-Horizon-Terminal-Bench — набор из 46 реальных терминальных задач,…
GLM-5.2 запустили на ноутбуке с 25 ГБ памяти
🛠 GLM-5.2 запустили на ноутбуке с 25 ГБ памяти Разработчик-одиночка JustVugg выкатил движок Colibri — 1300 строк на чистом C, которые запускают…
Muse Spark 1.1 вышла с API и заговорила сама с собой
🚀 Muse Spark 1.1 вышла с API и заговорила сама с собой 9 июля Meta открыла API для Muse Spark 1.1 — первой модели линейки Spark с публичным доступом.…
SWE-Bench Pro показал проблемы с надёжностью оценки кода
📊 SWE-Bench Pro показал проблемы с надёжностью оценки кода Новый анализ OpenAI вскрывает проблемы в SWE-Bench Pro — одном из главных бенчмарков для оценки…
Вывод моделей подешевел в 50 раз — узким местом стали системы данных
🧠 Вывод моделей подешевел в 50 раз — узким местом стали системы данных По данным BAIR, стоимость GPT-4-уровня рухнула с $30 до менее чем $1 за миллион токенов…
GPT-5.6: три модели, ставка на агентные цепочки и спорный бенчмарк
🚀 GPT-5.6: три модели, ставка на агентные цепочки и спорный бенчмарк OpenAI выпустила линейку GPT-5.6 — Luna, Terra и Sol — с агрессивным позиционированием…
Аудит бенчмарков хрупок: пять невидимых сбоев, искажающих выводы
🧠 Аудит бенчмарков хрупок: пять невидимых сбоев, искажающих выводы По данным свежего препринта на arXiv, проверки корректности бенчмарков, построенные на…
OpenAI представила GeneBench-Pro — бенчмарк ИИ в реальной геномике
📊 OpenAI представила GeneBench-Pro — бенчмарк ИИ в реальной геномике OpenAI выпустила GeneBench-Pro — набор тестов, оценивающий модели на комплексных научных…