Рубрика

Бенчмарки

13 разборов · обновляется ежедневно

RSS
24.07.2026 Бенчмарки

Открытая модель Poolside Laguna S 2.1 в конкуренции США и Китая

🚀 Открытая модель Poolside Laguna S 2.1 в конкуренции США и Китая Poolside, стартап бывшего CTO GitHub, выложил в открытый доступ модель Laguna S 2.1 для…

habr_ai
23.07.2026 Бенчмарки

65% продуктовых PR в Anthropic теперь закрывает Claude Tag

🛠 65% продуктовых PR в Anthropic теперь закрывает Claude Tag Команда Claude Code рассказала Саймону Уиллисону, что их внутренняя Slack-интеграция Claude Tag…

simon_willison
21.07.2026 Бенчмарки

DocOCR-Eval: выбор OCR-движка без разметки и аннотаций

📊 DocOCR-Eval: выбор OCR-движка без разметки и аннотаций Распознавание текста на сканах — базовая операция для извлечения ключевой информации или ответов на…

arxiv_cs_lg
20.07.2026 Бенчмарки

Cura 1T: медицинская модель с циклом самоэволюции сохранила общие способности

🧠 Cura 1T: медицинская модель с циклом самоэволюции сохранила общие способности 15 июля 2026 года на arXiv появилась статья о Cura 1T — специализированной LLM…

arxiv_cs_ai
18.07.2026 Бенчмарки

Kimi K3 показала лучший результат в бенчмарке Pelican

🚀 Kimi K3 показала лучший результат в бенчмарке Pelican Moonshot AI анонсировала самую большую модель в открытом доступе — Kimi K3 на 2.8 триллиона…

simon_willison
15.07.2026 Бенчмарки

Агенты ИИ теряют эффективность на длительных задачах

📊 Агенты ИИ теряют эффективность на длительных задачах Исследователи представили Long-Horizon-Terminal-Bench — набор из 46 реальных терминальных задач,…

arxiv_cs_ai
13.07.2026 Бенчмарки

GLM-5.2 запустили на ноутбуке с 25 ГБ памяти

🛠 GLM-5.2 запустили на ноутбуке с 25 ГБ памяти Разработчик-одиночка JustVugg выкатил движок Colibri — 1300 строк на чистом C, которые запускают…

habr_ai
12.07.2026 Бенчмарки

Muse Spark 1.1 вышла с API и заговорила сама с собой

🚀 Muse Spark 1.1 вышла с API и заговорила сама с собой 9 июля Meta открыла API для Muse Spark 1.1 — первой модели линейки Spark с публичным доступом.…

simon_willison
11.07.2026 Бенчмарки

SWE-Bench Pro показал проблемы с надёжностью оценки кода

📊 SWE-Bench Pro показал проблемы с надёжностью оценки кода Новый анализ OpenAI вскрывает проблемы в SWE-Bench Pro — одном из главных бенчмарков для оценки…

openai_news
10.07.2026 Бенчмарки

Вывод моделей подешевел в 50 раз — узким местом стали системы данных

🧠 Вывод моделей подешевел в 50 раз — узким местом стали системы данных По данным BAIR, стоимость GPT-4-уровня рухнула с $30 до менее чем $1 за миллион токенов…

bair_blog
10.07.2026 Бенчмарки

GPT-5.6: три модели, ставка на агентные цепочки и спорный бенчмарк

🚀 GPT-5.6: три модели, ставка на агентные цепочки и спорный бенчмарк OpenAI выпустила линейку GPT-5.6 — Luna, Terra и Sol — с агрессивным позиционированием…

simon_willison
07.07.2026 Бенчмарки

Аудит бенчмарков хрупок: пять невидимых сбоев, искажающих выводы

🧠 Аудит бенчмарков хрупок: пять невидимых сбоев, искажающих выводы По данным свежего препринта на arXiv, проверки корректности бенчмарков, построенные на…

arxiv_cs_lg
07.07.2026 Бенчмарки

OpenAI представила GeneBench-Pro — бенчмарк ИИ в реальной геномике

📊 OpenAI представила GeneBench-Pro — бенчмарк ИИ в реальной геномике OpenAI выпустила GeneBench-Pro — набор тестов, оценивающий модели на комплексных научных…

openai_news