Релизы моделей
25 разборов · обновляется ежедневно
Flint ломает шаблонное мышление LLM точечной случайностью
🧠 Flint ломает шаблонное мышление LLM точечной случайностью Большие языковые модели на удивление предсказуемы: на просьбу назвать случайное число от 1 до 10…
Фоновые задачи AI-агента сжигали 4,6 млн токенов в день
🛠 Фоновые задачи AI-агента сжигали 4,6 млн токенов в день Разбор утечек в агенте Mickey на OpenClaw показал: основная статья расходов — не сложный анализ, а…
Claude Fable 5 против GPT 5.5 Pro: тест точности
🧠 Claude Fable 5 против GPT 5.5 Pro: тест точности Независимое тестирование на повседневных задачах — от написания браузерных шахмат до анализа 333 тысяч…
Рассуждение помогает моделям вспоминать простые факты — дело не в логике
🧠 Рассуждение помогает моделям вспоминать простые факты — дело не в логике Исследователи Google Research показали, что даже для простых вопросов о фактах без…
SkillOpt: навыки агентов превратили в обучаемые параметры без изменения весов модели
🤖 SkillOpt: навыки агентов превратили в обучаемые параметры без изменения весов модели Агенты на LLM часто ломаются, потому что их инструкции правят вручную,…