Лента разборов
234 разбора · обновляется ежедневно
Flint ломает шаблонное мышление LLM точечной случайностью
Большие языковые модели на удивление предсказуемы: на просьбу назвать случайное число от 1 до 10 почти всегда отвечают «7», а слоган для кроссовок New Balance…
Prompt-to-Paper пишет биоинформатические статьи с реальными экспериментами за $0.31
Новый препринт на arXiv описывает систему автоматической генерации научных рукописей, которая не просто компилирует текст из большой языковой модели, а…
Промпт-дизайн сделал 2B-модель эффективнее 4B как ассистента RL-агента
Исследователи изучили, почему небольшие языковые модели проваливаются при попытке направлять обучение агента в частично наблюдаемых средах. Наивное включение…
Фоновые задачи AI-агента сжигали 4,6 млн токенов в день
Разбор утечек в агенте Mickey на OpenClaw показал: основная статья расходов — не сложный анализ, а раздутая обвязка. Cron-задачам выдавались все 200+…
iFLYTEK создала единую модель для управления роботами
iFLYTEK выложила технический отчёт Embodied-Omni — унифицированной мультимодальной модели, которая совместно обрабатывает видео, язык и действия. Ключевой…
Claude Fable 5 против GPT 5.5 Pro: тест точности
Независимое тестирование на повседневных задачах — от написания браузерных шахмат до анализа 333 тысяч символов романа «Убийство в Восточном экспрессе» —…
Аудит бенчмарков хрупок: пять невидимых сбоев, искажающих выводы
По данным свежего препринта на arXiv, проверки корректности бенчмарков, построенные на пертурбациях, сами страдают от скрытых дефектов. Исследователи провели…
Рассуждение помогает моделям вспоминать простые факты — дело не в логике
Исследователи Google Research показали, что даже для простых вопросов о фактах без многоходовых логических шагов включение цепочки рассуждений (CoT)…
OpenAI представила GeneBench-Pro — бенчмарк ИИ в реальной геномике
OpenAI выпустила GeneBench-Pro — набор тестов, оценивающий модели на комплексных научных данных из биологии, геномики и смежных дисциплин. От обычных…
Бесплатный Goose заменит Claude Code за $200/мес
Claude Code от Anthropic — терминальный AI-агент, который автономно пишет, отлаживает и развертывает код. Инструмент быстро стал популярным, но ценник…
Memora: агенты получают память на месяцы, сокращая контекст на 98%
Сегодняшние LLM-агенты не помнят прошлых сессий: им приходится либо перечитывать весь диалог с нуля, либо терять детали при сжатии. Попытки совместить полноту…
SkillOpt: навыки агентов превратили в обучаемые параметры без изменения весов модели
Агенты на LLM часто ломаются, потому что их инструкции правят вручную, без гарантий улучшения. Microsoft Research предложила SkillOpt — метод, который…
Mistral AI привлекает инвестиции для европейской платформы ИИ
Французский AI-единорог отказался от лобовой гонки с ChatGPT. Вместо «убийцы OpenAI» Mistral превращается в сервисную машину по модели Palantir: инженеры,…
Google будет контролировать ИИ-агентов как потенциальных инсайдеров
Защита строится вокруг жёсткого допущения: даже обученный на alignment агент может повести себя непредсказуемо. Roadmap добавляет системный слой контроля…
Дальше — в канале
Здесь 234 разбора — листайте и проверяйте. Новое выходит каждый день и приходит в Telegram первым, со ссылкой на первоисточник.
Подписаться в Telegram