Архив

Лента разборов

234 разбора · обновляется ежедневно

RSS
09.07.2026 Релизы моделей

Flint ломает шаблонное мышление LLM точечной случайностью

Большие языковые модели на удивление предсказуемы: на просьбу назвать случайное число от 1 до 10 почти всегда отвечают «7», а слоган для кроссовок New Balance…

mit_tech_review_ai
09.07.2026 Исследования

Prompt-to-Paper пишет биоинформатические статьи с реальными экспериментами за $0.31

Новый препринт на arXiv описывает систему автоматической генерации научных рукописей, которая не просто компилирует текст из большой языковой модели, а…

arxiv_cs_ai
08.07.2026 Исследования

Промпт-дизайн сделал 2B-модель эффективнее 4B как ассистента RL-агента

Исследователи изучили, почему небольшие языковые модели проваливаются при попытке направлять обучение агента в частично наблюдаемых средах. Наивное включение…

arxiv_cs_ai
08.07.2026 Релизы моделей

Фоновые задачи AI-агента сжигали 4,6 млн токенов в день

Разбор утечек в агенте Mickey на OpenClaw показал: основная статья расходов — не сложный анализ, а раздутая обвязка. Cron-задачам выдавались все 200+…

habr_ai
08.07.2026 Исследования

iFLYTEK создала единую модель для управления роботами

iFLYTEK выложила технический отчёт Embodied-Omni — унифицированной мультимодальной модели, которая совместно обрабатывает видео, язык и действия. Ключевой…

arxiv_cs_ai
08.07.2026 Релизы моделей

Claude Fable 5 против GPT 5.5 Pro: тест точности

Независимое тестирование на повседневных задачах — от написания браузерных шахмат до анализа 333 тысяч символов романа «Убийство в Восточном экспрессе» —…

habr_ai
07.07.2026 Бенчмарки

Аудит бенчмарков хрупок: пять невидимых сбоев, искажающих выводы

По данным свежего препринта на arXiv, проверки корректности бенчмарков, построенные на пертурбациях, сами страдают от скрытых дефектов. Исследователи провели…

arxiv_cs_lg
07.07.2026 Релизы моделей

Рассуждение помогает моделям вспоминать простые факты — дело не в логике

Исследователи Google Research показали, что даже для простых вопросов о фактах без многоходовых логических шагов включение цепочки рассуждений (CoT)…

google_research
07.07.2026 Бенчмарки

OpenAI представила GeneBench-Pro — бенчмарк ИИ в реальной геномике

OpenAI выпустила GeneBench-Pro — набор тестов, оценивающий модели на комплексных научных данных из биологии, геномики и смежных дисциплин. От обычных…

openai_news
07.07.2026 Дайджесты

Бесплатный Goose заменит Claude Code за $200/мес

Claude Code от Anthropic — терминальный AI-агент, который автономно пишет, отлаживает и развертывает код. Инструмент быстро стал популярным, но ценник…

venturebeat_ai
07.07.2026 Исследования

Memora: агенты получают память на месяцы, сокращая контекст на 98%

Сегодняшние LLM-агенты не помнят прошлых сессий: им приходится либо перечитывать весь диалог с нуля, либо терять детали при сжатии. Попытки совместить полноту…

microsoft_research
06.07.2026 Релизы моделей

SkillOpt: навыки агентов превратили в обучаемые параметры без изменения весов модели

Агенты на LLM часто ломаются, потому что их инструкции правят вручную, без гарантий улучшения. Microsoft Research предложила SkillOpt — метод, который…

microsoft_research
06.07.2026 Рынок и инвестиции

Mistral AI привлекает инвестиции для европейской платформы ИИ

Французский AI-единорог отказался от лобовой гонки с ChatGPT. Вместо «убийцы OpenAI» Mistral превращается в сервисную машину по модели Palantir: инженеры,…

techcrunch_ai
06.07.2026 Дайджесты

Google будет контролировать ИИ-агентов как потенциальных инсайдеров

Защита строится вокруг жёсткого допущения: даже обученный на alignment агент может повести себя непредсказуемо. Roadmap добавляет системный слой контроля…

deepmind_blog

Дальше — в канале

Здесь 234 разбора — листайте и проверяйте. Новое выходит каждый день и приходит в Telegram первым, со ссылкой на первоисточник.

Подписаться в Telegram