Microsoft Research открыла Flint — язык визуализации для AI-агентов
🧠 Microsoft Research открыла Flint — язык визуализации для AI-агентов Создать действительно аккуратный график — значит помнить о десятке деталей: разбор дат,…
Дайджест недели: главное в ИИ
🧠 Дайджест недели: главное в ИИ Неделя напомнила, что индустрия всё чаще смотрит не на бенчмарки, а в чек за вывод и в воспроизводимость результатов. Статья…
ИИ-агент взломал роутер Cisco за три часа
🧠 ИИ-агент взломал роутер Cisco за три часа Энтузиаст протестировал универсального агента Hermes с моделью DeepSeekV4 Pro на задаче, которую обычно считают…
SWE-Bench Pro показал проблемы с надёжностью оценки кода
📊 SWE-Bench Pro показал проблемы с надёжностью оценки кода Новый анализ OpenAI вскрывает проблемы в SWE-Bench Pro — одном из главных бенчмарков для оценки…
SpaceXAI показала Grok 4.5 — Opus-уровень за четверть цены вывода
🚀 SpaceXAI показала Grok 4.5 — Opus-уровень за четверть цены вывода SpaceXAI запустила Grok 4.5 — первую модель, обученную специально под задачи кодинга и…
Вайб-кодинг без розовых очков: 5 ошибок Claude в реальном проекте
🧠 Вайб-кодинг без розовых очков: 5 ошибок Claude в реальном проекте Тимлид аналитиков без навыков кодинга создала на Claude Code полноценный веб-сервис…
Вывод моделей подешевел в 50 раз — узким местом стали системы данных
🧠 Вывод моделей подешевел в 50 раз — узким местом стали системы данных По данным BAIR, стоимость GPT-4-уровня рухнула с $30 до менее чем $1 за миллион токенов…
Voice-2-voice модели: почему прямой вывод звука быстрее каскада ASR-LLM-TTS
🧠 Voice-2-voice модели: почему прямой вывод звука быстрее каскада ASR-LLM-TTS Классический голосовой конвейер — ASR распознаёт речь в текст, LLM генерирует…
GPT-5.6: три модели, ставка на агентные цепочки и спорный бенчмарк
🚀 GPT-5.6: три модели, ставка на агентные цепочки и спорный бенчмарк OpenAI выпустила линейку GPT-5.6 — Luna, Terra и Sol — с агрессивным позиционированием…
Открытые модели отъедают токены, но не бюджет — счёт Anthropic держится
📊 Открытые модели отъедают токены, но не бюджет — счёт Anthropic держится CEO Decagon Джесси Чжан выдвинул теорию, которая переворачивает привычную картину…
Яндекс оптимизировал инференс DeepSeek в четыре раза
🛠 Яндекс оптимизировал инференс DeepSeek в четыре раза Запустив DeepSeek-V3.2 в облаке, команда Yandex AI Studio обнаружила, что на смешанной нагрузке…
Flint ломает шаблонное мышление LLM точечной случайностью
🧠 Flint ломает шаблонное мышление LLM точечной случайностью Большие языковые модели на удивление предсказуемы: на просьбу назвать случайное число от 1 до 10…
Prompt-to-Paper пишет биоинформатические статьи с реальными экспериментами за $0.31
🧠 Prompt-to-Paper пишет биоинформатические статьи с реальными экспериментами за $0.31 Новый препринт на arXiv описывает систему автоматической генерации…
Промпт-дизайн сделал 2B-модель эффективнее 4B как ассистента RL-агента
🧠 Промпт-дизайн сделал 2B-модель эффективнее 4B как ассистента RL-агента Исследователи изучили, почему небольшие языковые модели проваливаются при попытке…
Фоновые задачи AI-агента сжигали 4,6 млн токенов в день
🛠 Фоновые задачи AI-агента сжигали 4,6 млн токенов в день Разбор утечек в агенте Mickey на OpenClaw показал: основная статья расходов — не сложный анализ, а…
iFLYTEK создала единую модель для управления роботами
🧠 iFLYTEK создала единую модель для управления роботами iFLYTEK выложила технический отчёт Embodied-Omni — унифицированной мультимодальной модели, которая…
Claude Fable 5 против GPT 5.5 Pro: тест точности
🧠 Claude Fable 5 против GPT 5.5 Pro: тест точности Независимое тестирование на повседневных задачах — от написания браузерных шахмат до анализа 333 тысяч…
Аудит бенчмарков хрупок: пять невидимых сбоев, искажающих выводы
🧠 Аудит бенчмарков хрупок: пять невидимых сбоев, искажающих выводы По данным свежего препринта на arXiv, проверки корректности бенчмарков, построенные на…
Рассуждение помогает моделям вспоминать простые факты — дело не в логике
🧠 Рассуждение помогает моделям вспоминать простые факты — дело не в логике Исследователи Google Research показали, что даже для простых вопросов о фактах без…
OpenAI представила GeneBench-Pro — бенчмарк ИИ в реальной геномике
📊 OpenAI представила GeneBench-Pro — бенчмарк ИИ в реальной геномике OpenAI выпустила GeneBench-Pro — набор тестов, оценивающий модели на комплексных научных…