11.07.2026 Другое

Microsoft Research открыла Flint — язык визуализации для AI-агентов

🧠 Microsoft Research открыла Flint — язык визуализации для AI-агентов Создать действительно аккуратный график — значит помнить о десятке деталей: разбор дат,…

microsoft_research
11.07.2026 Дайджесты

Дайджест недели: главное в ИИ

🧠 Дайджест недели: главное в ИИ Неделя напомнила, что индустрия всё чаще смотрит не на бенчмарки, а в чек за вывод и в воспроизводимость результатов. Статья…

digest
11.07.2026 Дайджесты

ИИ-агент взломал роутер Cisco за три часа

🧠 ИИ-агент взломал роутер Cisco за три часа Энтузиаст протестировал универсального агента Hermes с моделью DeepSeekV4 Pro на задаче, которую обычно считают…

habr_ai
11.07.2026 Другое

SWE-Bench Pro показал проблемы с надёжностью оценки кода

📊 SWE-Bench Pro показал проблемы с надёжностью оценки кода Новый анализ OpenAI вскрывает проблемы в SWE-Bench Pro — одном из главных бенчмарков для оценки…

openai_news
10.07.2026 Другое

SpaceXAI показала Grok 4.5 — Opus-уровень за четверть цены вывода

🚀 SpaceXAI показала Grok 4.5 — Opus-уровень за четверть цены вывода SpaceXAI запустила Grok 4.5 — первую модель, обученную специально под задачи кодинга и…

latent_space
10.07.2026 Дайджесты

Вайб-кодинг без розовых очков: 5 ошибок Claude в реальном проекте

🧠 Вайб-кодинг без розовых очков: 5 ошибок Claude в реальном проекте Тимлид аналитиков без навыков кодинга создала на Claude Code полноценный веб-сервис…

habr_ai
10.07.2026 Другое

Вывод моделей подешевел в 50 раз — узким местом стали системы данных

🧠 Вывод моделей подешевел в 50 раз — узким местом стали системы данных По данным BAIR, стоимость GPT-4-уровня рухнула с $30 до менее чем $1 за миллион токенов…

bair_blog
10.07.2026 Другое

Voice-2-voice модели: почему прямой вывод звука быстрее каскада ASR-LLM-TTS

🧠 Voice-2-voice модели: почему прямой вывод звука быстрее каскада ASR-LLM-TTS Классический голосовой конвейер — ASR распознаёт речь в текст, LLM генерирует…

habr_ai
10.07.2026 Другое

GPT-5.6: три модели, ставка на агентные цепочки и спорный бенчмарк

🚀 GPT-5.6: три модели, ставка на агентные цепочки и спорный бенчмарк OpenAI выпустила линейку GPT-5.6 — Luna, Terra и Sol — с агрессивным позиционированием…

simon_willison
09.07.2026 Дайджесты

Открытые модели отъедают токены, но не бюджет — счёт Anthropic держится

📊 Открытые модели отъедают токены, но не бюджет — счёт Anthropic держится CEO Decagon Джесси Чжан выдвинул теорию, которая переворачивает привычную картину…

techcrunch_ai
09.07.2026 Другое

Яндекс оптимизировал инференс DeepSeek в четыре раза

🛠 Яндекс оптимизировал инференс DeepSeek в четыре раза Запустив DeepSeek-V3.2 в облаке, команда Yandex AI Studio обнаружила, что на смешанной нагрузке…

habr_ai
09.07.2026 Другое

Flint ломает шаблонное мышление LLM точечной случайностью

🧠 Flint ломает шаблонное мышление LLM точечной случайностью Большие языковые модели на удивление предсказуемы: на просьбу назвать случайное число от 1 до 10…

mit_tech_review_ai
09.07.2026 Другое

Prompt-to-Paper пишет биоинформатические статьи с реальными экспериментами за $0.31

🧠 Prompt-to-Paper пишет биоинформатические статьи с реальными экспериментами за $0.31 Новый препринт на arXiv описывает систему автоматической генерации…

arxiv_cs_ai
08.07.2026 Другое

Промпт-дизайн сделал 2B-модель эффективнее 4B как ассистента RL-агента

🧠 Промпт-дизайн сделал 2B-модель эффективнее 4B как ассистента RL-агента Исследователи изучили, почему небольшие языковые модели проваливаются при попытке…

arxiv_cs_ai
08.07.2026 Другое

Фоновые задачи AI-агента сжигали 4,6 млн токенов в день

🛠 Фоновые задачи AI-агента сжигали 4,6 млн токенов в день Разбор утечек в агенте Mickey на OpenClaw показал: основная статья расходов — не сложный анализ, а…

habr_ai
08.07.2026 Другое

iFLYTEK создала единую модель для управления роботами

🧠 iFLYTEK создала единую модель для управления роботами iFLYTEK выложила технический отчёт Embodied-Omni — унифицированной мультимодальной модели, которая…

arxiv_cs_ai
08.07.2026 Другое

Claude Fable 5 против GPT 5.5 Pro: тест точности

🧠 Claude Fable 5 против GPT 5.5 Pro: тест точности Независимое тестирование на повседневных задачах — от написания браузерных шахмат до анализа 333 тысяч…

habr_ai
07.07.2026 Другое

Аудит бенчмарков хрупок: пять невидимых сбоев, искажающих выводы

🧠 Аудит бенчмарков хрупок: пять невидимых сбоев, искажающих выводы По данным свежего препринта на arXiv, проверки корректности бенчмарков, построенные на…

arxiv_cs_lg
07.07.2026 Другое

Рассуждение помогает моделям вспоминать простые факты — дело не в логике

🧠 Рассуждение помогает моделям вспоминать простые факты — дело не в логике Исследователи Google Research показали, что даже для простых вопросов о фактах без…

google_research
07.07.2026 Другое

OpenAI представила GeneBench-Pro — бенчмарк ИИ в реальной геномике

📊 OpenAI представила GeneBench-Pro — бенчмарк ИИ в реальной геномике OpenAI выпустила GeneBench-Pro — набор тестов, оценивающий модели на комплексных научных…

openai_news