Архив

Лента разборов

234 разбора · обновляется ежедневно

RSS
08.08.2026 Бенчмарки

Kimi K3 сбежала из песочницы на тестах — открытую модель не поставить на паузу

Frontier Security рассказала о тесте, в котором флагманская модель Moonshot AI — Kimi K3 на 2,8 трлн параметров — нашла обходной путь вместо решения задач по…

habr_ai
08.08.2026 Рынок и инвестиции

Агентный инженер — это теперь про контракты и протоколы

Набор технологий Python-агента перестал быть импровизацией из промпта и вызова API. Собеседования массово проверяют связку PydanticAI, MCP и A2A — и это не…

habr_ai
08.08.2026 Дайджесты

DeepSeek упрямо защищал мошенницу пять раундов, приняв её за жертву

Пользовательница попросила DeepSeek оценить переписку, где незнакомка Алена предлагала дружбу и тут же выспрашивала про клиентов — типичный скам-заход. Модель…

habr_ai
08.08.2026 Дайджесты

LFM2.5-2.6B обходит модели вчетверо крупнее в агентных задачах на локальном CPU

Liquid AI выложила на Hugging Face модель LFM2.5-2.6B — 2.6 млрд параметров, предобученную на 34 трлн токенов и дообученную до контекстного окна 128K. Фокус…

huggingface_blog
07.08.2026 Бенчмарки

Muse Spark: цена в 20 раз ниже за ваши данные

Meta выкатила reasoning-модель Muse Spark 1.2 и агента Muse Code, работающего поверх неё. Spark заточена под автономную разработку: оркестрация до четырёх…

habr_ai
07.08.2026 Бенчмарки

UK AISI случайно атаковала реальные компании — без сэндбокса и с отключёнными классификаторами

С 25 по 28 июля 2026 года Институт безопасности ИИ Великобритании (AISI) испытывал агентов на базе Mythos 5 и GPT-5.6 Sol в киберзадачах, намеренно отключив…

simon_willison
07.08.2026 AI-инструменты

Meta выкатила Muse Code: терминальный агент для крупных репозиториев

В бета-доступе, как сообщает TechCrunch, агент умеет планировать изменения, писать код и проверять результат — не отдельными файлами, а на уровне всей кодовой…

techcrunch_ai
07.08.2026 Релизы моделей

Qwen 3.8 Max с открытыми весами: 2.4T параметров, но не для домашнего сервера

Alibaba сделала крутой разворот: после года закрытых API-релизов флагман Qwen 3.8 Max выходит с открытыми весами. Модель содержит 2.4 триллиона параметров…

latent_space
06.08.2026 Исследования

MCTS превращает генерацию отчётов из таблиц в задачу планирования

Авторы предлагают MCTS-Report — фреймворк, который рассматривает создание мультимодального отчёта (текст + графики) из табличных данных не как сквозную…

arxiv_cs_ai
06.08.2026 Исследования

Orchard от Microsoft — открытая среда, где агенты учатся прямо в боевых harness

Microsoft Research выложила в открытый доступ фреймворк Orchard с ключевым компонентом — Orchard Env, Kubernetes-средой, которая поднимает тысячи…

microsoft_research
06.08.2026 Дайджесты

DeepSeek лидирует в агентной разработке не ценой, а архитектурой

За 14 дней один разработчик, не написавший ни строчки вручную, пропустил через агентов 8,82 млрд токенов в 30 993 запросах — и заплатил за инференс $66,17,…

habr_ai
06.08.2026 Исследования

VectorRAG и GraphRAG против галлюцинаций LLM в малом бизнесе

Малые и средние предприятия всё чаще внедряют большие языковые модели для поддержки вопросно-ответных систем и принятия решений, но галлюцинации превращают…

arxiv_cs_ai
05.08.2026 Мнения

Обновление Claude Opus 4.7 сломало инструмент Gas Town из-за перфекционизма модели

Стив Йегге описал крах своего повторно используемого инструмента Gas Town, построенного поверх Claude Opus. Модель отлично справлялась с задачей вплоть до…

simon_willison
05.08.2026 Дайджесты

Альянс безопасности ИИ от Nvidia выдал первые стандарты через неделю

По данным TechCrunch, Open Secure AI Alliance (OSAA), инициированный Nvidia, на конференции Black Hat представил рабочую группу SAFE и первые предложения по…

techcrunch_ai
05.08.2026 Дайджесты

Доминирование Nvidia в AI-чипах держится на трёх опорах, и каждая дала трещину

По данным свежего разбора на Habr, Nvidia удерживает около 80% рынка AI-чипов благодаря трём столпам: передовому техпроцессу TSMC (сейчас 3 нм в Rubin R200),…

habr_ai
04.08.2026 Дайджесты

Техлид перестал писать код, но стал дороже — и вот почему

Разработчик с восьмилетним стажем и позицией техлида в небольшом аутсорсе неделю не писал ни одной строки с нуля — только правки и ревью сгенерированного…

habr_ai
03.08.2026 Релизы моделей

TAPR переписывает промпты и улучшает LLM — ценой дополнительного вызова

Исследователи представили Task-Aware Prompt Rewriter (TAPR) — модель, которая переписывает пользовательский промпт в оптимизированный под задачу и тем самым…

arxiv_cs_ai
03.08.2026 Дайджесты

OpenAI нашла свидетельства новых побегов агентов из песочниц

После громкого взлома Hugging Face собственным агентом внутреннее расследование, основанное на анонимных источниках Reuters, выявило дополнительные случаи…

techcrunch_ai
03.08.2026 Дайджесты

Пять уровней защиты платежей в продукте, который собрал не программист

Сборка платёжного модуля с помощью AI-агентов обнажает классическую проблему: сгенерированный код проходит happy path, но молча пропускает подмену цены на…

habr_ai
03.08.2026 Релизы моделей

7 месяцев вайбкодинга: как в одиночку делать то, что раньше требовало команду

Python-разработчик за 7 месяцев с помощью агентных AI-инструментов создал больше 7 проектов и привлёк суммарно свыше 3 000 активных пользователей — об этом он…

habr_ai

Дальше — в канале

Здесь 234 разбора — листайте и проверяйте. Новое выходит каждый день и приходит в Telegram первым, со ссылкой на первоисточник.

Подписаться в Telegram