Релизы моделей
25 разборов · обновляется ежедневно
Схема данных заставляет модель врать — открытие PhantomFill
🧠 Схема данных заставляет модель врать — открытие PhantomFill Исследователи протестировали тринадцать языковых моделей на задаче, где правдивый ответ…
J-пространство Claude: Anthropic научилась читать невысказанные мысли модели
🧠 J-пространство Claude: Anthropic научилась читать невысказанные мысли модели Исследователи Anthropic обнаружили внутри Claude небольшой набор нейронных…
Дообученный ruGPT-3 XL обходит Gemma3 1B на русских тестах
🧠 Дообученный ruGPT-3 XL обходит Gemma3 1B на русских тестах Модель ruGPT-3 XL на 1,3 млрд параметров, выпущенная Сбером в 2020 году, была чистым…
Qwen 3.8 Max: новая модель и вызовы для безопасности
🚀 Qwen 3.8 Max: новая модель и вызовы для безопасности Alibaba выложила Qwen 3.8 Max с открытыми весами — 2.4 триллиона параметров, почти как у Kimi K3…
Режимы reasoning effort в языковых моделях: как это работает
🧠 Режимы reasoning effort в языковых моделях: как это работает Себастьян Рашка разобрал механику управления «усилиями рассуждений» на примере GPT-5.6 и…
Как обвязка агента улучшила результаты на SWE-bench на 9.5 пункта
🧠 Как обвязка агента улучшила результаты на SWE-bench на 9.5 пункта Автор вскрыл исходники трёх кодинг-агентов и сравнил архитектурные решения с собственным…
Simon Willison сделал детектор типичных LLM-фраз
🛠 Simon Willison сделал детектор типичных LLM-фраз Создатель Datasette и автор sqlite-utils запустил крошечный веб-инструмент, который выделяет в тексте…
Вышла Kimi K3 с открытыми весами и 2.8 трлн параметров
🚀 Вышла Kimi K3 с открытыми весами и 2.8 трлн параметров Moonshot AI выпустила Kimi K3 — мультимодальную модель с контекстным окном в миллион токенов,…
OpenAI вырастила LLM-хакера GPT-Red через самоигру моделей
🧠 OpenAI вырастила LLM-хакера GPT-Red через самоигру моделей Исследователи OpenAI построили внутреннюю модель GPT-Red, которая автоматизирует красное…
Inkling: новая открытая мультимодальная модель на 975 миллиардов параметров
🚀 Inkling: новая открытая мультимодальная модель на 975 миллиардов параметров Thinking Machines Lab (Thinky) представила Inkling — первую полностью открытую…
Российские LLM отстают от Sonnet в контексте и коде
📊 Российские LLM отстают от Sonnet в контексте и коде Сравнение пяти моделей из одного ценового сегмента — Claude Sonnet 5, Sonnet 4.6, Sonnet 4.5, GigaChat 2…
GATS: 100% успех в планировании агентов без единого вызова LLM
🧠 GATS: 100% успех в планировании агентов без единого вызова LLM Новый фреймворк GATS (Graph-Augmented Tree Search) отказывается от LLM в цикле принятия…
Claude Code проверяет палитру скриптом, а форму графика — эвристикой
🛠 Claude Code проверяет палитру скриптом, а форму графика — эвристикой В начале июля в Claude Code появился встроенный скилл `/dataviz`, и внутри он устроен…
Fable 5 вернулась, но административный рубильник остался
⚠️ Fable 5 вернулась, но административный рубильник остался 1 июля Anthropic вернула Fable 5 — спустя 19 дней после того, как 12 июня Министерство торговли…
Шесть компонентов кодинг-агента: почему обвязка важнее модели
🛠 Шесть компонентов кодинг-агента: почему обвязка важнее модели Себастьян Рашка в Ahead of AI разбирает внутреннее устройство кодинг-агентов вроде Claude Code…
Нейросеть не повторяет лозунги — она пересказывает ценность с фактурой
🧠 Нейросеть не повторяет лозунги — она пересказывает ценность с фактурой GEO принципиально отличается от старого SEO: модель не запоминает ваш бренд, а каждый…
GPT-5.6 выпустили с новыми API и скрытыми расходами
🚀 GPT-5.6 выпустили с новыми API и скрытыми расходами Релиз GPT-5.6 обернулся катастрофой пользовательского опыта, которую OpenAI признала публично. Модель…
Codex-агент провёл анализ стилера в песочнице: работа реверсера отдана LLM
🧠 Codex-агент провёл анализ стилера в песочнице: работа реверсера отдана LLM Эксперимент на стеке QEMU/libvirt + Volatility 3 + Ghidra + Codex показал:…
Voice-2-voice модели: почему прямой вывод звука быстрее каскада ASR-LLM-TTS
🧠 Voice-2-voice модели: почему прямой вывод звука быстрее каскада ASR-LLM-TTS Классический голосовой конвейер — ASR распознаёт речь в текст, LLM генерирует…
Яндекс оптимизировал инференс DeepSeek в четыре раза
🛠 Яндекс оптимизировал инференс DeepSeek в четыре раза Запустив DeepSeek-V3.2 в облаке, команда Yandex AI Studio обнаружила, что на смешанной нагрузке…