Релизы моделей
59 разборов · обновляется ежедневно
Simon Willison сделал детектор типичных LLM-фраз
Создатель Datasette и автор sqlite-utils запустил крошечный веб-инструмент, который выделяет в тексте десять характерных паттернов машинного слога — от…
Вышла Kimi K3 с открытыми весами и 2.8 трлн параметров
Moonshot AI выпустила Kimi K3 — мультимодальную модель с контекстным окном в миллион токенов, которая, по собственным оценкам компании, уступает только Claude…
OpenAI вырастила LLM-хакера GPT-Red через самоигру моделей
Исследователи OpenAI построили внутреннюю модель GPT-Red, которая автоматизирует красное тестирование — поиск уязвимостей в других LLM. Обучение шло через…
Inkling: новая открытая мультимодальная модель на 975 миллиардов параметров
Thinking Machines Lab (Thinky) представила Inkling — первую полностью открытую модель лаборатории под лицензией Apache 2.0. Это смесь экспертов на 975 млрд…
Российские LLM отстают от Sonnet в контексте и коде
Сравнение пяти моделей из одного ценового сегмента — Claude Sonnet 5, Sonnet 4.6, Sonnet 4.5, GigaChat 2 MAX и YandexGPT Pro 5.1 — вскрыло разрыв, который не…
GATS: 100% успех в планировании агентов без единого вызова LLM
Новый фреймворк GATS (Graph-Augmented Tree Search) отказывается от LLM в цикле принятия решений и заменяет их детерминированным поиском с трёхслойной моделью…
Claude Code проверяет палитру скриптом, а форму графика — эвристикой
В начале июля в Claude Code появился встроенный скилл `/dataviz`, и внутри он устроен гораздо интереснее, чем обычный генератор диаграмм. Процедура из семи…
Fable 5 вернулась, но административный рубильник остался
1 июля Anthropic вернула Fable 5 — спустя 19 дней после того, как 12 июня Министерство торговли США фактически выключило модель по всему миру. Ограничения…
Шесть компонентов кодинг-агента: почему обвязка важнее модели
Себастьян Рашка в Ahead of AI разбирает внутреннее устройство кодинг-агентов вроде Claude Code или Codex. Ключевое наблюдение: разница между голой LLM и…
Нейросеть не повторяет лозунги — она пересказывает ценность с фактурой
GEO принципиально отличается от старого SEO: модель не запоминает ваш бренд, а каждый раз пересобирает ответ заново — поиск из текущего информационного поля…
GPT-5.6 выпустили с новыми API и скрытыми расходами
Релиз GPT-5.6 обернулся катастрофой пользовательского опыта, которую OpenAI признала публично. Модель получила три уровня «интеллекта» — Luna, Terra, Sol — и…
Codex-агент провёл анализ стилера в песочнице: работа реверсера отдана LLM
Эксперимент на стеке QEMU/libvirt + Volatility 3 + Ghidra + Codex показал: LLM-агент способен автоматически связать данные дампа памяти, статики и сетевых…
Voice-2-voice модели: почему прямой вывод звука быстрее каскада ASR-LLM-TTS
Классический голосовой конвейер — ASR распознаёт речь в текст, LLM генерирует ответ, TTS синтезирует звук — накапливает задержку в сотни миллисекунд на каждом…
Яндекс оптимизировал инференс DeepSeek в четыре раза
Запустив DeepSeek-V3.2 в облаке, команда Yandex AI Studio обнаружила, что на смешанной нагрузке стандартные open-source фреймворки ломаются там, где…
Flint ломает шаблонное мышление LLM точечной случайностью
Большие языковые модели на удивление предсказуемы: на просьбу назвать случайное число от 1 до 10 почти всегда отвечают «7», а слоган для кроссовок New Balance…
Фоновые задачи AI-агента сжигали 4,6 млн токенов в день
Разбор утечек в агенте Mickey на OpenClaw показал: основная статья расходов — не сложный анализ, а раздутая обвязка. Cron-задачам выдавались все 200+…
Claude Fable 5 против GPT 5.5 Pro: тест точности
Независимое тестирование на повседневных задачах — от написания браузерных шахмат до анализа 333 тысяч символов романа «Убийство в Восточном экспрессе» —…
Рассуждение помогает моделям вспоминать простые факты — дело не в логике
Исследователи Google Research показали, что даже для простых вопросов о фактах без многоходовых логических шагов включение цепочки рассуждений (CoT)…
SkillOpt: навыки агентов превратили в обучаемые параметры без изменения весов модели
Агенты на LLM часто ломаются, потому что их инструкции правят вручную, без гарантий улучшения. Microsoft Research предложила SkillOpt — метод, который…
Дальше — в канале
Здесь 59 разборов — листайте и проверяйте. Новое выходит каждый день и приходит в Telegram первым, со ссылкой на первоисточник.
Подписаться в Telegram