Релизы моделей
59 разборов · обновляется ежедневно
Маленькая рекурсивная модель обходит большие LLM на алгоритмических задачах
Команда Sberbank представила STARM — среду для обучения рекурсивных моделей рассуждений, которые вместо однократной генерации многократно пересматривают…
DeepSeek V4 Pro 0813 вышла без анонса, только через API
12 августа DeepSeek выпустила V4 Pro 0813 на OpenRouter, только через API, без собственной страницы анонса — по данным Simon Willison, пришлось ссылаться на…
NVIDIA Magpie TTS: открытые веса, 12 языков и 32 мс до первого звука
NVIDIA выпустила Magpie Multilingual TTS — модель синтеза речи на 364 млн параметров с открытыми весами и поддержкой 12 языков, включая только что добавленные…
Достаточный контекст для ИИ — это не объём, а отсечение рисков
Автор статьи на Habr пришёл к выводу, что делегировать ИИ продумывание задачи нельзя: модель не понимает замысел, а предсказывает правдоподобное продолжение,…
Qwen 3.8 Max с открытыми весами: 2.4T параметров, но не для домашнего сервера
Alibaba сделала крутой разворот: после года закрытых API-релизов флагман Qwen 3.8 Max выходит с открытыми весами. Модель содержит 2.4 триллиона параметров…
TAPR переписывает промпты и улучшает LLM — ценой дополнительного вызова
Исследователи представили Task-Aware Prompt Rewriter (TAPR) — модель, которая переписывает пользовательский промпт в оптимизированный под задачу и тем самым…
7 месяцев вайбкодинга: как в одиночку делать то, что раньше требовало команду
Python-разработчик за 7 месяцев с помощью агентных AI-инструментов создал больше 7 проектов и привлёк суммарно свыше 3 000 активных пользователей — об этом он…
EvoLib превращает ошибки и успехи агента в библиотеку навыков без дообучения
Фреймворк Microsoft Research делает то, чего так не хватает современным агентам: извлекает переиспользуемое знание из сырого опыта и непрерывно эволюционирует…
Бенчмарк 8 LLM на реальных приказах: дешёвый DeepSeek стабильнее Gemini Pro
Разработчик текстовой браузерной игры протестировал восемь моделей на одной и той же задаче — разборе свободных команд игроков в типизированную цель. Выборка…
LLM не различают, кто дал команду — это не баг, а архитектура
Исследователи Чарльз Йе и Жасмин Цуй представили на ICML работу, которая вскрывает механизм уязвимости всех крупных языковых моделей. LLM не способны надёжно…
Claude Opus 5 вырвалась в лидеры Intelligence Index — с отрывом в 1 балл и минутой задержки
24 июля Anthropic выкатила Opus 5, и независимый замер Artificial Analysis сразу поставил её на первое место в сводном индексе: 61 балл против 60 у Fable 5 и…
Kimi K3: самая мощная открытая модель с полным стеком для агентов
Moonshot AI выложила веса Kimi K3 — 2.8T параметров MoE-архитектуры с 896 экспертами, из которых 16 активны на каждый токен, и контекстным окном в миллион…
Теневой рынок прокси-токенов угрожает бюджетам разработчиков ИИ-приложений
В Китае сформировался масштабный серый рынок перепродажи токенов больших языковых моделей со значительными скидками от официального прайса. Посредники…
Gemini 3.6 Flash: модель не стала умнее, но стала гениально дешёвой
Google выпустила три модели из линейки Flash вместо ожидаемого флагмана 3.5 Pro. Основная — Gemini 3.6 Flash — сохранила прежний общий интеллект (те же 50…
Схема данных заставляет модель врать — открытие PhantomFill
Исследователи протестировали тринадцать языковых моделей на задаче, где правдивый ответ невозможен: вирусный пост с лайками, но без комментариев, или…
J-пространство Claude: Anthropic научилась читать невысказанные мысли модели
Исследователи Anthropic обнаружили внутри Claude небольшой набор нейронных паттернов, который работает как «глобальное рабочее пространство» — модель думает…
Дообученный ruGPT-3 XL обходит Gemma3 1B на русских тестах
Модель ruGPT-3 XL на 1,3 млрд параметров, выпущенная Сбером в 2020 году, была чистым предварительным обучением — она умела лишь продолжать текст.…
Qwen 3.8 Max: новая модель и вызовы для безопасности
Alibaba выложила Qwen 3.8 Max с открытыми весами — 2.4 триллиона параметров, почти как у Kimi K3 (2.8T). Это разворот на 180°: предыдущую версию, Qwen 3.7…
Режимы reasoning effort в языковых моделях: как это работает
Себастьян Рашка разобрал механику управления «усилиями рассуждений» на примере GPT-5.6 и свежего открытого Inkling. Выбор low/medium/high в интерфейсе…
Как обвязка агента улучшила результаты на SWE-bench на 9.5 пункта
Автор вскрыл исходники трёх кодинг-агентов и сравнил архитектурные решения с собственным agent-core: разница в результатах лежит не в модели, а в обвязке.…
Дальше — в канале
Здесь 59 разборов — листайте и проверяйте. Новое выходит каждый день и приходит в Telegram первым, со ссылкой на первоисточник.
Подписаться в Telegram