🚀 IBM Granite 4.2: три открытые модели с агентным обучением IBM открыла веса трёх плотных моделей Granite 4.2 — 3B, 8B и 30B — с явным рассуждением и переключателем между режимами рассуждения и обычной работы. По данным Hugging Face, предварительное обучение с нуля заняло примерно 15T токенов в пять фаз и довело длину контекста до 512K. Дообучение на инструкциях прошло на ~7,2 млн примеров (~100B токенов), из которых 31,6% — траектории работы агентов: работа с терминалом, вызовы инструментов, поиск, правки в песочнице. Ключевое отличие от прошлых Granite — многоступенчатое обучение с подкреплением: модели 8B и 30B прошли этапы работы агентов в настоящих средах для разработки, терминала и поиска, получая разреженное вознаграждение по принципу «решил или нет». Все веса распространяются по Apache 2.0, модели запускаются через совместимую с OpenAI точку доступа в vLLM и SGLang. → Размеры: 3B, 8B, 30B, плотные модели; GQA, RoPE (θ=10M), SwiGLU, раздельные эмбеддинги → Контекст: 128K при дообучении на инструкциях, 512K после пятой фазы предварительного обучения → Дообучение на инструкциях: 7,2M примеров, ~65B токенов для обучения; агентные данные генерировали более чем 12 средствами (OpenHands, SWE-agent, Codex и др.) → Обучение с подкреплением: асинхронный GRPO без сети оценки; в RLVR пакет из 4096 примеров (256 запросов × 16 генераций) Сдвиг от «рассуждать» к «действовать» через обучение с подкреплением в реальных средах — главный сигнал для тех, кто строит агентов: модели с открытыми весами впервые получают исходные материалы такого обучения, а не только разработку запросов поверх. Но в статье нет ни одного теста, и воспроизвести агентное обучение с подкреплением без NeMo-RL и закрытых синтетических сред почти нереально — Apache 2.0 здесь относится к весам, а не к конвейеру обучения. Для русскоязычного ML-сообщества это легальное дообучение без оглядки на лицензию, как с Qwen и Mistral. Granite 4.2 LLMs: How They're Built #Granite4 #IBM #openweight #agenticRL #Apache2