🧠 Orchard от Microsoft — открытая среда, где агенты учатся прямо в боевых harness Microsoft Research выложила в открытый доступ фреймворк Orchard с ключевым компонентом — Orchard Env, Kubernetes-средой, которая поднимает тысячи изолированных контейнеров для сбора данных, reinforcement learning‑рулонов и оценки агентов. Архитектурный ход — вынести среду в переиспользуемый сервис, не привязанный к конкретному бенчмарку или агенту. Благодаря лёгкому прокси, агента можно обучать end‑to‑end прямо в реальном harness для деплоя — Codex, OpenClaw, ZeroClaw, — без разрыва между тренировочным стендом и боевым окружением. Вместе с инфраструктурой опубликованы три рецепта обучения, и цифры бросают вызов гигантомании. Orchard‑SWE на ~3 млрд активных параметров набирает 69,7% на SWE‑bench Verified, а с переранжированием value‑моделью — 73,0%. Это вплотную к фронтир‑системам, использующим модели в 10 и более раз крупнее. Результат получен на 107 тыс. дистиллированных взаимодействий с двумя крупными open‑weight моделями, credit‑assignment‑файнтюнингом неудачных попыток и RL с плотными наградами от учителя и процессной reward‑модели. Orchard‑GUI — 4‑миллиардная vision‑language‑модель — после 400 демонстраций и 2 200 задач достигает 74,1% на WebVoyager, 67,0% на Online‑Mind2Web и 64,0% на DeepShop. Orchard‑Claw всего на 200 синтетических примерах выдаёт 59,6% на Claw‑Eval, а при переключении на harness Codex взлетает с 18,6% до 51,5%. Orchard смещает акцент с размера модели на инженерию среды — именно она сейчас главный тормоз для независимых команд, а не отсутствие очередной 400‑миллиардной LLM. Открытость инфраструктуры — мощный шаг, но ключевой вопрос: сможет ли сообщество воспроизводить и развивать всё это без неявной привязки к внутренним инструментам Microsoft? По данным Microsoft Research #Orchard #agenticAI #opensource #SWEbench #MicrosoftResearch