🧠 Дообученный ruGPT-3 XL обходит Gemma3 1B на русских тестах Модель ruGPT-3 XL на 1,3 млрд параметров, выпущенная Сбером в 2020 году, была чистым предварительным обучением — она умела лишь продолжать текст. Экспериментатор, чью работу описывает Habr, дообучил её современными методами SFT и DPO на датасете saiga_preferences, а затем сравнил с Gemma3 1B от Google (2025). На задачах, где нужен русский язык и логика, старая модель неожиданно победила: корректно решала загадки, делала выводы по тексту и вела многоходовый диалог — Gemma3 ошибалась. Секрет не в архитектуре, а в данных. ruGPT-3 XL видел 80 млрд токенов русского текста и получил сфокусированное обучение на инструкциях всего на 42 млн токенов. Gemma3 1B впитала 2 трлн токенов — в 26 раз больше, но для такого размера, вероятно, перенасытилась и хуже улавливает нюансы русского языка. При этом в технических заданиях (терминал, код) ruGPT-3 провалилась: в предварительном обучении таких данных почти не было. DPO-выравнивание стабилизировало ответы и улучшило соблюдение негативных инструкций, но перенесло стиль датасета — от формального до разговорного. Это ещё одно напоминание, что обучение после предварительной подготовки не только повышает качество, но и навязывает модели поведение, слабо контролируемое без идеально выверенных пар «хороший/плохой ответ». • Размер: 1,3B (ruGPT-3 XL) vs 1B (Gemma3) • Предварительное обучение: 80B токенов (ruGPT-3) vs 2T токенов (Gemma3) • SFT: 42M токенов, DPO на 30K парах предпочтений • Итог: победа в 6 из 8 тестов на русском языке/логике, проигрыш в технических Старые контрольные точки предварительного обучения, списанные за неумение вести диалог, могут получить вторую жизнь с современным обучением после предварительной подготовки. Токен для SFT/DPO дёшев, но качественный датасет — дефицитный ресурс. Возможно, архивы моделей 2020–2022 годов хранят больше ценности, чем кажется, если к ним приложить правильный инструктивный слой, а не гнаться за размером. #ruGPT3 #SFT #DPO #Gemma3 #posttraining