🧠 Маленькая рекурсивная модель обходит большие LLM на алгоритмических задачах Команда Sberbank представила STARM — среду для обучения рекурсивных моделей рассуждений, которые вместо однократной генерации многократно пересматривают внутреннее представление решения. По данным Habr, модель с несколькими миллионами параметров конкурирует с большими LLM в шести алгоритмических областях: ARC-AGI-1, ARC-AGI-2, арифметика, «игра в жизнь» Конвея, лабиринты и судоку. Главное преимущество — адаптивные вычисления: простые задачи решаются быстро, сложные требуют дополнительных итераций. Ключевые инженерные решения авторов — отказ от двухуровневой иерархии HRM в пользу одномодульной TRM-подобной архитектуры, dropout с фиксированной маской, зашумление входных векторных представлений и ограничение градиента на уровне 1 для стабилизации обучения. Увеличение реального размера пакета данных оказалось критичнее накопления градиента: модель чувствительна к шуму оптимизации, и накопление не заменяет большой пакет. Длинный путь градиента через несколько циклов тоже улучшил обобщение, хотя и требует больше памяти. Свёртки дали прирост только на задачах ARC-AGI. Ограничение жёсткое: единая модель для всех областей не обучилась. После тысяч итераций многозадачного обучения точность на судоку и лабиринтах осталась близкой к нулю, стабильно обучалась только арифметика. Похоже, один рекурсивный блок перегружается разнородными зависимостями, а ёмкости векторных представлений не хватает. То есть STARM — это пока специализированный решатель для одной области, а не универсальная машина рассуждений. Это не замена LLM, а дешёвый специализированный вычислитель. Для узких задач, где LLM систематически ошибаются в многошаговых рассуждениях, такая модель может стоить существенно дешевле на этапе вывода — и при этом давать предсказуемую точность. Но если нужна одна модель, которая решает всё, рекурсивные архитектуры пока не доросли. #STARM #рекурсивныемодели #reasoning #Sberbank #алгоритмическиезадачи