🧠 ABBEL сокращает пиковое число токенов вдвое и учится в 2 раза быстрее саммари-моделей Cаммаризация контекста в длинных агентных цепочках — компромисс с потерями. Команда BAIR показала это на тесте Combination Lock: модель с саммари учится, но разрыв с полным контекстом не закрывается даже после RL-файнтюнинга. Проблема не в архитектуре, а в качестве данных: в реальных сценариях вроде совместного кодинга траекторий взаимодействия мало, и они грязные. ABBEL переформулирует саммари как байесовское обновление убеждений. Модель периодически генерирует belief state на естественном языке, а ключевой приём — Belief Grading — автоэнкодерная RL-эвристика, которая награждает за то, насколько хорошо из этого убеждения восстанавливается последнее наблюдение. Это не просто сжатие, а изоляция релевантной информации. В среде совместного кодинга CollabBench ABBEL с реконструкционной grading-функцией сокращает разрыв с полным контекстом примерно вдвое по pass rate — 0.48 против 0.52 — и достигает этого за 50 шагов обучения вместо 100, при пиковом контексте в 601 токен против 1408. Без grading-функции модель упирается в pass rate 0.46, несмотря на полные 100 шагов. По данным BAIR, в среде Combination Lock с доменной grading-функцией ABBEL превосходит даже полный контекст по скорости обучения. Саммаризация и контекст-компрессия до сих пор обсуждались как архитектурный компромисс, но BAIR смещает акцент на то, чему именно учится модель. Если автоэнкодерный Belief Grading так хорошо масштабируется, то следующий вопрос — будут ли эти belief states переносимы между разными доменами, или каждому ассистенту нужен свой датасет реконструкций, что возвращает нас к проблеме нехватки реальных интерактивных данных. #ABBEL #контекст #агенты