KVBoost обходит кэширование префиксов, ускоряя предварительную обработку в 4,5 раза
🧠 KVBoost обходит кэширование префиксов, ускоряя предварительную обработку в 4,5 раза
KVBoost — система повторного использования KV-кэша на уровне блоков для декодеров, совместимых с HuggingFace, описанная в arXiv. В отличие от кэширования префиксов, которое требует общего начального префикса, здесь совпадения находят в любых позициях с помощью двойного хеширования: отдельного хэша для позиционной идентичности и отдельного — для содержимого. Для исправления ошибок на границах независимо закэшированных блоков используют два механизма: SelectiveRecompute пересчитывает граничные области, а CacheBlendRecompute после пробного прохода выявляет токены с высоким отклонением и пересчитывает только их. Система работает в рамках фиксированного бюджета памяти за счёт асимметричной квантизации KV (int8/int4), адаптивного разбиения на блоки и вытеснения по важности.
→ Снижение TTFT: в 4,49 раза, 142,4 мс против 639,1 мс
→ Превосходит кэширование префиксов на 16%
→ Точность: 99,2% против 99,1%
→ Модель и данные: Qwen2.5-3B, 1000 образцов для локализации ошибок
Практическая ценность KVBoost в том, что это слой поверх существующих сред выполнения без переобучения модели — то, что можно проверить в своей развернутой среде за день. Но меня смущает, что единственный тестовый набор — локализация ошибок на 3B-модели: в рабочей среде с длинным контекстом и разными типами запросов накладные расходы на хеширование и пробный проход могут съесть выигрыш.
#KVBoost #KVcache #LLMinference #Qwen #arXiv
Такие разборы выходят в канале каждый день — коротко и со ссылкой на первоисточник.