TAPR переписывает промпты и улучшает LLM — ценой дополнительного вызова
🧠 TAPR переписывает промпты и улучшает LLM — ценой дополнительного вызова
Исследователи представили Task-Aware Prompt Rewriter (TAPR) — модель, которая переписывает пользовательский промпт в оптимизированный под задачу и тем самым поднимает качество ответов целевой LLM. Рерайтер построен на базе Phi-4-mini-instruct и обучен через Group Relative Policy Optimization (GRPO), где награды формируются с помощью LLM-судьи, оценивающего и сам переписанный промпт, и финальный результат. В абстракте заявлен последовательный прирост на задачах вопросно-ответных, суммаризации и арифметического рассуждения — упомянуты бенчмарки Natural Questions и GSM8K, но без конкретных цифр. Код доступен, что позволяет воспроизвести и проверить заявленные улучшения.
Практическая сторона упирается в дополнительный вызов: даже небольшая модель рерайтера добавляет задержку, тратит токены и увеличивает счёт за инференс. Если задача по-настоящему требовательна к промпту, один лишний шаг окупается; в простых кейсах он с высокой вероятностью станет чистым оверхедом.
До тех пор пока никто не сравнил соотношение «прирост accuracy / цена рерайта» на реальном продакшен-пайплайне, элегантность решения — пока демо-статистика. Ирония в том, что вручную отлаженный хороший промпт часто даёт тот же профит без дополнительных вызовов модели. Стоит ли овчинка выделки?
arXiv
#TAPR #GRPO #Phi4 #промпт_инженерия
Такие разборы выходят в канале каждый день — коротко и со ссылкой на первоисточник.