OGL-Mini: трёхфазный фильтр инъекций в запросах с обработкой на CPU
🛠 OGL-Mini: трёхфазный фильтр инъекций в запросах с обработкой на CPU
Автор опубликовал OGL-Mini — открытую гибридную модель безопасности для LLM-агентов, которая работает на CPU и доступна как модуль для TypeScript, Python и Go. Конвейер делится на три этапа: эвристики отсекают очевидные шаблоны (zero-width, homoglyph, контрольные токены) за 0.1 мс, мини-классификатор на TF-IDF распознаёт смысл инъекций, а детектор PII обнаруживает персональные данные. Автор обучил модель на 110 734 примерах: 54 162 из shieldlm, 22 500 синтетических атак на агентов, 14 000 обфускаций и 15 000 безопасных примеров для баланса. Задержка полной обработки — от 10 до 300 мс на слабом CPU, так что фильтр можно встраивать в реальные агентские системы без GPU. Подробнее об архитектуре и примерах атак — в материале Habr.
→ Обучающая выборка: 110 734 примера (инъекции, атаки на агентов, обфускации, безопасные примеры)
→ Детектор PII: F1 = 0.86, 11 типов данных (PERSON, BANK_CARD, PHONE и др.)
→ Архитектура: TF-IDF (80 000 словарных единиц) + линейный классификатор, дистилляция из DeBERTa-v3-xsmall (70M)
→ Задержка: эвристики 0.1 мс, мини-классификатор 3–7 мс, полная обработка 10–300 мс
Идея вынести безопасность из LLM в отдельный недорогой слой на CPU выглядит практично: не нужно платить за токены ещё одной большой модели, а интерпретируемость TF-IDF помогает объяснять решения. Но F1=0.86 для PII — это не тот уровень, при котором банк доверит фильтру платёжные данные без ручной проверки, и собственные метрики автора не заменят независимое тестирование атакующими.
Habr
#OGLMini #LLMSecurity #PromptInjection #AIagents #opensource
Такие разборы выходят в канале каждый день — коротко и со ссылкой на первоисточник.