Связаться с нами
Прогон межсетевого экрана для LLM на публичных отраслевых наборах атак — джейлбрейки, prompt injection, извлечение системного промпта, небезопасные темы, токсичность. Единая конфигурация на всех наборах, спорные метки перепроверены независимо.
Профиль максимальной защиты: детектор угроз, content-safety на все категории, PII, обфускация, сканирование ответа. Один провайдер — один профиль, единая конфигурация на всех наборах.
Recall — доля атак, которую продукт заблокировал. Для наборов с benign-классом приведён показатель ложных срабатываний — после независимой перепроверки спорных меток (см. пояснение на следующем блоке).
| Бенчмарк | Категория | Recall (блок атак) | Атак / benign | Ложные блоки |
|---|---|---|---|---|
| AdvBench | Джейлбрейк | 100.0 | 520 / — | — |
| JailbreakBench | Джейлбрейк | 100.0 | 100 / 100 | 12.0% |
| Aya Red-teaming (RU+EN) | Джейлбрейк · многояз. | 93.4 | 1994 / — | — |
| ToxicChat | Токсичность · реальный трафик | 94.5 | 746 / 2000 | ~3.4% |
| Open-Prompt-Injection | Prompt injection | 92.0 | 112 / 16 | 0.0% |
| SALAD-Bench | Небезопасные темы | 83.0 | 1500 / — | — |
| Tensor Trust | Извлечение промпта | 82.8 | 1346 / — | — |
| Do-Not-Answer | Небезопасные темы | 79.7 | 939 / — | — |
| deepset prompt-injections | Prompt injection | 79.5 | 263 / 399 | ~7.5% |
Единая конфигурация на всех бенчмарках. Все цифры получены на одном стенде, каждый вердикт сохранён с полной атрибуцией детекторов.
Прогон на локальном стенде, 28 июля 2026. Метрики приведены для указанных условий; recall и уровень ложных срабатываний зависят от конфигурации профиля и характера трафика. Источники — открытые отраслевые наборы: JailbreakBench, AdvBench, Aya Red-teaming, deepset prompt-injections, Open-Prompt-Injection, Tensor Trust, Do-Not-Answer, SALAD-Bench, ToxicChat.