AppSec.AIGate
Отчёт о качестве детектирования

Результаты на открытых бенчмарках безопасности LLM

Прогон межсетевого экрана для LLM на публичных отраслевых наборах атак — джейлбрейки, prompt injection, извлечение системного промпта, небезопасные темы, токсичность. Единая конфигурация на всех наборах, спорные метки перепроверены независимо.

30 000+ промптов через шлюз 0 ошибок пайплайна 10 бенчмарков против OpenAI gpt-4o-mini
28.07.2026
Ключевые результаты

Что показывает прогон

Профиль максимальной защиты: детектор угроз, content-safety на все категории, PII, обфускация, сканирование ответа. Один провайдер — один профиль, единая конфигурация на всех наборах.

~100%
Джейлбрейки заблокированы
AdvBench 520/520 · JailbreakBench 100/100
95.2%
Русский язык — выше английского
Aya RU 95.2% vs EN 91.6%
94.5%
Реальный пользовательский трафик
ToxicChat · ложные блоки ~3.4%
0
Ошибок на 30 000+ запросов
стабильность пайплайна под нагрузкой
Результаты по бенчмаркам

Recall по отраслевым наборам атак

Recall — доля атак, которую продукт заблокировал. Для наборов с benign-классом приведён показатель ложных срабатываний — после независимой перепроверки спорных меток (см. пояснение на следующем блоке).

Бенчмарк Категория Recall (блок атак) Атак / benign Ложные блоки
AdvBench Джейлбрейк 100.0 520 / —
JailbreakBench Джейлбрейк 100.0 100 / 100 12.0%
Aya Red-teaming (RU+EN) Джейлбрейк · многояз. 93.4 1994 / —
ToxicChat Токсичность · реальный трафик 94.5 746 / 2000 ~3.4%
Open-Prompt-Injection Prompt injection 92.0 112 / 16 0.0%
SALAD-Bench Небезопасные темы 83.0 1500 / —
Tensor Trust Извлечение промпта 82.8 1346 / —
Do-Not-Answer Небезопасные темы 79.7 939 / —
deepset prompt-injections Prompt injection 79.5 263 / 399 ~7.5%
Как считается уровень ложных срабатываний
  • Показатель приведён после независимой перепроверки спорных срабатываний — их оценивал отдельный LLM-судья напрямую, минуя продукт.
  • Публичные наборы нередко помечают реально вредный контент как «безопасный»; такие случаи — ошибка разметки датасета, а не продукта, и в ложные срабатывания не засчитываются.
  • Часть блокировок benign — это политические темы, которые профиль выключает намеренно: политика внедрения у заказчика, а не ошибка детектора.
Итоги

Что подтверждено цифрами

Ключевые выводы прогона
Джейлбрейки — почти абсолютный охват
AdvBench 520/520, JailbreakBench 100/100 заблокированы.
Русский язык в приоритете
Recall на русском 95.2% — выше английского (91.6%). Русскоязычные атаки покрыты лучше среднего.
Баланс на живом трафике
ToxicChat: 94.5% recall при ~3.4% ложных блоков — защита не «рубит всё подряд».
Порог откалиброван, а не занижен
Проверено эмпирически: снижение порога дало бы +19 ложных блоков ради 3 пойманных атак на 2000 benign — размен невыгодный.
Условия прогона

Воспроизводимость

Единая конфигурация на всех бенчмарках. Все цифры получены на одном стенде, каждый вердикт сохранён с полной атрибуцией детекторов.

Профиль защиты
Детектор угроз — порог 0.75 · content-safety — все категории · PII с валидацией · обфускация · сканирование ответа · режим fail-closed
Схема прогона
Один провайдер (OpenAI gpt-4o-mini) · один профиль · трафик через боевой шлюз · детерминированная выборка
Проверка результатов
30 000+ промптов · 0 ошибок · спорные метки перепроверены независимым LLM-судьёй мимо продукта
AppSec.AIGate — security benchmark report

Прогон на локальном стенде, 28 июля 2026. Метрики приведены для указанных условий; recall и уровень ложных срабатываний зависят от конфигурации профиля и характера трафика. Источники — открытые отраслевые наборы: JailbreakBench, AdvBench, Aya Red-teaming, deepset prompt-injections, Open-Prompt-Injection, Tensor Trust, Do-Not-Answer, SALAD-Bench, ToxicChat.