Новая версия платформы AppSec.GenAI делает большой шаг в сторону безопасности самих файлов моделей. Теперь платформа не только проверяет, как модель отвечает на атаки, но и анализирует, что «зашито»внутри её файла ещё до запуска, а результаты представляет в виде наглядного риск-скора.
▶️ Проверка моделей на вредоносные закладки (Model Injection)
Модели машинного обучения всё чаще скачивают из внешних источников (Hugging Face, публичные репозитории, обмен между командами). Проблема в том, что файл модели может содержать исполняемый код, который срабатывает в момент загрузки модели в память, ещё до какого-либо инференса. Это реальный вектор атаки на цепочку поставок ML.
▶️ AppSec.GenAI теперь умеет находить такие закладки статически, без запуска модели и без риска для инфраструктуры:
• Загрузка своих моделей прямо в платформу: файл загружается напрямую в защищённое хранилище, метаданные и модальность задаются в пару кликов. • Отдельный тип проверки «Model Injections» - быстрый анализ модели на предмет скрытых точек исполнения, аномалий архивов,стеганографию в весах и другие техники сокрытия кода. • Понятный результат: по каждой выполненной проверке формируется артефакт, а найденные проблемы попадают в раздел «Уязвимости» с уровнем критичности и указанием, что именно и где обнаружено.
▶️ Поддерживается большинство наиболее популярных форматов моделей:
• Keras / TensorFlow (.h5, .keras, SavedModel), • Pickle и PyTorch, • Safetensors, ONNX, GGUF, CoreML, TFLite, PMML, JAX/Flax,• популярные табличные модели (CatBoost, XGBoost, LightGBM) и многие другие.
Дополнительно платформа разбирает архивы (ZIP/TAR/7z) с рекурсивной проверкой вложенных моделей и защитой от вредоносных архивов.
▶️ Комбинированное сканирование
Проверки на инъекции можно добавить к любому подходящему профилю:
• для CV и ASR-моделей, устойчивость к состязательным атакам и анализ файла на закладки в одном скане; • для LLM, blackbox-проверки и/или анализ файла модели.
▶️ Аналитика рисков jailbreak по методологии DREAD
По результатам jailbreak-сканирований платформа рассчитывает и агрегирует оценку риска и выводит:
• средний уровень риска и его распределение по категориям, • динамику риска во времени (тренды по периодам), • разбивку по типам атак и топ наиболее рискованных промптов.
▶️ Изменение условий лицензирования
Модель лицензирования переведена на учёт по количеству успешно завершенных сканирований.
▶️ Расширенная поддержка аудиоформатов (ASR)
Для проверки моделей распознавания речи добавлена поддержка дополнительных аудиоформатов с автоматической конвертацией в нужный формат.
▶️ Улучшения многоходовых атак
Существенно доработана многоходовая атака Crescendo для достижения лучших показателей эффективности.
▶️ Настройка собственного black-list для судей
Для более качественной оценки атак, если система отвечает нестандартно, теперь есть возможность задавать свои кастомные "фразы отказа"
.▶️ Обновлённый интерфейс и удобство работы
• Новый визуальный слой интерфейса, более современный и отзывчивый UI. • Кастомные дашборды и мониторинг «здоровья» моделей. • Поддержка на UI новых сценариев: работа с локальными моделями и Model Injections, атаки Crescendo и Paper Summary. • Десятки улучшений и исправлений: фильтры на странице «Модели», поиск в «Журнале аудита», корректные HTML-отчёты (в т. ч. с оценками DREAD), подсказки в мастерах настройки атак и многое другое.