Данная дисциплина посвящена комплексному анализу проблем безопасности систем искусственного интеллекта, начиная от технических аспектов (состязательные атаки, джейлбрейки, валидация) и заканчивая фундаментальными вопросами выравнивания (alignment) и контроля над всё более сложными моделями. Курс исследует, как некорректно заданные цели, смещённые данные или недостаточная спецификация человеческих предпочтений могут приводить к непредвиденному и потенциально опасному поведению ИИ, а также рассматривает современные подходы к тестированию, верификации и управлению этими рисками. Целью освоения является формирование у студентов системного понимания ландшафта угроз, связанных с ИИ, и принципов построения надёжных, подконтрольных и безопасных систем, способных эффективно взаимодействовать с человеком.
Цель освоения дисциплины
Сформировать у студентов системное понимание ландшафта угроз, связанных с ИИ, и принципов построения надёжных, подконтрольных и безопасных систем, способных эффективно взаимодействовать с человеком.
Планируемые результаты обучения
Формализует цель и ограничения состязательной атаки как задачу оптимизации
Реализует не менее трёх белоящичных алгоритмов атаки и оценивает уязвимость стандартных классификаторов
Разграничивает гарантии эмпирических и сертифицированных защит
Обосновывает теоретическую неизбежность компромисса между робастностью и точностью
Классифицирует технические маршруты джейлбрейк-атак и различия их моделей угроз
Воспроизводит как минимум один метод джейлбрейка и измеряет долю успешных атак (ASR)
Объясняет причины параметрической хрупкости безопасного выравнивания
Оценивает границы эффективности существующих защит при различных моделях угроз
Различает механизмы отказа «генерализации способностей» и «генерализации целей»
Конструирует простой пример взлома вознаграждения и анализирует условия его возникновения
Формулирует ключевую трудность масштабируемого надзора: стратегии выравнивания при задачах, превышающих возможности прямой человеческой оценки
Оценивает границы применимости RLHF, Constitutional AI и родственных подходов
Идентифицирует аномальные паттерны поведения в производственной среде, требующие эскалации
Сравнивает архитектуры контроля ИИ по условиям отказа при расширении разрыва в способностях
Аргументирует условия перехода механистической интерпретируемости от «понимания» к «верификации»
Сопоставляет технические меры безопасности с требованиями регуляторного соответствия
Критически анализирует пробелы в возможностях текущих условиях управления безопасностью ИИ
Содержание учебной дисциплины
Состязательные атаки и валидация робастности
Джейлбрейки больших языковых моделей и уязвимость выравнивания
Структурные трудности проблемы выравнивания
Проблема контроля и обнаружение признаков рассогласования
Управление ИИ и институционализация оценки безопасности
Элементы контроля
Экзамен
Практическая работа №2
Практическая работа №1
Промежуточная аттестация
2026/2027 3rd module
0.3 * Практическая работа №1 + 0.4 * Экзамен + 0.3 * Практическая работа №2
Список литературы
Рекомендуемая основная литература
Администрирование и кибербезопасность информационных систем : учебное пособие / В. П. Часовских, Г. А. Акчурина, В. Г. Лабунец [и др.]. — Екатеринбург : УрГЭУ, 2022. — 173 с. — Текст : электронный // Лань : электронно-библиотечная система. — URL: https://e.lanbook.com/book/417746 (дата обращения: 00.00.0000). — Режим доступа: для авториз. пользователей.
Безопасность систем искусственного интеллекта : учебное пособие / П. С. Ложников, А. Е. Самотуга, С. С. Жумажанова, А. Е. Сулавко. — Омск : ОмГТУ, 2023 — Часть 2 : Доверенный искусственный интеллект — 2023. — 74 с. — ISBN 978-5-8149-3731-5. — Текст : электронный // Лань : электронно-библиотечная система. — URL: https://e.lanbook.com/book/421598 (дата обращения: 00.00.0000). — Режим доступа: для авториз. пользователей.
Рекомендуемая дополнительная литература
Кузнецова, А. В., Искусственный интеллект и информационная безопасность общества : монография / А. В. Кузнецова, С. И. Самыгин, М. В. Радионов. — Москва : Русайнс, 2020. — 118 с. — ISBN 978-5-4365-1558-8. — URL: https://book.ru/book/934089 (дата обращения: 09.12.2025). — Текст : электронный.
Программа дисциплины
Аннотация
Цель освоения дисциплины
Планируемые результаты обучения
Содержание учебной дисциплины
Элементы контроля
Промежуточная аттестация
Список литературы
Рекомендуемая основная литература
Рекомендуемая дополнительная литература
Авторы