Данная дисциплина посвящена комплексному анализу проблем безопасности систем искусственного интеллекта, начиная от технических аспектов (состязательные атаки, джейлбрейки, валидация) и заканчивая фундаментальными вопросами выравнивания (alignment) и контроля над всё более сложными моделями. Курс исследует, как некорректно заданные цели, смещённые данные или недостаточная спецификация человеческих предпочтений могут приводить к непредвиденному и потенциально опасному поведению ИИ, а также рассматривает современные подходы к тестированию, верификации и управлению этими рисками. Целью освоения является формирование у студентов системного понимания ландшафта угроз, связанных с ИИ, и принципов построения надёжных, подконтрольных и безопасных систем, способных эффективно взаимодействовать с человеком.
Цель освоения дисциплины
Сформировать у студентов системное понимание ландшафта угроз, связанных с ИИ, и принципов построения надёжных, подконтрольных и безопасных систем, способных эффективно взаимодействовать с человеком.
Планируемые результаты обучения
Формализует цель и ограничения состязательной атаки как задачу оптимизации
Реализует не менее трёх белоящичных алгоритмов атаки и оценивает уязвимость стандартных классификаторов
Разграничивает гарантии эмпирических и сертифицированных защит
Обосновывает теоретическую неизбежность компромисса между робастностью и точностью
Классифицирует технические маршруты джейлбрейк-атак и различия их моделей угроз
Воспроизводит как минимум один метод джейлбрейка и измеряет долю успешных атак (ASR)
Объясняет причины параметрической хрупкости безопасного выравнивания
Оценивает границы эффективности существующих защит при различных моделях угроз
Различает механизмы отказа «генерализации способностей» и «генерализации целей»
Конструирует простой пример взлома вознаграждения и анализирует условия его возникновения
Формулирует ключевую трудность масштабируемого надзора: стратегии выравнивания при задачах, превышающих возможности прямой человеческой оценки
Оценивает границы применимости RLHF, Constitutional AI и родственных подходов
Идентифицирует аномальные паттерны поведения в производственной среде, требующие эскалации
Сравнивает архитектуры контроля ИИ по условиям отказа при расширении разрыва в способностях
Аргументирует условия перехода механистической интерпретируемости от «понимания» к «верификации»
Сопоставляет технические меры безопасности с требованиями регуляторного соответствия
Критически анализирует пробелы в возможностях текущих условиях управления безопасностью ИИ
Содержание учебной дисциплины
Состязательные атаки и валидация робастности
Джейлбрейки больших языковых моделей и уязвимость выравнивания
Структурные трудности проблемы выравнивания
Проблема контроля и обнаружение признаков рассогласования
Управление ИИ и институционализация оценки безопасности
Элементы контроля
Экзамен
Практическая работа №2
Практическая работа №1
Промежуточная аттестация
2026/2027 3rd module
0.3 * Практическая работа №1 + 0.4 * Экзамен + 0.3 * Практическая работа №2
Список литературы
Рекомендуемая основная литература
Администрирование и кибербезопасность информационных систем - Часовских В. П., Акчурина Г. А., Лабунец В. Г., Стариков Е. Н., Кох Е. В. - Уральский государственный экономический университет - - - 2022 - русский - https://e.lanbook.com/book/417746 - ЛАНЬ - 417746
Безопасность систем искусственного интеллекта. Ч. 2: Доверенный искусственный интеллект - Ложников П. С., Самотуга А. Е., Жумажанова С. С., Сулавко А. Е. - Омский государственный технический университет - 978-5-8149-3731-5 - 2023 - русский - https://e.lanbook.com/book/421598 - ЛАНЬ - 421598
Рекомендуемая дополнительная литература
Кузнецова, А. В., Искусственный интеллект и информационная безопасность общества : монография / А. В. Кузнецова, С. И. Самыгин, М. В. Радионов. — Москва : Русайнс, 2020. — 118 с. — ISBN 978-5-4365-1558-8. — URL: https://book.ru/book/934089 (дата обращения: 01.07.2026). — Текст : электронный.
Программа дисциплины
Аннотация
Цель освоения дисциплины
Планируемые результаты обучения
Содержание учебной дисциплины
Элементы контроля
Промежуточная аттестация
Список литературы
Рекомендуемая основная литература
Рекомендуемая дополнительная литература
Авторы