• A
  • A
  • A
  • ABC
  • ABC
  • ABC
  • А
  • А
  • А
  • А
  • А
Regular version of the site

HSE Campus in St PetersburgBachelor's programmesSchool of Computer Science, Physics and Technology

For visually-impairedFor visually-impairedUser profile (HSE staff only)Search

01.03.02 Applied Mathematics and Informatics

Bachelor’s Programme

Applied Data Analysis and Artificial Intelligence

AI Safety

2026/2027
Academic Year
RUS
Instruction in Russian
3
ECTS credits
Delivered at:
Department of Informatics
Course type:
Elective course
When:
4 year, 3 module

Программа дисциплины

Аннотация

Данная дисциплина посвящена комплексному анализу проблем безопасности систем искусственного интеллекта, начиная от технических аспектов (состязательные атаки, джейлбрейки, валидация) и заканчивая фундаментальными вопросами выравнивания (alignment) и контроля над всё более сложными моделями. Курс исследует, как некорректно заданные цели, смещённые данные или недостаточная спецификация человеческих предпочтений могут приводить к непредвиденному и потенциально опасному поведению ИИ, а также рассматривает современные подходы к тестированию, верификации и управлению этими рисками. Целью освоения является формирование у студентов системного понимания ландшафта угроз, связанных с ИИ, и принципов построения надёжных, подконтрольных и безопасных систем, способных эффективно взаимодействовать с человеком.
Цель освоения дисциплины

Цель освоения дисциплины

  • Сформировать у студентов системное понимание ландшафта угроз, связанных с ИИ, и принципов построения надёжных, подконтрольных и безопасных систем, способных эффективно взаимодействовать с человеком.
Планируемые результаты обучения

Планируемые результаты обучения

  • Формализует цель и ограничения состязательной атаки как задачу оптимизации Реализует не менее трёх белоящичных алгоритмов атаки и оценивает уязвимость стандартных классификаторов
  • Разграничивает гарантии эмпирических и сертифицированных защит Обосновывает теоретическую неизбежность компромисса между робастностью и точностью
  • Классифицирует технические маршруты джейлбрейк-атак и различия их моделей угроз Воспроизводит как минимум один метод джейлбрейка и измеряет долю успешных атак (ASR)
  • Объясняет причины параметрической хрупкости безопасного выравнивания Оценивает границы эффективности существующих защит при различных моделях угроз
  • Различает механизмы отказа «генерализации способностей» и «генерализации целей»
  • Конструирует простой пример взлома вознаграждения и анализирует условия его возникновения
  • Формулирует ключевую трудность масштабируемого надзора: стратегии выравнивания при задачах, превышающих возможности прямой человеческой оценки
  • Оценивает границы применимости RLHF, Constitutional AI и родственных подходов
  • Идентифицирует аномальные паттерны поведения в производственной среде, требующие эскалации
  • Сравнивает архитектуры контроля ИИ по условиям отказа при расширении разрыва в способностях
  • Аргументирует условия перехода механистической интерпретируемости от «понимания» к «верификации»
  • Сопоставляет технические меры безопасности с требованиями регуляторного соответствия
  • Критически анализирует пробелы в возможностях текущих условиях управления безопасностью ИИ
Содержание учебной дисциплины

Содержание учебной дисциплины

  • Состязательные атаки и валидация робастности
  • Джейлбрейки больших языковых моделей и уязвимость выравнивания
  • Структурные трудности проблемы выравнивания
  • Проблема контроля и обнаружение признаков рассогласования
  • Управление ИИ и институционализация оценки безопасности
Элементы контроля

Элементы контроля

  • блокирующий Экзамен
  • неблокирующий Практическая работа №2
  • неблокирующий Практическая работа №1
Промежуточная аттестация

Промежуточная аттестация

  • 2026/2027 3rd module
    0.3 * Практическая работа №1 + 0.4 * Экзамен + 0.3 * Практическая работа №2
Список литературы

Список литературы

Рекомендуемая основная литература

  • Администрирование и кибербезопасность информационных систем : учебное пособие / В. П. Часовских, Г. А. Акчурина, В. Г. Лабунец [и др.]. — Екатеринбург : УрГЭУ, 2022. — 173 с. — Текст : электронный // Лань : электронно-библиотечная система. — URL: https://e.lanbook.com/book/417746 (дата обращения: 00.00.0000). — Режим доступа: для авториз. пользователей.
  • Безопасность систем искусственного интеллекта : учебное пособие / П. С. Ложников, А. Е. Самотуга, С. С. Жумажанова, А. Е. Сулавко. — Омск : ОмГТУ, 2023 — Часть 2 : Доверенный искусственный интеллект — 2023. — 74 с. — ISBN 978-5-8149-3731-5. — Текст : электронный // Лань : электронно-библиотечная система. — URL: https://e.lanbook.com/book/421598 (дата обращения: 00.00.0000). — Режим доступа: для авториз. пользователей.

Рекомендуемая дополнительная литература

  • Кузнецова, А. В., Искусственный интеллект и информационная безопасность общества : монография / А. В. Кузнецова, С. И. Самыгин, М. В. Радионов. — Москва : Русайнс, 2020. — 118 с. — ISBN 978-5-4365-1558-8. — URL: https://book.ru/book/934089 (дата обращения: 09.12.2025). — Текст : электронный.

Авторы

  • Архимандритов Игорь Борисович
  • Любавина Светлана Вячеславовна