Данная дисциплина посвящена комплексному анализу проблем безопасности систем искусственного интеллекта, начиная от технических аспектов (состязательные атаки, джейлбрейки, валидация) и заканчивая фундаментальными вопросами выравнивания (alignment) и контроля над всё более сложными моделями. Курс исследует, как некорректно заданные цели, смещённые данные или недостаточная спецификация человеческих предпочтений могут приводить к непредвиденному и потенциально опасному поведению ИИ, а также рассматривает современные подходы к тестированию, верификации и управлению этими рисками. Целью освоения является формирование у студентов системного понимания ландшафта угроз, связанных с ИИ, и принципов построения надёжных, подконтрольных и безопасных систем, способных эффективно взаимодействовать с человеком.
Программа дисциплины
Аннотация