• A
  • A
  • A
  • АБВ
  • АБВ
  • АБВ
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта

НИУ ВШЭ в Санкт-ПетербургеПрограммы бакалавриатаШкола информатики, физики и технологий

РУС
Версия для слабовидящихВерсия для слабовидящихЛичный кабинет сотрудника ВШЭПоиск

01.03.02 Прикладная математика и информатика

Бакалаврская программа

Прикладной анализ данных и искусственный интеллект

Мультимодальное обучение

2026/2027
Учебный год
RUS
Обучение ведется на русском языке
4
Кредиты
Статус:
Курс по выбору
Когда читается:
4-й курс, 1, 2 модуль

Преподаватель

Программа дисциплины

Аннотация

Курс «Мультимодальное обучение» знакомит студентов с принципами построения, обучения и использования моделей, интегрирующих несколько типов данных (текст, изображения, аудио, видео). Рассматриваются фундаментальные архитектуры визуально-языковых моделей (VLM) и мультимодальных LLM (CLIP, BLIP, LLaVA, InternVL и др.), методы pre-training и fine-tuning, работа с мультимодальными датасетами (COCO, LAION‑5B, CC12M, WebVid, AudioSet), а также подходы к оценке качества и интерпретации мультимодальных систем. Особое внимание уделяется практическим аспектам: студенты реализуют прототипы мультимодальных систем (image captioning, video understanding, multimodal retrieval), осваивают автоматизацию генерации датасетов и знакомятся с вопросами надёжности и атак на мультимодальные модели.
Цель освоения дисциплины

Цель освоения дисциплины

  • Понимать принципы работы мультимодальных моделей и их отличие от одномодальных систем (только текст или только изображение).​
  • Различать ключевые типы мультимодальных систем: визуально-языковые модели (VLM), аудио‑визуальные, видео‑текстовые модели, мультимодальные LLM (MLLM).​
  • Объяснять архитектуры популярных open‑source моделей (CLIP, BLIP, LLaVA, InternVL и др.).​
  • Обучать и адаптировать мультимодальные модели к прикладным задачам (fine-tuning, instruction tuning).​
  • Работать с мультимодальными датасетами, включая сбор, предобработку, синхронизацию и генерацию weakly/synthetically aligned пар.​
  • Применять метрики качества для оценки мультимодальных моделей и интерпретировать результаты.​
  • Разрабатывать и презентовать мультимодальные решения под реальные индустриальные кейсы.
Планируемые результаты обучения

Планируемые результаты обучения

  • Сравнивать различные классы мультимодальных моделей (VLM, аудио‑визуальные, видео‑текстовые, MLLM) по входным данным, архитектурам и областям применения.​
  • Реализовывать базовые прототипы задач image–text retrieval, image captioning и video captioning на основе CLIP, BLIP, LLaVA, TimeSformer/VideoMAE.​
  • Создавать и анализировать мультимодальные датасеты (COCO, LAION‑подвыборки, CC12M, WebVid и др.), в том числе формировать слабосвязанные и синтетические пары.​
  • Настраивать мультимодальные модели (в т.ч. LLaVA/InternVL) на собственных данных с использованием доступных фреймворков и репозиториев.​
  • Применять специализированные метрики (Recall@K, CLIPScore, BLEU/CIDEr/METEOR и др.) для задач captioning и retrieval и интерпретировать различия между моделями.​
  • Оценивать устойчивость мультимодальных моделей к типичным атакам (adversarial examples, prompt leakage) и описывать базовые стратегии защиты.​
Содержание учебной дисциплины

Содержание учебной дисциплины

  • Раздел 1. Введение в мультимодальные модели
  • Раздел 2. Основы визуально-языковых моделей (VLM)
  • Раздел 3. Работа с видео в мультимодальных моделях
  • Раздел 4. Данные для мультимодальных моделей и оценка качества
  • Раздел 5. Продвинутые техники и применение
  • Раздел 6. Эффективный инференс мультимодальных моделей
  • Раздел 7. Атаки и надежность мультимодальных моделей
Элементы контроля

Элементы контроля

  • неблокирующий Суммарная оценка за домашние задания
    Домашние задания (3 работы, максимум 50 баллов) ДЗ 1 — 15 баллов. Запуск inference готовых моделей CLIP и BLIP, построение t‑SNE‑визуализации эмбеддингов для набора изображений и подписей, сравнение качества поиска картинок по тексту. ДЗ 2 — 15 баллов. Загрузка поднабора данных через clip‑retrieval, формирование не менее 200 пар «изображение–текст», базовый анализ качества синхронизации (насколько подписи описывают изображения). ДЗ 3 — Автоматическая генерация датасета с помощью LLaVA — 20 баллов. Использование LLaVA для описания изображений из открытого датасета (например, COCO), генерация не менее 100 новых пар «изображение–описание» и сравнительный анализ стиля/качества с оригинальными подписями.
  • блокирующий Оценка за итоговый проект
    Итоговое испытание (экзамен) по курсу проводится в формате защиты финального проекта. Каждый студент (или команда) представляет разработанную мультимодальную систему или её ключевые компоненты: работу с мультимодальными данными (изображения, текст, при желании видео/аудио), выбор и интеграцию моделей (например, CLIP, BLIP, LLaVA, VideoMAE и др.), обучение или дообучение модели, а также демонстрирует полученные результаты (пример работы системы, метрики качества, анализ ограничений) и отвечает на вопросы преподавателей и/или комиссии.​ Защита проекта включает краткую структурированную презентацию постановки задачи и сценариев использования, описания использованных датасетов, выбранных мультимодальных моделей и архитектуры пайплайна (как соединяются энкодеры, генераторы, retrieval‑компоненты), организации экспериментов и расчёта метрик, а также анализ полученных результатов, интерпретацию поведения модели, обсуждение ограничений решения и возможных направлений улучшения и развития системы. Экзамен проводится в сессионный период. Для студентов, получивших неудовлетворительную оценку, предусматривается возможность пересдач. Все пересдачи проводятся в соответствии с Регламентом вуза в период пересдач, ее проводит преподаватель, выставивший оценку по промежуточной аттестации. Время для проведения пересдачи определяется Учебным офисом в рамках расписания дополнительной сессии. Первая пересдача защиты проекта проводится преподавателем курса, выставившим исходную оценку. Формат сохраняется: повторная защита проекта (уточнённая версия решения, доработанные эксперименты и презентация). Накопленные баллы за ДЗ и активность при этом не пересдаются и не пересматриваются. Вторая и последующие пересдачи, при необходимости, проводятся в порядке, предусмотренном внутренними документами университета: в формате устной защиты перед комиссией не менее чем из трёх человек. Состав комиссии и дата такой пересдачи утверждаются распоряжением руководителя департамента или академического руководителя ОП. Итоговая оценка за вторую (комиссионную) пересдачу определяется коллегиальным решением членов комиссии и является окончательной.
Промежуточная аттестация

Промежуточная аттестация

  • 2026/2027 2nd module
    Суммарная оценка за домашние задания + Оценка за итоговый проект Далее суммарная оценка переводится в 10‑балльную шкалу по установленной шкале. Шкала перевода в 10-балльную систему НИУ ВШЭ Оценка (10-балльная) Оценка (100-балльная) Комментарий 10 100 Максимальный результат 9 90–99 Отлично 8 80–89 Очень хорошо 7 70–79 Хорошо 6 60–69 Хорошо 5 50–59 Удовлетворительно 4 40–49 Минимальный порог прохождения 3 30–39 Неудовлетворительно 2 20–29 Явно неудовлетворительно 1 10–19 Практическое отсутствие выполнения
Список литературы

Список литературы

Рекомендуемая основная литература

  • Siddhartha Bhattacharyya, Vaclav Snasel, Aboul Ella Hassanien, Satadal Saha, & B. K. Tripathy. (2020). Deep Learning : Research and Applications. De Gruyter.

Рекомендуемая дополнительная литература

  • Iba, H. (2018). Evolutionary Approach to Machine Learning and Deep Neural Networks : Neuro-Evolution and Gene Regulatory Networks. Singapore: Springer. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=1833749

Авторы

  • Рогачев Александр Игоревич
  • Юнышева Анастасия Владимировна
  • Любавина Светлана Вячеславовна
  • Оленчук Ольга Геннадьевна