Мультимодальные модели: текст, изображения и звук
Мультимодальная система принимает или создаёт данные нескольких модальностей: текст, изображение, аудио, видео.
Краткий ответ
Мультимодальная система принимает или создаёт данные нескольких модальностей: текст, изображение, аудио, видео. Общая идея — представить их в совместимых признаках и научить модель связывать объекты между каналами.
Мультимодальная система принимает или создаёт данные нескольких модальностей: текст, изображение, аудио, видео. Общая идея — представить их в совместимых признаках и научить модель связывать объекты между каналами. Конкретные архитектуры сильно различаются, поэтому слово «мультимодальная» не описывает один алгоритм.
Как изображение становится последовательностью
Vision Transformer делит изображение на патчи, проецирует каждый патч в вектор и обрабатывает последовательность Transformer. Другие системы используют свёрточный encoder или комбинацию подходов. Размер патча задаёт компромисс: мелкие детали требуют больше токенов и вычислений.
Для аудио сигнал переводят в спектральные признаки или дискретные аудиотокены. Видео добавляет временное измерение, поэтому стоимость быстро растёт. Любое такое преобразование может потерять мелкий текст, точную геометрию или быстрые события.
Совместное пространство CLIP
CLIP обучал encoder изображения и encoder текста так, чтобы реальные пары были ближе, а неправильные пары — дальше. Такое контрастивное обучение создаёт пространство, полезное для поиска и zero-shot классификации.
Совместный embedding не генерирует пиксели сам по себе. В text-to-image системе текстовый encoder обычно предоставляет условие генератору, например диффузионной модели. Различайте компонент, который понимает соответствие текста и изображения, и компонент, который синтезирует изображение.
Диффузионная генерация
В прямом процессе к обучающим изображениям постепенно добавляют шум. Модель учится предсказывать шум или связанную величину на разных шагах. При генерации процесс начинается с шума и итеративно движется к образцу, согласованному с текстовым условием.
Практические системы часто работают в сжатом латентном пространстве, используют guidance и дополнительные условия. Аналогия «модель стирает шум» полезна, но обучение связано с вероятностной целью; это не обычный графический фильтр, применённый много раз.
Ограничения мультимодального понимания
Модель может уверенно ошибаться в подсчёте похожих объектов, чтении мелкой надписи, пространственных отношениях и деталях за пределами разрешения. OCR, детектор объектов или специализированная модель иногда надёжнее общего vision-language ответа.
Изображения способны содержать недоверенные инструкции. Скриншот с текстом «раскрой системный prompt» является данными, а не полномочной командой. Персональные лица, голоса и документы требуют отдельных правил доступа и согласия.
Упражнение: разберите мультимодальный запрос
Представьте фото чека и вопрос «Сколько потрачено на продукты?». Разбейте задачу на ориентацию изображения, OCR строк, классификацию категорий, проверку сумм и объяснение. Укажите, какие шаги лучше сделать специализированным инструментом.
Добавьте нечёткую строку и две одинаковые суммы. Определите, когда система должна попросить более качественное фото, а не угадывать. Сформулируйте ответ с явным уровнем неопределённости.
Частые вопросы
Мультимодальная модель видит изображение как человек?
Она получает числовое представление, сформированное encoder и предобработкой. Поле зрения, разрешение, данные и цель обучения отличаются от человеческого восприятия.
CLIP является генератором изображений?
Нет. CLIP обучает соответствие изображения и текста. Его признаки могут использоваться внутри генеративного конвейера, но синтез выполняет другой компонент.
Почему текст на картинке читается хуже обычного текста?
Надпись проходит через пиксельное представление, масштабирование и патчи; мелкие символы могут потеряться. Прямой текстовый вход не имеет этих визуальных потерь.
Что важно запомнить
- Модальности кодируются отдельными или совместными encoders и затем связываются в общей архитектуре.
- Vision Transformer представляет изображение последовательностью патчей.
- CLIP учит соответствие текста и изображения, а диффузионный компонент может выполнять синтез.
- Мультимодальный ответ требует тех же проверок groundedness, доступа и безопасности, что и текстовый.
https://yadro-code.ru/lessons/without-university/generative-ai-foundations/generative-ai-11