Термин
Мультимодальный ИИ
Англ.: мультимодальные модели
Короткое определение
ИИ, обрабатывающий вместе несколько видов входа – изображение или видео плюс текст или звук – и рассуждающий по ним в одной модели.
Мультимодальный ИИ сплавляет сигналы, ранее требовавшие отдельных систем, так что одна модель может смотреть клип и отвечать о нём словами. Это основа понимания видео, визуального поиска и ассистентов, которые «видят» так же, как читают.
Считаете параметры для своего продукта?
Поможем собрать энкодер-леддер и посчитать стоимость доставки – до старта разработки.