Термин

Мультимодальный ИИ

Англ.: мультимодальные модели
Короткое определение

ИИ, обрабатывающий вместе несколько видов входа – изображение или видео плюс текст или звук – и рассуждающий по ним в одной модели.

Мультимодальный ИИ сплавляет сигналы, ранее требовавшие отдельных систем, так что одна модель может смотреть клип и отвечать о нём словами. Это основа понимания видео, визуального поиска и ассистентов, которые «видят» так же, как читают.

Считаете параметры для своего продукта?

Поможем собрать энкодер-леддер и посчитать стоимость доставки – до старта разработки.