Термин
VLM (модель «зрение-язык»)
Англ.: модель зрение-язык
Короткое определение
Модель, принимающая изображения или видео плюс текст и выдающая текст – описывая, отвечая на вопросы или рассуждая об увиденном.
Vision-language model соединяет визуальный энкодер с языковой моделью, чтобы вы задавали вопросы на обычном языке о картинке или клипе и получали письменный ответ. VLM всё чаще заменяют кастомные детекторы там, где гибкость важнее пиковой скорости.
Считаете параметры для своего продукта?
Поможем собрать энкодер-леддер и посчитать стоимость доставки – до старта разработки.