Термин

VLM (модель «зрение-язык»)

Англ.: модель зрение-язык
Короткое определение

Модель, принимающая изображения или видео плюс текст и выдающая текст – описывая, отвечая на вопросы или рассуждая об увиденном.

Vision-language model соединяет визуальный энкодер с языковой моделью, чтобы вы задавали вопросы на обычном языке о картинке или клипе и получали письменный ответ. VLM всё чаще заменяют кастомные детекторы там, где гибкость важнее пиковой скорости.

Считаете параметры для своего продукта?

Поможем собрать энкодер-леддер и посчитать стоимость доставки – до старта разработки.