Короткое определение

Модель, отображающая изображения и текст в общее пространство, чтобы оценивать, насколько подпись соответствует картинке. Базовый приём за open-vocabulary зрением.

CLIP учится на парах «картинка-подпись» располагать связанные изображения и слова рядом в одном пространстве, давая zero-shot классификацию и текстовый поиск картинок. Это фундаментальный кирпичик многих мультимодальных и open-vocabulary систем.

Считаете параметры для своего продукта?

Поможем собрать энкодер-леддер и посчитать стоимость доставки – до старта разработки.