Термин

Vision Transformer (ViT)

Англ.: ViT
Короткое определение

Нейросеть, применяющая архитектуру трансформера к участкам изображения вместо слов. Сегодня – основа большинства передовых моделей зрения.

Vision Transformer (ViT) делит изображение на патчи, относится к каждому как к токену и связывает их механизмом внимания. Он во многом обогнал старые свёрточные архитектуры по точности на масштабе и лежит в основе современных детекторов, сегментаторов и мультимодальных моделей.

Считаете параметры для своего продукта?

Поможем собрать энкодер-леддер и посчитать стоимость доставки – до старта разработки.