Термин
Vision Transformer (ViT)
Англ.: ViT
Короткое определение
Нейросеть, применяющая архитектуру трансформера к участкам изображения вместо слов. Сегодня – основа большинства передовых моделей зрения.
Vision Transformer (ViT) делит изображение на патчи, относится к каждому как к токену и связывает их механизмом внимания. Он во многом обогнал старые свёрточные архитектуры по точности на масштабе и лежит в основе современных детекторов, сегментаторов и мультимодальных моделей.
Считаете параметры для своего продукта?
Поможем собрать энкодер-леддер и посчитать стоимость доставки – до старта разработки.