Термин
LLaVA
Англ.: LLaVA-NeXT
Короткое определение
Популярная открытая модель «зрение-язык», соединяющая энкодер изображений с открытой LLM; частая база для self-hosted мультимодальных функций.
LLaVA соединяет визуальный энкодер с открытой языковой моделью, чтобы описывать изображения и отвечать на визуальные вопросы, а её открытые веса делают её частой отправной точкой для команд, строящих или дообучающих свои VLM-функции.
Считаете параметры для своего продукта?
Поможем собрать энкодер-леддер и посчитать стоимость доставки – до старта разработки.