Термин
vLLM
Англ.: PagedAttention
Короткое определение
Открытый высокопроизводительный движок для обслуживания языковых и мультимодальных моделей; использует PagedAttention и непрерывное пакетирование, чтобы упаковать много запросов на GPU.
vLLM резко повышает пропускную способность обслуживания, управляя памятью модели как ОС управляет страницами RAM, и непрерывно пакетируя запросы. Частый выбор self-hosting, когда продукт гоняет открытые модели на масштабе и хочет низкую цену за запрос.
Считаете параметры для своего продукта?
Поможем собрать энкодер-леддер и посчитать стоимость доставки – до старта разработки.