Термин
Triton Inference Server
Англ.: NVIDIA Triton
Короткое определение
Открытый сервер NVIDIA для развёртывания многих моделей за единым быстрым API с пакетированием, планированием и разделением GPU между типами моделей.
Triton обслуживает модели из разных фреймворков вместе с динамическим пакетированием и многомодельным планированием, чтобы модели зрения, аудио и языка эффективно делили GPU. Частая основа продакшен-конвейеров видео-ИИ.
Считаете параметры для своего продукта?
Поможем собрать энкодер-леддер и посчитать стоимость доставки – до старта разработки.