Короткое определение

Однофайловый формат для распространения квантованных языковых и мультимодальных моделей; популярен для эффективного запуска на CPU и потребительских GPU.

GGUF упаковывает веса модели, метаданные и токенизатор в один файл, созданный для экосистемы llama.cpp. Это распространённый способ поставлять компактные квантованные модели, работающие на ноутбуках и edge-устройствах без тяжёлого ML-фреймворка.

Считаете параметры для своего продукта?

Поможем собрать энкодер-леддер и посчитать стоимость доставки – до старта разработки.