Материал
Чек-лист сжатия для edge – дистилляция + квантизация
Одна страница: как сжать ИИ-модели для работы на edge в видео-продукте. Два рычага (дистилляция обучает меньшую модель-ученика; квантизация хранит числа той же модели в меньшем числе бит) и как они перемножаются; арифметика памяти по разрядности для модели на 7 млрд параметров (28 / 14 / 7 / 3,5 ГБ на FP32 / FP16 / INT8 / INT4) против потолка 8 ГБ; шесть методов квантизации (INT8 + калибровка, GPTQ, AWQ, GGUF Q4_K_M, FP8, NVFP4) и для чего каждый; сначала PTQ / QAT при необходимости; решение по этапам видео-конвейера (детекция на INT8/TensorRT, речь на дистиллированной-затем-квантизованной модели, языковые/VLM на 4-бит AWQ/GGUF); и вопросы, которые задать перед сжатием, включая перемер точности на своих кадрах.
Что внутри
- Два рычага, делающих модель меньше
- Арифметика памяти (модель на 7 млрд параметров)
- Методы квантизации (узнавайте в спецификации подрядчика)
- Видео-функция это конвейер - сжимайте каждый этап
- Перед сжатием спросите:
Кому пригодится
Тем, кто загоняет модель в устройство с восемью гигабайтами памяти. Чек-лист разводит дистилляцию и квантизацию, считает память для модели на 7 млрд параметров – 28, 14, 7 и 3,5 ГБ по разрядности – и перечисляет шесть методов квантизации: точность после сжатия надо перемерить на своих кадрах, а не брать из карточки модели.

Без регистрации и почты – файл открывается сразу
Источник
Из какого курса материал
Ещё материалы
Похожие материалы
Все материалы →Выбираете технологию под проект?
Пройдём чек-лист вместе и посчитаем стоимость вариантов на ваших объёмах.