Материал
Чек-лист видео-стенда оценки – сборка на LLM в роли судьи
Одна страница: как собрать надёжный стенд оценки для видео-ИИ функции. Пять частей стенда (эталонный набор, тестируемая функция, судья, оценочная карта, ворота); почему метрики совпадения слов (BLEU/ROUGE) и текстовые судьи проваливаются на видео; когда нужна VLM в роли судьи, читающая выборку кадров для проверки заземления; три решения по режиму оценки (поэлементно/попарно, с эталоном/без, грубая/тонкая шкала); три контроля смещений (перестановка-усреднение против позиции, лимит длины против многословия, судья из другого семейства против самопредпочтения); и шаг «а судьи кто» (измерьте согласие с людьми каппой Коэна до доверия любому автоматическому баллу). Соответствует функции MEASURE из NIST AI RMF и ISO/IEC 42001.
Что внутри
- Пять частей стенда
- Почему метрики совпадения слов слепнут, и когда нужен VLM-судья
- Три решения по режиму оценки
- Нейтрализуй три стоящих смещения судьи
- А судьи кто (сделай это ДО доверия любому автоматическому баллу)
- Перед выпуском функции спроси:
Кому пригодится
Командам, которые не могут ответить, стало ли лучше после правки промпта. Чек-лист собирает стенд из пяти частей, объясняет, почему BLEU и ROUGE проваливаются на видео, когда нужен судья, читающий кадры, и как гасить три смещения – а до доверия любому автоматическому баллу требует измерить согласие судьи с людьми каппой Коэна.

Без регистрации и почты – файл открывается сразу
Источник
Из какого курса материал
ИИ в видеоинженерии
Компьютерное зрение, речь, мультимодальные модели, генеративное видео, агенты и регламент ЕС об ИИ.
Стенды оценки ИИ-функций видео – LLM-as-judge
Стенд оценки (eval rig) – это испытательная установка для ИИ-функции, результат которой нельзя проверить простым знаком…
Ещё материалы
Похожие материалы
Все материалы →Выбираете технологию под проект?
Пройдём чек-лист вместе и посчитаем стоимость вариантов на ваших объёмах.