Справочник

Глоссарий ИИ в видеоинженерии

Короткие определения с синонимами и ссылками на статьи, где термин разобран подробно. Все термины на одной странице – ищите поиском или прыгайте по алфавиту.

150 терминов опубликованоиз ~150 запланированных

С чего начать

Ключевые термины

Если читать словарь целиком некогда – это тот минимум, на котором держатся остальные 138 терминов.

А

Б

В

Векторная база данных

векторное хранилище

Хранилище для эмбеддингов, быстро находящее ближайшие к запросу. Движок извлечения под семантическим поиском и RAG.

Подробнее

Веса модели

параметры

Обученные числа внутри нейросети. Обучение их создаёт; их количество (например, 7B = 7 млрд) говорит о размере, способностях и цене модели.

Подробнее

Виртуальный фон

замена фона

Замена реального фона за человеком в звонке на картинку или сцену; строится на сегментации в реальном времени плюс композитинге.

Подробнее

Внимание (attention)

самовнимание

Механизм, позволяющий модели взвешивать, какие части входа важнее для каждого выхода. Ключевая идея, заставляющая трансформеры работать.

Подробнее

Выборка кадров (frame sampling)

отбор кадров

Выбор того, какие кадры подать модели, а не все подряд, чтобы снизить цену и токены, сохранив достаточно информации о клипе.

Подробнее

Г

Д

Детекция лиц

обнаружение лиц

Поиск лиц на изображении рамками – без установления личности. Первый шаг перед размытием, кадрированием или распознаванием.

Подробнее

Детекция с открытым словарём

open-set детекция

Обнаружение категорий, заданных текстом во время работы, а не фиксированным набором из обучения. Одна модель находит произвольные новые объекты.

Подробнее

Диаризация говорящих

диаризация

Определение, кто и когда говорил в аудио – разметка сегментов «Говорящий 1», «Говорящий 2» – необязательно зная имена.

Подробнее

Дистилляция знаний

дистилляция

Обучение маленькой модели-«ученика» копировать большую «учителя», чтобы получить почти то же качество за долю размера, цены и задержки.

Подробнее

Диффузионная модель

диффузия

Доминирующий подход к генерации изображений и видео: начать с шума и шаг за шагом уточнять его в чистый результат по запросу.

Подробнее

Дообучение (fine-tuning)

файн-тюнинг, доменная адаптация

Берётся общая предобученная модель и немного дообучается на своих данных под узкую задачу – без старта с нуля.

Подробнее

Ж

З

И

ИИ-аватар

цифровой аватар, HeyGen, Tavus

Синтетический экранный ведущий, созданный из реального или придуманного лица, управляемый текстом или звуком, чтобы говорить и двигаться. Видео без съёмок.

Подробнее

ИИ-агент

автономный агент

ИИ-система, идущая к цели, самостоятельно выбирая шаги – вызывая инструменты, читая результаты и действуя – вместо ответа на один запрос.

Подробнее

ИИ-ассистент встреч

AI-нотетейкер, копилот встреч

Бот, который входит в звонки, чтобы транскрибировать, суммировать и фиксировать задачи; также ИИ-нотетейкер. Флагманская категория ИИ реального времени.

Подробнее

ИИ-дубляж

автодубляж

Автоматический перевод и переозвучка видео на другой язык через ASR, перевод, синтез голоса и lip-sync, вместо найма актёров озвучки.

Подробнее

ИИ-модерация контента

модерация, trust and safety

Автоматическая проверка живого или загруженного медиа на небезопасный контент – нагота, насилие, абьюз – чтобы блокировать, размывать или помечать на масштабе.

Подробнее

Инстанс-сегментация

Пиксельные маски, разделяющие отдельные объекты – не просто «пиксели людей», а «человек 1» и «человек 2». Сочетает детекцию и сегментацию.

Подробнее

Интеллектуальная видеоаналитика (IVA)

IVA, видеоаналитика

ПО, автоматически превращающее видеопотоки в бизнес- или охранные сигналы – подсчёты, оповещения, время пребывания – поверх детекции и трекинга.

Подробнее

Инференс

инференс, предсказание

Запуск обученной модели на новых данных ради предсказания. Основная стоимость ИИ-функции возникает именно на инференсе, а не на обучении.

Подробнее

Использование инструментов (tool use)

вызов функций, function calling

Возможность модели вызывать внешние функции – поиск, детектор, базу – чтобы действовать и доставать факты, а не полагаться только на память.

Подробнее

К

Кадр (frame)

видеокадр

Одно неподвижное изображение в видео. Видео – это быстрая череда кадров; большинство CV работает покадрово, поэтому число кадров влияет на качество и цену.

Подробнее

Квантизация

квантование

Уменьшение модели за счёт хранения весов с меньшей числовой точностью, чтобы она занимала меньше памяти и работала быстрее, обычно почти без потери точности.

Подробнее

Классификация изображений

классификация

Присвоение одной метки всему изображению – «кот», «оружие», «безопасно» – без локализации. Простейшая CV-задача и кирпичик детекторов.

Подробнее

Клонирование голоса

синтез голоса

Воссоздание голоса конкретного человека из образцов, чтобы TTS говорил этим голосом. Сильно для дубляжа, но юридически и этически сложно – нужно согласие.

Подробнее

Ключевая точка (keypoint)

лэндмарк, ориентир

Один отслеживаемый ориентир – сустав, точка лица, кончик пальца. Модели позы и лица выдают наборы keypoints, описывающие форму и движение.

Подробнее

Компьютерное зрение

CV, машинное зрение

Область, обучающая ПО извлекать смысл из изображений и видео – обнаруживать, классифицировать, отслеживать и измерять то, что в кадре.

Подробнее

Контрастное обучение

Метод обучения, сближающий совпадающие пары и раздвигающий несовпадающие в пространстве эмбеддингов. Так CLIP связывает картинки с текстом.

Подробнее

М

О

Облачный инференс

серверный инференс

Запуск моделей в удалённом дата-центре по сети. Легко масштабируется и использует мощные GPU, но добавляет задержку и плату за каждый вызов.

Подробнее

Обнаружение аномалий

детекция аномалий

Выявление событий, отклоняющихся от нормы – падение, вторжение, дефект – без размеченного примера каждой возможной проблемы.

Подробнее

Обнаружение объектов

детекция объектов

Поиск объектов на изображении с рамкой и меткой вокруг каждого. Базовый примитив для видеонаблюдения, ритейла и спортивного видео.

Подробнее

Обучение

тренировка

Настройка модели на размеченных примерах, пока её внутренние веса не начнут давать верные предсказания. Делается один раз и стоит куда дороже инференса.

Подробнее

Ограничивающая рамка (bounding box)

bbox, рамка

Прямоугольник, который детектор рисует вокруг объекта: координаты углов, метка и уверенность. Базовая форма вывода детекции.

Подробнее

Окно контекста

длина контекста

Максимальный объём входа – в токенах – который модель учитывает за раз. Ограничивает, сколько видео, транскрипта или документа помещается в один запрос.

Подробнее

Оптический поток (optical flow)

поле движения

Попиксельное движение между двумя кадрами в виде поля векторов. Лежит в основе стабилизации, интерполяции кадров и анализа движения.

Подробнее

Оценка глубины (depth estimation)

монокулярная глубина

Предсказание расстояния каждого пикселя до камеры из обычного 2D-видео. Даёт 3D-эффекты, AR с учётом перекрытий и понимание сцены.

Подробнее

Оценка позы (pose estimation)

трекинг позы

Поиск положения суставов – плечи, локти, колени – для считывания осанки и движения. Питает фитнес, спорт и жесты.

Подробнее

П

Перевод в реальном времени

живой перевод

Перевод речи на другой язык по ходу разговора, чтобы два человека без общего языка могли говорить вживую.

Подробнее

Повторная идентификация (Re-ID)

Re-ID

Повторное узнавание того же объекта или человека после ухода и возврата в кадр по визуальной сигнатуре. Позволяет трекингу переживать разрывы и смену камер.

Подробнее

Пословные таймкоды

выравнивание, тайминги слов

Точное время начала и конца каждого расшифрованного слова. Позволяет субтитрам подсвечиваться синхронно и резать клипы по границам слов.

Подробнее

Потоковый ASR

онлайн ASR

Расшифровка речи по мере произнесения, слово за словом, без ожидания конца аудио. Нужен для живых субтитров и голосовых агентов.

Подробнее

Предобработка (preprocessing)

препроцессинг

Подготовка сырых кадров для модели – масштаб, кроп, цветокоррекция, нормализация – ради чистого согласованного входа. Незаметно решает многое для точности.

Подробнее

Промпт-инжиниринг

промптинг

Составление инструкций и примеров для модели ради лучшего и надёжного результата, не меняя саму модель.

Подробнее

Промптируемая сегментация

интерактивная сегментация

Сегментация того, на что указал пользователь – клик, рамка, текст – а не фиксированного списка классов. Модель взаимодействия, популяризованная SAM.

Подробнее

Пропускная способность

QPS

Сколько работы система выполняет за единицу времени – кадров в секунду, запросов в секунду. Конфликтует с задержкой при пакетировании запросов.

Подробнее

Р

С

Т

Ц

Ш

Э

A

AgentOps

наблюдаемость агентов

Практика и инструменты эксплуатации агентов в продакшене – оценка, трассировка, учёт стоимости и защита – чтобы автономные системы оставались надёжными и безопасными.

Подробнее

AR-эффекты

AR-фильтры, бьюти-фильтр

AR-наложения в реальном времени на лицо или сцену в видео – фильтры, маски, сглаживание, коррекция взгляда – на основе трекинга лица и позы.

Подробнее

ASR (распознавание речи)

STT, распознавание речи

Automatic Speech Recognition – превращение звучащей речи в текст. Базовый слой для субтитров, транскриптов, голосовых команд и заметок встреч.

Подробнее

ASR на клиенте

ASR в браузере

Запуск распознавания речи в браузере или на устройстве пользователя вместо сервера: аудио остаётся локальным, поминутная облачная плата исчезает.

Подробнее

AutoGen

Фреймворк Microsoft для многоагентных диалогов, где агенты общаются друг с другом и с инструментами ради решения задачи. Ранний влиятельный набор для агентов.

Подробнее

B

C

C2PA

Content Credentials

Открытый стандарт привязки защищённого от подделки происхождения к медиа, фиксирующий, как файл создан или изменён. Техническая основа меток «сгенерировано ИИ».

Подробнее

Claude

Claude Opus, Claude Sonnet

Семейство флагманских языковых и мультимодальных моделей Anthropic, используемое через API для рассуждений, длинного контекста, зрения и агентного вызова инструментов.

Подробнее

Claude Agent SDK

Claude Code SDK

Набор Anthropic для построения автономных агентов, исполняющих собственный цикл вызова инструментов, с доступом к файлам и командам. Ранее Claude Code SDK.

Подробнее

Claude Code

Агентный инструмент Anthropic для кодинга в терминале: читает кодовую базу, редактирует файлы и запускает команды для выполнения задач разработки.

Подробнее

CLIP

Модель, отображающая изображения и текст в общее пространство, чтобы оценивать, насколько подпись соответствует картинке. Базовый приём за open-vocabulary зрением.

Подробнее

Computer-use агент

Operator, Perplexity Comet

Агент, управляющий софтом как человек – смотрит на экран, кликает и печатает – выполняя задачи в приложениях без специальных API.

Подробнее

CrewAI

Фреймворк агентов, организующий несколько ролевых агентов в «команду», совместно решающую задачу. Популярен для многоагентных сценариев.

Подробнее

D

E

F

G

Gemini

Google Gemini

Семейство флагманских мультимодальных моделей Google, принимающих текст, изображения, звук и видео. Доступно через API как закрытая модель с очень большим контекстом.

Подробнее

GGUF

Однофайловый формат для распространения квантованных языковых и мультимодальных моделей; популярен для эффективного запуска на CPU и потребительских GPU.

Подробнее

GPT

ChatGPT, GPT-5

Линейка флагманских языковых и мультимодальных моделей OpenAI, доступная через платный API. Выбор закрытой модели по умолчанию для рассуждений и зрения.

Подробнее

GPU

видеокарта, ускоритель

Graphics Processing Unit – параллельный чип, на котором работает почти весь современный ИИ. Доступность и цена GPU определяют стоимость self-hosting.

Подробнее

Grounding DINO

Детектор с открытым словарём, находящий объекты по свободному текстовому запросу, а не по фиксированному списку – найти «красный рюкзак» без переобучения.

Подробнее

I

J

K

L

LangGraph

Фреймворк для построения агентных приложений как графов шагов с точным контролем состояния, ветвлений и циклов. Ведущий инструмент оркестрации агентов.

Подробнее

Lip-sync (синхрон губ)

синхронизация губ

Подгонка движений рта лица под заданную аудиодорожку, чтобы говорящая голова выглядела действительно произносящей слова. Ключ к ИИ-аватарам и дубляжу.

Подробнее

LiveKit

LiveKit Agents

Открытый стек реального времени и фреймворк агентов, позволяющий ИИ войти в WebRTC-звонок полноценным участником, который слышит, видит и говорит.

Подробнее

LLaVA

LLaVA-NeXT

Популярная открытая модель «зрение-язык», соединяющая энкодер изображений с открытой LLM; частая база для self-hosted мультимодальных функций.

Подробнее

LLM (большая языковая модель)

большая языковая модель

Модель, обученная на огромных текстах, предсказывающая и генерирующая язык. Движок рассуждений за чатом, суммаризацией и большинством агентных систем.

Подробнее

LLM-как-судья

оценка моделью

Использование сильной языковой или мультимодальной модели для автоматической оценки вывода другой модели, масштабируя проверку за пределы ручного ревью.

Подробнее

LoRA

Low-Rank Adaptation

Low-Rank Adaptation – дешёвый метод дообучения, тренирующий маленькие добавочные слои вместо всей модели, чтобы кастомизировать большие модели на скромном железе.

Подробнее

M

N

O

P

Q

R

RAFT

Lucas-Kanade

Глубокая модель оптического потока, точная на сложном движении. Современный выбор по умолчанию, когда классических методов вроде Lucas-Kanade не хватает.

Подробнее

RAG (генерация с извлечением)

генерация с извлечением

Подача языковой модели релевантных фактов, извлечённых из ваших данных в момент запроса, чтобы ответы опирались на реальные источники, а не только на память.

Подробнее

Real-ESRGAN

Популярная открытая модель апскейла реальных изображений и видео, хорошо восстанавливающая детали в сжатом или повреждённом материале.

Подробнее

RNNoise

Крошечная эффективная открытая модель шумоподавления голоса в реальном времени, достаточно лёгкая для запуска в браузере через WebAssembly.

Подробнее

Runway

Runway ML

Коммерческая платформа генеративного видео с text- и image-to-video и инструментами монтажа; популярна у креаторов и пост-продакшена.

Подробнее

S

T

V

Veo

Google Veo

Модель text-to-video от Google, известная генерацией синхронного звука вместе с изображением и выводом высокого разрешения.

Подробнее

Video RAG

мультимодальный RAG

Применение RAG к видеоархиву: находить нужные моменты по смыслу, а затем дать модели ответить на вопросы или их суммировать.

Подробнее

Vision Transformer (ViT)

ViT

Нейросеть, применяющая архитектуру трансформера к участкам изображения вместо слов. Сегодня – основа большинства передовых моделей зрения.

Подробнее

vLLM

PagedAttention

Открытый высокопроизводительный движок для обслуживания языковых и мультимодальных моделей; использует PagedAttention и непрерывное пакетирование, чтобы упаковать много запросов на GPU.

Подробнее

VLM (модель «зрение-язык»)

модель зрение-язык

Модель, принимающая изображения или видео плюс текст и выдающая текст – описывая, отвечая на вопросы или рассуждая об увиденном.

Подробнее

VRAM

память GPU

Память видеокарты. Модель запустится, только если её веса и рабочие данные помещаются в VRAM, поэтому объём VRAM ограничивает выбор моделей.

Подробнее

W

WebAssembly (WASM)

WASM

Быстрый переносимый бинарный формат, исполняющий близкий к нативному код в браузере; используется для запуска ИИ-моделей вроде шумоподавления и ASR на клиенте.

Подробнее

WebGPU

Браузерный API с прямым доступом к GPU, чтобы ИИ-модели работали быстро на стороне клиента без установки.

Подробнее

WebRTC

Web Real-Time Communication

Открытый стандарт, позволяющий браузерам и приложениям напрямую обмениваться аудио, видео и данными в реальном времени. Транспортный слой под большинством видеозвонков.

Подробнее

WER (пословная ошибка)

пословная ошибка

Стандартная метрика точности распознавания речи: доля неверных слов, меньше – лучше. Позволяет сравнивать ASR на одном аудио.

Подробнее

Whisper

faster-whisper

Открытое семейство моделей распознавания речи от OpenAI, сильное во многих языках. Частый бесплатный базис для транскрипции и субтитров.

Подробнее

WhisperX

Улучшенный конвейер Whisper с точными пословными таймкодами и метками говорящих, чтобы транскрипт плотно совпадал со звуком и с тем, кто говорил.

Подробнее

Y

Z

Термин встретился в статье без определения? Напишите нам – добавим в глоссарий.

Нужен не словарь, а команда?

Разрабатываем видеопродукты с 2005 года: стриминг, ВКС, ИИ на видео. 250+ проектов.