Справочник
Глоссарий ИИ в видеоинженерии
Короткие определения с синонимами и ссылками на статьи, где термин разобран подробно. Все термины на одной странице – ищите поиском или прыгайте по алфавиту.
С чего начать
Ключевые термины
Если читать словарь целиком некогда – это тот минимум, на котором держатся остальные 138 терминов.
А
Агентный ИИ
агентность
ИИ, созданный действовать автономно к целям в несколько шагов, в отличие от генеративного ИИ, который лишь создаёт контент по запросу. Парадигма агентов.
Подробнее →Артефакт модели
файл модели, чекпойнт
Упакованный файл с весами и структурой обученной модели, готовый к загрузке и запуску. Его формат определяет, какие среды смогут его обслуживать.
Подробнее →Б
Бенчмарк
лидерборд
Стандартный тестовый набор и метрика для объективного сравнения моделей. Полезен для отбора, но реальное качество требует и собственной оценки.
Подробнее →Бюджет задержки
бюджетирование задержки
Суммарная задержка, разрешённая функции реального времени, распределённая по шагам так, чтобы сумма держалась под лимитом – часто около 100 мс сквозь живое видео.
Подробнее →В
Векторная база данных
векторное хранилище
Хранилище для эмбеддингов, быстро находящее ближайшие к запросу. Движок извлечения под семантическим поиском и RAG.
Подробнее →Веса модели
параметры
Обученные числа внутри нейросети. Обучение их создаёт; их количество (например, 7B = 7 млрд) говорит о размере, способностях и цене модели.
Подробнее →Виртуальный фон
замена фона
Замена реального фона за человеком в звонке на картинку или сцену; строится на сегментации в реальном времени плюс композитинге.
Подробнее →Внимание (attention)
самовнимание
Механизм, позволяющий модели взвешивать, какие части входа важнее для каждого выхода. Ключевая идея, заставляющая трансформеры работать.
Подробнее →Выборка кадров (frame sampling)
отбор кадров
Выбор того, какие кадры подать модели, а не все подряд, чтобы снизить цену и токены, сохранив достаточно информации о клипе.
Подробнее →Г
Галлюцинация
конфабуляция
Когда модель уверенно выдаёт связное, но ложное или выдуманное. Главный риск надёжности языкового и мультимодального ИИ, который снижают, а не устраняют.
Подробнее →Генеративный ИИ
genAI
ИИ, создающий новый контент – изображения, видео, звук, текст – а не только анализирующий вход. Основа функций синтетических медиа.
Подробнее →Д
Детекция лиц
обнаружение лиц
Поиск лиц на изображении рамками – без установления личности. Первый шаг перед размытием, кадрированием или распознаванием.
Подробнее →Детекция с открытым словарём
open-set детекция
Обнаружение категорий, заданных текстом во время работы, а не фиксированным набором из обучения. Одна модель находит произвольные новые объекты.
Подробнее →Диаризация говорящих
диаризация
Определение, кто и когда говорил в аудио – разметка сегментов «Говорящий 1», «Говорящий 2» – необязательно зная имена.
Подробнее →Дистилляция знаний
дистилляция
Обучение маленькой модели-«ученика» копировать большую «учителя», чтобы получить почти то же качество за долю размера, цены и задержки.
Подробнее →Диффузионная модель
диффузия
Доминирующий подход к генерации изображений и видео: начать с шума и шаг за шагом уточнять его в чистый результат по запросу.
Подробнее →Дообучение (fine-tuning)
файн-тюнинг, доменная адаптация
Берётся общая предобученная модель и немного дообучается на своих данных под узкую задачу – без старта с нуля.
Подробнее →Ж
З
Задержка (latency)
лаг, задержка
Промежуток между входом и результатом, обычно в миллисекундах. В видео реального времени бюджет на ИИ-шаг крошечный – часто менее 100 мс сквозь весь путь.
Подробнее →Закрытая модель
проприетарная модель
Проприетарная модель, доступная только через платный API; веса остаются приватными. Вы меняете контроль и хранение данных на отсутствие забот об инфраструктуре.
Подробнее →И
ИИ-аватар
цифровой аватар, HeyGen, Tavus
Синтетический экранный ведущий, созданный из реального или придуманного лица, управляемый текстом или звуком, чтобы говорить и двигаться. Видео без съёмок.
Подробнее →ИИ-агент
автономный агент
ИИ-система, идущая к цели, самостоятельно выбирая шаги – вызывая инструменты, читая результаты и действуя – вместо ответа на один запрос.
Подробнее →ИИ-ассистент встреч
AI-нотетейкер, копилот встреч
Бот, который входит в звонки, чтобы транскрибировать, суммировать и фиксировать задачи; также ИИ-нотетейкер. Флагманская категория ИИ реального времени.
Подробнее →ИИ-дубляж
автодубляж
Автоматический перевод и переозвучка видео на другой язык через ASR, перевод, синтез голоса и lip-sync, вместо найма актёров озвучки.
Подробнее →ИИ-модерация контента
модерация, trust and safety
Автоматическая проверка живого или загруженного медиа на небезопасный контент – нагота, насилие, абьюз – чтобы блокировать, размывать или помечать на масштабе.
Подробнее →Инстанс-сегментация
Пиксельные маски, разделяющие отдельные объекты – не просто «пиксели людей», а «человек 1» и «человек 2». Сочетает детекцию и сегментацию.
Подробнее →Интеллектуальная видеоаналитика (IVA)
IVA, видеоаналитика
ПО, автоматически превращающее видеопотоки в бизнес- или охранные сигналы – подсчёты, оповещения, время пребывания – поверх детекции и трекинга.
Подробнее →Инференс
инференс, предсказание
Запуск обученной модели на новых данных ради предсказания. Основная стоимость ИИ-функции возникает именно на инференсе, а не на обучении.
Подробнее →Использование инструментов (tool use)
вызов функций, function calling
Возможность модели вызывать внешние функции – поиск, детектор, базу – чтобы действовать и доставать факты, а не полагаться только на память.
Подробнее →К
Кадр (frame)
видеокадр
Одно неподвижное изображение в видео. Видео – это быстрая череда кадров; большинство CV работает покадрово, поэтому число кадров влияет на качество и цену.
Подробнее →Квантизация
квантование
Уменьшение модели за счёт хранения весов с меньшей числовой точностью, чтобы она занимала меньше памяти и работала быстрее, обычно почти без потери точности.
Подробнее →Классификация изображений
классификация
Присвоение одной метки всему изображению – «кот», «оружие», «безопасно» – без локализации. Простейшая CV-задача и кирпичик детекторов.
Подробнее →Клонирование голоса
синтез голоса
Воссоздание голоса конкретного человека из образцов, чтобы TTS говорил этим голосом. Сильно для дубляжа, но юридически и этически сложно – нужно согласие.
Подробнее →Ключевая точка (keypoint)
лэндмарк, ориентир
Один отслеживаемый ориентир – сустав, точка лица, кончик пальца. Модели позы и лица выдают наборы keypoints, описывающие форму и движение.
Подробнее →Компьютерное зрение
CV, машинное зрение
Область, обучающая ПО извлекать смысл из изображений и видео – обнаруживать, классифицировать, отслеживать и измерять то, что в кадре.
Подробнее →Контрастное обучение
Метод обучения, сближающий совпадающие пары и раздвигающий несовпадающие в пространстве эмбеддингов. Так CLIP связывает картинки с текстом.
Подробнее →М
Многообъектный трекинг (MOT)
MOT, трекинг объектов
Слежение за многими объектами между кадрами с сохранением стабильного ID у каждого, даже при перекрытии. Превращает покадровые детекции в траектории.
Подробнее →Модель с открытыми весами
открытые веса
Модель, чьи веса опубликованы для скачивания: её можно self-host, изучать и дообучать, а не только вызывать платный API.
Подробнее →Мультимодальный ИИ
мультимодальные модели
ИИ, обрабатывающий вместе несколько видов входа – изображение или видео плюс текст или звук – и рассуждающий по ним в одной модели.
Подробнее →О
Облачный инференс
серверный инференс
Запуск моделей в удалённом дата-центре по сети. Легко масштабируется и использует мощные GPU, но добавляет задержку и плату за каждый вызов.
Подробнее →Обнаружение аномалий
детекция аномалий
Выявление событий, отклоняющихся от нормы – падение, вторжение, дефект – без размеченного примера каждой возможной проблемы.
Подробнее →Обнаружение объектов
детекция объектов
Поиск объектов на изображении с рамкой и меткой вокруг каждого. Базовый примитив для видеонаблюдения, ритейла и спортивного видео.
Подробнее →Обучение
тренировка
Настройка модели на размеченных примерах, пока её внутренние веса не начнут давать верные предсказания. Делается один раз и стоит куда дороже инференса.
Подробнее →Ограничивающая рамка (bounding box)
bbox, рамка
Прямоугольник, который детектор рисует вокруг объекта: координаты углов, метка и уверенность. Базовая форма вывода детекции.
Подробнее →Окно контекста
длина контекста
Максимальный объём входа – в токенах – который модель учитывает за раз. Ограничивает, сколько видео, транскрипта или документа помещается в один запрос.
Подробнее →Оптический поток (optical flow)
поле движения
Попиксельное движение между двумя кадрами в виде поля векторов. Лежит в основе стабилизации, интерполяции кадров и анализа движения.
Подробнее →Оценка глубины (depth estimation)
монокулярная глубина
Предсказание расстояния каждого пикселя до камеры из обычного 2D-видео. Даёт 3D-эффекты, AR с учётом перекрытий и понимание сцены.
Подробнее →Оценка позы (pose estimation)
трекинг позы
Поиск положения суставов – плечи, локти, колени – для считывания осанки и движения. Питает фитнес, спорт и жесты.
Подробнее →П
Перевод в реальном времени
живой перевод
Перевод речи на другой язык по ходу разговора, чтобы два человека без общего языка могли говорить вживую.
Подробнее →Повторная идентификация (Re-ID)
Re-ID
Повторное узнавание того же объекта или человека после ухода и возврата в кадр по визуальной сигнатуре. Позволяет трекингу переживать разрывы и смену камер.
Подробнее →Пословные таймкоды
выравнивание, тайминги слов
Точное время начала и конца каждого расшифрованного слова. Позволяет субтитрам подсвечиваться синхронно и резать клипы по границам слов.
Подробнее →Потоковый ASR
онлайн ASR
Расшифровка речи по мере произнесения, слово за словом, без ожидания конца аудио. Нужен для живых субтитров и голосовых агентов.
Подробнее →Предобработка (preprocessing)
препроцессинг
Подготовка сырых кадров для модели – масштаб, кроп, цветокоррекция, нормализация – ради чистого согласованного входа. Незаметно решает многое для точности.
Подробнее →Промпт-инжиниринг
промптинг
Составление инструкций и примеров для модели ради лучшего и надёжного результата, не меняя саму модель.
Подробнее →Промптируемая сегментация
интерактивная сегментация
Сегментация того, на что указал пользователь – клик, рамка, текст – а не фиксированного списка классов. Модель взаимодействия, популяризованная SAM.
Подробнее →Пропускная способность
QPS
Сколько работы система выполняет за единицу времени – кадров в секунду, запросов в секунду. Конфликтует с задержкой при пакетировании запросов.
Подробнее →Р
Размытие фона
блюр фона
Смягчение или скрытие всего за человеком в видеозвонке. Опирается на сегментацию в реальном времени, отделяющую передний план от фона на каждом кадре.
Подробнее →Распознавание лиц
распознавание лица
Сопоставление обнаруженного лица с известной личностью. Мощно, но юридически чувствительно – биометрические нормы и EU AI Act сильно ограничивают применение.
Подробнее →Речь-в-речь (speech-to-speech)
S2S, голос-в-голос
Модели, принимающие речь и сразу возвращающие речь, минуя отдельный текстовый этап. Даёт быстрый естественный голосовой диалог.
Подробнее →Ротоскопинг
рото
Вырезание движущегося объекта из каждого кадра для изоляции или замены. Раньше кропотливо вручную, теперь во многом автоматизировано моделями сегментации.
Подробнее →С
Свёрточная нейросеть (CNN)
CNN, ConvNet
Классическая сеть обработки изображений, ищущая локальные паттерны вроде краёв и текстур. Долго была стандартом зрения; эффективна и широко применяется.
Подробнее →Сверхразрешение (super-resolution)
апскейл, SR
Реконструкция изображения или видео большего разрешения из низкокачественного источника с помощью ИИ, с добавлением правдоподобных деталей. Для апскейла старого или сжатого видео.
Подробнее →Семантическая сегментация
попиксельная сегментация
Разметка каждого пикселя по категории – человек, фон, дорога. Питает размытие фона, виртуальные фоны и точное понимание сцены.
Подробнее →Т
Текст-в-видео (text-to-video)
T2V
Генерация видеоклипа по текстовому описанию. Главная способность инструментов вроде Sora, Veo, Runway и Kling.
Подробнее →Токен
токены, токенизация
Маленький фрагмент текста (или участок изображения), который модель читает и пишет. Цена API считается за токены, поэтому токен – единица стоимости ИИ.
Подробнее →Трансформер
архитектура трансформер
Нейросетевая архитектура за современным ИИ, построенная на внимании. Питает языковые модели, vision-трансформеры и большинство мультимодальных систем.
Подробнее →Ц
Ш
Э
Эмбеддинг
вектор, эмбеддинги
Список чисел, схватывающий смысл объекта – слова, изображения, лица, клипа – так что похожее лежит рядом и его можно сравнивать и искать.
Подробнее →Эхоподавление (AEC)
AEC, акустическое эхоподавление
Предотвращение возврата собственного звука говорящего, проигранного с другой стороны, обратно в его микрофон в виде эха. Необходимо для громкой связи.
Подробнее →A
AgentOps
наблюдаемость агентов
Практика и инструменты эксплуатации агентов в продакшене – оценка, трассировка, учёт стоимости и защита – чтобы автономные системы оставались надёжными и безопасными.
Подробнее →AR-эффекты
AR-фильтры, бьюти-фильтр
AR-наложения в реальном времени на лицо или сцену в видео – фильтры, маски, сглаживание, коррекция взгляда – на основе трекинга лица и позы.
Подробнее →ASR (распознавание речи)
STT, распознавание речи
Automatic Speech Recognition – превращение звучащей речи в текст. Базовый слой для субтитров, транскриптов, голосовых команд и заметок встреч.
Подробнее →ASR на клиенте
ASR в браузере
Запуск распознавания речи в браузере или на устройстве пользователя вместо сервера: аудио остаётся локальным, поминутная облачная плата исчезает.
Подробнее →AutoGen
Фреймворк Microsoft для многоагентных диалогов, где агенты общаются друг с другом и с инструментами ради решения задачи. Ранний влиятельный набор для агентов.
Подробнее →B
C
C2PA
Content Credentials
Открытый стандарт привязки защищённого от подделки происхождения к медиа, фиксирующий, как файл создан или изменён. Техническая основа меток «сгенерировано ИИ».
Подробнее →Claude
Claude Opus, Claude Sonnet
Семейство флагманских языковых и мультимодальных моделей Anthropic, используемое через API для рассуждений, длинного контекста, зрения и агентного вызова инструментов.
Подробнее →Claude Agent SDK
Claude Code SDK
Набор Anthropic для построения автономных агентов, исполняющих собственный цикл вызова инструментов, с доступом к файлам и командам. Ранее Claude Code SDK.
Подробнее →Claude Code
Агентный инструмент Anthropic для кодинга в терминале: читает кодовую базу, редактирует файлы и запускает команды для выполнения задач разработки.
Подробнее →CLIP
Модель, отображающая изображения и текст в общее пространство, чтобы оценивать, насколько подпись соответствует картинке. Базовый приём за open-vocabulary зрением.
Подробнее →Computer-use агент
Operator, Perplexity Comet
Агент, управляющий софтом как человек – смотрит на экран, кликает и печатает – выполняя задачи в приложениях без специальных API.
Подробнее →CrewAI
Фреймворк агентов, организующий несколько ролевых агентов в «команду», совместно решающую задачу. Популярен для многоагентных сценариев.
Подробнее →D
DeepFilterNet
Более качественная открытая модель шумоподавления, хорошо очищающая речь и остающаяся достаточно эффективной для реального времени.
Подробнее →DeepSORT
Популярный трекер, сочетающий предсказание движения с «отпечатком» внешнего вида ради стабильных ID при кратких перекрытиях.
Подробнее →Depth Anything
Сильная универсальная монокулярная модель глубины, оценивающая расстояние по одному изображению в разных сценах; достаточно мала для работы на устройстве.
Подробнее →E
Edge AI
периферийный AI
Запуск моделей на устройстве съёмки или рядом с ним – камера, телефон, локальный сервер – вместо удалённого дата-центра ради снижения задержки и трафика.
Подробнее →ElevenLabs
11labs
Ведущий коммерческий провайдер TTS и клонирования голоса с естественными голосами; широко используется для дубляжа, озвучки и разговорных агентов.
Подробнее →EU AI Act
закон ЕС об ИИ
Комплексный закон ЕС об ИИ, классифицирующий системы по риску и задающий обязанности – включая запреты на отдельные применения и правила прозрачности для других.
Подробнее →EU AI Act, статья 50
статья 50
Норма прозрачности в EU AI Act, требующая раскрывать пользователям ИИ-сгенерированные или изменённые медиа. Причина, по которой синтетический контент нуждается в метке.
Подробнее →F
Few-shot
обучение в контексте
Направление модели несколькими примерами в самом запросе, чтобы она следовала образцу без переобучения. Быстрый способ задать поведение.
Подробнее →FPS
частота кадров
Frames Per Second – сколько изображений проигрывается или обрабатывается в секунду. Выше FPS – плавнее видео, но больше кадров для анализа и оплаты.
Подробнее →G
Gemini
Google Gemini
Семейство флагманских мультимодальных моделей Google, принимающих текст, изображения, звук и видео. Доступно через API как закрытая модель с очень большим контекстом.
Подробнее →GGUF
Однофайловый формат для распространения квантованных языковых и мультимодальных моделей; популярен для эффективного запуска на CPU и потребительских GPU.
Подробнее →GPT
ChatGPT, GPT-5
Линейка флагманских языковых и мультимодальных моделей OpenAI, доступная через платный API. Выбор закрытой модели по умолчанию для рассуждений и зрения.
Подробнее →GPU
видеокарта, ускоритель
Graphics Processing Unit – параллельный чип, на котором работает почти весь современный ИИ. Доступность и цена GPU определяют стоимость self-hosting.
Подробнее →Grounding DINO
Детектор с открытым словарём, находящий объекты по свободному текстовому запросу, а не по фиксированному списку – найти «красный рюкзак» без переобучения.
Подробнее →I
Insertable Streams
Encoded Transform
Браузерный API, позволяющий коду менять каждый аудио- или видеокадр при прохождении через WebRTC; зацепка для ИИ-эффектов в звонке вроде размытия и оверлеев.
Подробнее →IoU
индекс Жаккара
Intersection over Union – насколько предсказанная рамка перекрывает истинную, от 0 до 1. Мера правильности детекции.
Подробнее →J
K
Kling
Kling AI
Сильная модель text- и image-to-video от Kuaishou, часто хвалимая за качество движения и конкурентную цену среди сервисов генеративного видео.
Подробнее →Kokoro TTS
Kokoro
Маленькая быстрая открытая модель синтеза речи с хорошим качеством голоса за низкую цену; популярна для self-hosted и on-device речи.
Подробнее →Krisp
Krisp AI
Коммерческий сервис шумоподавления и чистоты голоса в реальном времени, широко встраиваемый в продукты звонков как вариант «купить, а не строить».
Подробнее →KV-кэш
key-value кэш
Сохранённые значения внимания, которые языковая модель переиспользует при генерации, чтобы не пересчитывать весь контекст на каждый новый токен. Крупный потребитель памяти.
Подробнее →L
LangGraph
Фреймворк для построения агентных приложений как графов шагов с точным контролем состояния, ветвлений и циклов. Ведущий инструмент оркестрации агентов.
Подробнее →Lip-sync (синхрон губ)
синхронизация губ
Подгонка движений рта лица под заданную аудиодорожку, чтобы говорящая голова выглядела действительно произносящей слова. Ключ к ИИ-аватарам и дубляжу.
Подробнее →LiveKit
LiveKit Agents
Открытый стек реального времени и фреймворк агентов, позволяющий ИИ войти в WebRTC-звонок полноценным участником, который слышит, видит и говорит.
Подробнее →LLaVA
LLaVA-NeXT
Популярная открытая модель «зрение-язык», соединяющая энкодер изображений с открытой LLM; частая база для self-hosted мультимодальных функций.
Подробнее →LLM (большая языковая модель)
большая языковая модель
Модель, обученная на огромных текстах, предсказывающая и генерирующая язык. Движок рассуждений за чатом, суммаризацией и большинством агентных систем.
Подробнее →LLM-как-судья
оценка моделью
Использование сильной языковой или мультимодальной модели для автоматической оценки вывода другой модели, масштабируя проверку за пределы ручного ревью.
Подробнее →LoRA
Low-Rank Adaptation
Low-Rank Adaptation – дешёвый метод дообучения, тренирующий маленькие добавочные слои вместо всей модели, чтобы кастомизировать большие модели на скромном железе.
Подробнее →M
Manus AI
Manus
Универсальный автономный агент, планирующий и выполняющий сложные многошаговые задачи от начала до конца с помощью внутренней команды специализированных под-агентов.
Подробнее →mAP
средняя точность
Mean Average Precision – стандартная метрика точности детекторов от 0 до 1. Выше – больше верных рамок в нужных местах.
Подробнее →MCP (Model Context Protocol)
Model Context Protocol
Открытый стандарт подключения ИИ-моделей к инструментам и данным через общий интерфейс, чтобы любая модель использовала любой совместимый инструмент.
Подробнее →MediaPipe
Открытая библиотека Google с готовыми on-device пайплайнами зрения – сегментация, лицо, руки, поза – рассчитанными на быструю работу в браузере и на телефоне.
Подробнее →N
NO FAKES Act
Предлагаемый закон США для защиты голоса и внешности людей от несанкционированных ИИ-копий. Влияет на то, как клонирование голоса и аватары должны получать согласие.
Подробнее →Non-max suppression
NMS
Шаг очистки, убирающий дублирующиеся перекрывающиеся рамки одного объекта, оставляя самую уверенную. Стандарт в конвейерах детекции.
Подробнее →NVIDIA Maxine
Maxine
Набор GPU-ускоренных ИИ-эффектов NVIDIA для видеозвонков – шумоподавление, сверхразрешение, коррекция взгляда, эффекты фона – как вариант «купить».
Подробнее →O
OCR
распознавание текста
Optical Character Recognition – чтение текста на изображениях или кадрах видео и его перевод в машиночитаемые символы.
Подробнее →ONNX
Open Neural Network Exchange – нейтральный к вендору формат, чтобы модель из одного фреймворка запускалась в разных средах и на разных чипах.
Подробнее →OpenPose
Ранний влиятельный оценщик позы для нескольких людей. До сих пор ориентир, хотя лёгкие модели MediaPipe Pose и RTMPose теперь выигрывают в скорости.
Подробнее →P
PaddleOCR
Популярный открытый OCR-набор с сильной мультиязычной детекцией и распознаванием текста; распространён в продакшен-конвейерах видео и документов.
Подробнее →Pyannote
pyannote.audio
Открытый набор для диаризации и смежных аудио-задач, частый продакшен-выбор для определения, кто когда говорил.
Подробнее →Q
R
RAFT
Lucas-Kanade
Глубокая модель оптического потока, точная на сложном движении. Современный выбор по умолчанию, когда классических методов вроде Lucas-Kanade не хватает.
Подробнее →RAG (генерация с извлечением)
генерация с извлечением
Подача языковой модели релевантных фактов, извлечённых из ваших данных в момент запроса, чтобы ответы опирались на реальные источники, а не только на память.
Подробнее →Real-ESRGAN
Популярная открытая модель апскейла реальных изображений и видео, хорошо восстанавливающая детали в сжатом или повреждённом материале.
Подробнее →RNNoise
Крошечная эффективная открытая модель шумоподавления голоса в реальном времени, достаточно лёгкая для запуска в браузере через WebAssembly.
Подробнее →Runway
Runway ML
Коммерческая платформа генеративного видео с text- и image-to-video и инструментами монтажа; популярна у креаторов и пост-продакшена.
Подробнее →S
SAM (Segment Anything)
Segment Anything, SAM 2
Segment Anything Model – промптируемый сегментатор, маскирующий любой объект по клику или рамке; SAM 2 переносит это на трекинг масок в видео.
Подробнее →Self-hosting
self-hosted, on-prem
Запуск моделей с открытыми весами на своей инфраструктуре вместо вызова API вендора. Обмен эксплуатационной работы на приватность, контроль и меньшую предельную цену.
Подробнее →SFU (Selective Forwarding Unit)
медиасервер
Медиасервер, принимающий поток каждого участника и пересылающий его остальным; стандартная основа групповых звонков и удобное место для ИИ.
Подробнее →Sora
Sora 2
Линейка моделей text-to-video от OpenAI, известная физически реалистичным движением. Доступна через API для генерации коротких клипов по запросу.
Подробнее →T
TensorRT
TensorRT-LLM
Оптимизатор NVIDIA, компилирующий модель в сильно настроенную под её GPU форму, снижая задержку и повышая пропускную способность на инференсе.
Подробнее →Triton Inference Server
NVIDIA Triton
Открытый сервер NVIDIA для развёртывания многих моделей за единым быстрым API с пакетированием, планированием и разделением GPU между типами моделей.
Подробнее →TTS (синтез речи)
синтез речи
Генерация звучащей речи из текста. Современный нейросетевой TTS звучит естественно и используется для озвучки, дубляжа, ассистентов и доступности.
Подробнее →V
Veo
Google Veo
Модель text-to-video от Google, известная генерацией синхронного звука вместе с изображением и выводом высокого разрешения.
Подробнее →Video RAG
мультимодальный RAG
Применение RAG к видеоархиву: находить нужные моменты по смыслу, а затем дать модели ответить на вопросы или их суммировать.
Подробнее →Vision Transformer (ViT)
ViT
Нейросеть, применяющая архитектуру трансформера к участкам изображения вместо слов. Сегодня – основа большинства передовых моделей зрения.
Подробнее →vLLM
PagedAttention
Открытый высокопроизводительный движок для обслуживания языковых и мультимодальных моделей; использует PagedAttention и непрерывное пакетирование, чтобы упаковать много запросов на GPU.
Подробнее →VLM (модель «зрение-язык»)
модель зрение-язык
Модель, принимающая изображения или видео плюс текст и выдающая текст – описывая, отвечая на вопросы или рассуждая об увиденном.
Подробнее →VRAM
память GPU
Память видеокарты. Модель запустится, только если её веса и рабочие данные помещаются в VRAM, поэтому объём VRAM ограничивает выбор моделей.
Подробнее →W
WebAssembly (WASM)
WASM
Быстрый переносимый бинарный формат, исполняющий близкий к нативному код в браузере; используется для запуска ИИ-моделей вроде шумоподавления и ASR на клиенте.
Подробнее →WebGPU
Браузерный API с прямым доступом к GPU, чтобы ИИ-модели работали быстро на стороне клиента без установки.
Подробнее →WebRTC
Web Real-Time Communication
Открытый стандарт, позволяющий браузерам и приложениям напрямую обмениваться аудио, видео и данными в реальном времени. Транспортный слой под большинством видеозвонков.
Подробнее →WER (пословная ошибка)
пословная ошибка
Стандартная метрика точности распознавания речи: доля неверных слов, меньше – лучше. Позволяет сравнивать ASR на одном аудио.
Подробнее →Whisper
faster-whisper
Открытое семейство моделей распознавания речи от OpenAI, сильное во многих языках. Частый бесплатный базис для транскрипции и субтитров.
Подробнее →WhisperX
Улучшенный конвейер Whisper с точными пословными таймкодами и метками говорящих, чтобы транскрипт плотно совпадал со звуком и с тем, кто говорил.
Подробнее →Y
Z
Нужен не словарь, а команда?
Разрабатываем видеопродукты с 2005 года: стриминг, ВКС, ИИ на видео. 250+ проектов.