Содержание статьи +
- Кратко
- Почему это важно
- Что на самом деле значит «закрытый фронтир»
- Как каждое семейство обрабатывает видео
- Модель стоимости – читаем счёт до того, как он придёт
- Контекстное окно – по-прежнему жёсткий потолок для обработки длинных видео
- Claude Computer Use – единственная возможность, сто́ящая особняком
- Выбор между тремя – правило решения
- Частая ошибка – считать по модели pro, когда хватило бы flash
- Где здесь Фора Софт
- Главные выводы
- Что почитать дальше
Кратко
Три закрытых «передовых» семейства моделей – Gemini от Google, GPT-5 от OpenAI и Claude Opus 4 от Anthropic – являются самыми мощными системами понимания видео, доступными через API в 2026 году. К ним обращаются одинаково: отправляют видео (или сэмплированные кадры) вместе с вопросом и получают в ответ текст. Раньше главное различие заключалось в том, что только Gemini поддерживал видеофайлы нативно, тогда как GPT и Claude требовали предварительной обработки – разбиения видео на отдельные кадры. Однако к 2026 году этот разрыв исчез: нативная работа с видео стала стандартом для всех лидеров рынка.
Теперь их отличает форма оплаты, размер контекстного окна и одна уникальная возможность, которую как полноценный продукт предлагает только Anthropic – Claude Computer Use. Эта функция позволяет модели анализировать скриншоты реального экрана и управлять мышью и клавиатурой, чтобы выполнить задачу.
В этой статье – для читателя без подготовки в области машинного обучения – объясняется, как каждое из семейств обрабатывает видео, сколько это стоит, и в каких случаях «просто вызвать закрытый API» является правильным инженерным решением, а когда лучше запустить открытую модель локально.
Почему это важно
Если вашему продукту нужно понимать видео – составить конспект записи встречи, ответить на вопросы по лекции, выявить инцидент безопасности на записи с камеры или прочитать, что отображается на экране пользователя, и на основе этого действовать, – в 2026 году самый быстрый способ – использовать один из трёх закрытых API, а не обучать и не размещать модель самостоятельно. За словом «быстрый» скрываются три ключевых решения, которые тихо определяют, будет ли функция дешёвой или разорительной, точной или слепой, и можно ли её запустить за неделю или она застрянет в согласованиях на квартал: какое семейство моделей выбрано, сколько оно стоит за обработку одного видео и могут ли данные легально покинуть ваши серверы. Этот урок предназначен для продакт-менеджера, основателя или операционного руководителя, которому предстоит участвовать в встрече по выбору вендора и понимать, почему инженеры настаивают: «Gemini – для длинных видео, Claude – для автоматизации экранов, и следите за расходом токенов в выходные». Предполагается, что вы ознакомились с введением в видео-ВЛМ; если термины «токен», «сэмплирование кадров» и «контекстное окно» вам незнакомы, начните с него.
Что на самом деле значит «закрытый фронтир»
Начнём с двух ключевых понятий, потому что каждое из них важно. Фронтир – это самые передовые модели общего назначения, существующие сегодня: те, что показывают лучшие результаты на самых сложных тестах и с которыми сравнивают более скромные и дешёвые модели. Закрытая означает, что вы не можете скачать модель и запустить её на своём оборудовании – вместо этого вы арендуете доступ к ней через интернет, отправляя свои данные на серверы разработчика и платя за каждое использование. Противоположность – модель с открытыми весами (open-weights), которую можно скачать и запустить самостоятельно – об этом подробнее в уроке об открытом фронтире.
Три компании контролируют закрытый фронтир в 2026 году, и важно запомнить их названия и продукты в первую очередь. Google предлагает семейство Gemini. OpenAI – семейство GPT-5. Anthropic – семейство Claude Opus 4. У каждого семейства есть несколько вариантов: крупная, медленная и дорогая модель «pro» для сложных задач, а также компактная, быстрая и дешёвая модель «flash» или «mini» для массовой обработки. Кроме того, каждое семейство регулярно выпускает точечные обновления (Gemini 2.5, затем 3.0 и 3.1; GPT-5, далее 5.4 и 5.5; Opus – от 4.5 до 4.8), повышающие производительность без изменения интерфейса вызова. Конкретные номера версий обновляются каждые несколько недель, но сами семейства и способ интеграции остаются стабильными – именно на этой стабильности вы и строите свою работу.
Вот аналогия, которую стоит запомнить. Закрытая передовая модель – это как нанять блестящего аналитика-фрилансера через агентство. Вы с ним не встречаетесь, не видите его стол, отправляете материал в агентство, и обратно приходит готовый ответ, а счёт выставляют по страницам. Вы получаете экспертную работу, никого не нанимая, не обучая и не размещая, – но ваш материал покидает здание, вы платите каждый раз, и если агентство поднимет ставки или сменит сотрудников, повлиять вы почти не можете. Запустить открытую модель у себя – противоположность: вы нанимаете аналитика в штат. Остальная часть статьи – о том, когда стоит идти в агентство.
Как каждое семейство обрабатывает видео
Каждая из этих моделей по своей сути – vision-language-модель, система, способная «читать» и изображения, и текст, а также отвечать на вопросы по ним. Но за фразой «работать с видео» скрывается реальное инженерное различие, которое до недавнего времени было ключевым в сравнении: может ли модель принимать видеофайл напрямую – или сначала нужно преобразовать видео в последовательность неподвижных кадров?
Нативный приём видео означает, что вы передаёте API настоящий видеофайл или ссылку на него, а платформа сама извлекает кадры, синхронизирует звук и подаёт всё это модели. Покадровый приём означает, что модель работает только с неподвижными изображениями – значит, вы должны открыть видео, извлечь кадры (обычно один в секунду), закодировать каждый как изображение и отправить их пакетом вместе с текстовой расшифровкой звука. В обоих случаях модель анализирует сэмплированные кадры как токены, но при нативном приёме техническую работу – «сантехнику» – берёт на себя вендор, а не ваш код. Это и есть разница между функцией, которую можно собрать за день, и той, что займёт неделю.
Бо́льшую часть эпохи GPT-5 это и было главным разделением. Gemini с самого начала поддерживал видео нативно: согласно документации Google по обработке видео, вы загружаете ролик, и он автоматически разбивается на кадры – по одному в секунду по умолчанию. Каждый кадр оценивается примерно в 258 токенов, плюс около 32 токенов в секунду на аудиодорожку – цифра, которую стоит запомнить, поскольку она определяет любую оценку стоимости использования Gemini. GPT-5 (релиз – август 2025 года) и линейка Claude Opus 4 принимали только статичные изображения, поэтому для работы с видео требовалось самостоятельно извлекать кадры. Именно этот подход до сих пор описывают многие статьи 2024–2025 годов, хотя он уже давно устарел.
В течение 2026 года разрыв закрылся. GPT-5.4 от OpenAI (март 2026) и GPT-5.5 (апрель 2026) добавили нативную поддержку видео – GPT-5.5 был представлен OpenAI как модель, способная объединять текст, изображения, звук и видео в одной сессии. Gemini 3.0 от Google расширил и без того нативную обработку видео. Практический вывод для покупателя 2026 года остаётся верным: нативная поддержка видео больше не является решающим фактором при выборе вендора, поскольку топовые модели в каждом семействе уже обладают этой возможностью. Что по-прежнему важно проверять – это версию: если ваш стек привязан к исходному GPT-5, а не к 5.4 или более новой, вы всё ещё работаете в режиме извлечения кадров, и инженер, предположивший иное, создаст неработающую интеграцию. Сила Claude, как мы увидим, заключается в другом.
Модель стоимости – читаем счёт до того, как он придёт
Способ оплаты закрытой модели на первый взгляд прост и легко недооценивается: вам выставляют счёт за токены – отдельно за ввод (то, что вы отправляете), и за вывод (то, что модель генерирует в ответ), по цене за миллион токенов. Вывод всегда стоит в несколько раз дороже ввода, потому что генерация текста – более ресурсоёмкий процесс. Получите эти два числа – остальное – простое умножение.
Приведём реальный пример вслух, потому что арифметика и есть модель стоимости. Допустим, вы отправляете 10-минутный клип в быструю модель Gemini с частотой по умолчанию – один кадр в секунду и стандартным разрешением – и просите краткий конспект. Десять минут – это 600 секунд, поэтому платформа обрабатывает 600 кадров:
600 кадров × 258 токенов/кадр = 154 800 визуальных токенов
600 секунд × 32 токена/секунду = 19 200 аудио-токенов
----------------------
ввод ≈ 174 000 токеновПри репрезентативной цене 2026 года для быстрой модели – Gemini 2.5 Flash указанная стоимость составляет \$0.30 за миллион входных токенов – входная часть запроса обходится в:
174 000 ÷ 1 000 000 × $0.30 ≈ $0.052Около пяти центов, чтобы модель проанализировала десять минут видео. Теперь добавим вывод. Конспект объёмом в 300 слов – это примерно 400 выходных токенов; на модели, где цена составляет, скажем, \$2.50 за миллион выходных токенов, это доли цента – здесь уже несущественно. Но перевернём задачу: попросим модель выдать для того же видео полную расшифровку с тайм-кодами и разметкой по дикторам – и объём вывода может вырасти до 20 000 токенов. При цене \$2.50 за миллион это уже пять центов сами по себе, что удваивает счёт. Правило, которое удивляет команды: при задачах на понимание видео стоимость ввода обычно доминирует, но в любой функции, генерирующей большой объём текста, стоимость вывода незаметно становится более значительной. Всегда учитывайте обе стороны.
Заявленные цены различаются по семействам и тирам и меняются настолько часто, что любую цифру здесь нужно перепроверять перед принятием решений. Как ориентир – снимок цен на 2026 год: большие модели «pro» – Gemini 2.5 Pro, GPT-5, Claude Opus 4 – группируются в диапазоне \$1,25–5 за миллион входных токенов и \$10–25 за миллион выходных, а самые свежие премиум-версии (GPT-5.5, быстрые режимы) стоят ещё дороже. Маленькие модели «flash» и «mini» примерно в четыре–десять раз дешевле, и именно на них должен приходиться основной объём продакшена видео. Главное – не запоминать цены, а понимать, что между тиром pro и flash одного и того же вендора существует десятикратный разрыв в стоимости, и направлять каждую задачу на самый дешёвый тир, который обеспечивает требуемую точность.
| Семейство (снимок 2026) | Репрезентативная большая модель | Ввод \$/M | Вывод \$/M | Контекстное окно | Нативное видео |
|---|---|---|---|---|---|
| Google Gemini | Gemini 2.5 Pro | \$1.25–2.50 | \$10–15 | 1 000 000 | Да |
| OpenAI GPT-5 | GPT-5 (5.4 / 5.5) | \$1.25–5.00 | \$10–30 | 400 000–1 100 000 | 5.4+ да; 5.0 кадры |
| Anthropic Claude | Claude Opus 4.x | \$5.00 | \$25 | 1 000 000 | Изображения + скриншоты |
Цены и размеры контекста – ориентировочный снимок 2026 года, обновляются каждые несколько недель; воспринимайте таблицу как оценку порядка величины, а не как данные для внесения в договор. Gemini Pro и GPT-5 взимают более высокую плату при превышении порога в около 200K токенов на запрос.
Контекстное окно – по-прежнему жёсткий потолок для обработки длинных видео
Токены – это не только стоимость, но и жёсткий лимит. У каждой модели есть контекстное окно – максимальное количество токенов, которые она может обрабатывать одновременно, включая и ввод, и вывод. Как только ваше сэмплированное, токенизированное видео превышает этот предел, вы физически не сможете отправить больше, независимо от бюджета.
В 2026 году фронтир сошлись на одном миллионе токенов как на общем большом размере, а некоторые варианты GPT-5 идут выше. Это звучит огромно, пока не проделать видео-арифметику. При примерно 300 токенах на секунду видео в разрешении по умолчанию один миллион токенов вмещает около 3600 секунд – один час видео, и ни секундой больше. Опуститься до низкого разрешения, около 100 токенов в секунду, и то же окно растягивается примерно до трёх часов. Это не причуда Gemini; это физика преобразования видео в токены, и она применима к любой закрытой модели, заявляющей размер контекста.
Следствие меняет любой продукт с длинным видео. Двухчасовой фильм просто не помещается в разрешение по умолчанию в окно на миллион токенов – точка. У вас ровно три хода, и каждая функция длинного видео выбирает один из них: понизить разрешение (дешевле за кадр, помещается больше, видно меньше деталей), понизить частоту кадров (меньше кадров, помещается больше, риск пропустить быстрые события) или отказаться от попытки вместить всё разом и перейти к поиску – нарезать видео на куски, проиндексировать их и подавать модели только релевантные каждому вопросу фрагменты. Это паттерн мультимодального RAG. Четвёртого варианта, который даёт полное разрешение, полную частоту кадров и неограниченную длину, не существует. Контекстное окно – это стена; архитектура – это жизнь в её пределах. Больше токенов из нового релиза сдвигают стену, но никогда не убирают её.
Claude Computer Use – единственная возможность, сто́ящая особняком
Всё сказанное до сих пор применимо – с разной степенью – ко всем трём семействам. Claude Computer Use принципиально отличается от них, и именно это качество привлекает внимание видеоинженера. Нужно на мгновение остановиться, потому что большинство нетехнических читателей слышали эту фразу, но очень немногие понимают, что она на самом деле означает.
Computer Use – это возможность, при которой модели получают скриншоты реального экрана компьютера и, вместо того чтобы просто описывать их, решают, что нажать, ввести или прокрутить, а затем отправляют эти действия на выполнение. Экран превращается в основу для понимания видео и превращения его в действия: модель «видит» текущее состояние рабочего стола как изображение, анализирует его и управляет компьютером так, будто это делает человек. Согласно документации Anthropic, эта функция доступна через стандартный API в виде бета-инструмента, поддерживающего захват скриншотов, управление мышью, ввод с клавиатуры и (в новейших моделях) масштабирование для чтения мелкого текста.
Механизм – это цикл, и понимание этого цикла снимает всю мистичность. Anthropic называет его агентным циклом, и в нём четыре повторяющихся шага. Первый – вы отправляете Claude скриншот и цель, например: «сохрани картинку кота на рабочий стол». Второй – Claude анализирует скриншот и отвечает не текстом, а действием: «нажми по этим координатам», «введи этот текст», «сделай ещё один скриншот». Третий – ваше ПО выполняет это действие на реальной (или виртуальной) машине и отправляет свежий скриншот с результатом. Четвёртый – Claude смотрит на новый скриншот, оценивает, достигнута ли цель, и либо завершает процесс, либо запрашивает следующее действие. Цикл повторяется, пока задача не будет выполнена или пока его не остановит лимит безопасности. Важно: Claude никогда не подключается к вашему компьютеру напрямую – ваш код всегда остаётся под контролем; Claude – только «глаза» и «суждение».
Почему это место в курсе по видеоинженерии, а не в общем курсе по ИИ? Потому что живой экран – это видеопоток, и паттерны здесь те же, что в уроках о конвейере ИИ реального времени: последовательность кадров, модель, анализирующая недавние, и действие, выданное в ответ. Computer Use – это то, что позволяет видео-продукту что-то сделать с увиденным – открыть нужный инструмент, заполнить форму, перемотать таймлайн постпродакшена – а не просто пересказывать. В 2026 году ключевым бенчмарком для этой компетенции стал OSWorld (и его более чистая версия OSWorld-Verified), оценивающий модели по выполнению реальных задач в реальных приложениях. Закрытые фронтиры группируются в районе 70–80 процентов, а линейка Opus от Anthropic стабильно остаётся среди лидеров – результат уровня state-of-the-art на сложном бенчмарке, одновременно напоминая, что примерно одна задача из пяти всё ещё проваливается, так что человек должен оставаться в цикле для всего значимого.
Здесь уместна короткая и честная оговорка: Computer Use мощен, но пока не завершён. Он работает медленнее, чем человек, выполняющий те же действия, иногда промахивается мимо нужного элемента или «галлюцинирует» координаты – а главное, уязвим к инъекции промпта (prompt injection), когда скрытый на веб-странице или в изображении текст заставляет модель выполнить действия, о которых пользователь даже не просил. Anthropic предоставляет классификаторы и рекомендации, чтобы снизить такие риски, но ключевой совет остаётся твёрдым: запускайте Computer Use в изолированной виртуальной машине с минимальными привилегиями, держите её подальше от чувствительных учётных данных и всегда просите человека подтверждать любые действия с реальными последствиями. Более широкое семейство экранных агентов – Claude Code, OpenAI Operator, Manus, Perplexity Comet – заслуживает отдельного подробного разбора, который дан в уроке об агентах computer-use. Здесь же важно подчеркнуть: Computer Use – это возможность, которая делает Claude особенно интересным инструментом для команды, создающей действующий видео-продукт, а не просто наблюдающий.
Выбор между тремя – правило решения
Не поддавайтесь искушению объявить одного победителя. В 2026 году три семейства технологий настолько близки по базовому пониманию видео, что выбор будет зависеть от специфики вашей задачи, а не от позиций в рейтинге. Вот правило, которое мы применяем.
Берите Gemini, когда задача – понять длинное видео в масштабе и важна стоимость. Его нативный видеоконвейер – самый зрелый, окно в миллион токенов и задокументированные ставки токенов в секунду делают стоимость предсказуемой, а тариф flash рассчитан на объём. Конспектирование тысяч записанных лекций, генерация глав для архива OTT или анализ ночных записей с камер – вот где Gemini чувствует себя как дома.
Берите GPT-5, когда работа с видео встраивается в более широкий процесс рассуждений или использования инструментов, или если вы уже стандартизировались на стеке OpenAI. Релизы 5.4 и новее поддерживают видео нативно, а экосистема инструментов и библиотек вокруг них – самая крупная. В задачах, где видео комбинируется с глубоким текстовым анализом, генерацией кода или вызовом функций, возможность держать всё в одной сессии модели – реальное упрощение.
Берите Claude, когда функция должна действовать на экране – например, Computer Use, – или когда ваши проверяющие ценят аккуратные, честные, хорошо обоснованные ответы и строгое соблюдение правил безопасности, что особенно важно в регулируемых сферах, таких как телемедицина и видеонаблюдение. Ввод видео у Claude основан на изображениях и скриншотах, а не на нативном файле, поэтому для чистого конспектирования длинного видео он менее очевиден; для автоматизации экрана и агентных действий – напротив, наиболее подходящий выбор.
И выбирайте ни одну из них – переходите в open-weights, когда данные по закону не могут покинуть ваши серверы, когда стоимость одного вызова для объёмной функции превышает затраты на хостинг собственной модели, или когда требуется дообучить модель на приватном домене. Этот компромисс – центральная тема урока «просто возьмём VLM» и урока об открытом фронтире; кратко: закрытые API выигрывают в скорости вывода и пиковой производительности, но проигрывают в резидентности данных, удельной стоимости при масштабировании и возможности кастомизации.
| Если ваша функция… | Лучший первый выбор | Почему |
|---|---|---|
| Конспектирует длинное записанное видео в объёме | Gemini (тир flash) | Зрелое нативное видео, предсказуемая цена за секунду, дешёвый flash |
| Смешивает видео с тяжёлым рассуждением / инструментами | GPT-5 (5.4+) | Крупнейшая экосистема инструментов, нативное видео, одна сессия |
| Должна нажимать, печатать и водить реальный экран | Claude (Computer Use) | Единственный полноценный продукт автоматизации экрана; лидер OSWorld |
| Работает в регулируемой, критичной к безопасности вертикали | Claude | Аккуратные, хорошо оговорённые ответы; строгое поведение безопасности |
| Не может отправлять данные за пределы серверов, или огромный масштаб | Ни одна – open-weights | Резидентность данных, удельная стоимость, дообучение |
Частая ошибка – считать по модели pro, когда хватило бы flash
Чаще всего мы видим, как команды выбирают для бенчмарков и закладывают в бюджет тир pro – самую большую, умную и дорогую модель в семействе – для задачи, с которой тир flash справился бы безупречно. Модель pro может стоить в десять раз дороже своего собрата flash за токен, так что функция с видео, которая обходилась бы в пять центов за клип на flash, на pro обходится в пятьдесят центов. И кто-то делает вывод: «видео-ИИ слишком дорог», тогда как реальная проблема – неправильный выбор тира.
Лечение – это дисциплина из двух правил. Первое: по умолчанию направляйте каждую новую функцию с видео на самую дешёвую модель – flash или mini в выбранном семействе, и переходите на pro только для тех конкретных запросов, которые действительно не справляются с flash. При этом измеряйте процент таких провалов, а не предполагайте его. Второе: разделяйте стоимость обработки ввода и вывода в каждой оценке, потому что рычаг снижения каждой из них разный: стоимость ввода падает при снижении разрешения и частоты кадров, а стоимость вывода – при более коротких и ограниченных ответах. Ещё одна распространённая ошибка – закрепление на старой версии. Исходный GPT-5 требует извлечения кадров, GPT-5.4 – нет. Строка модели, скопированная из годовалого туториала, может незаметно посадить вас в устаревший режим, заставляя платить за операции, которые текущая версия выполняет бесплатно.
Где здесь Фора Софт
Мы интегрируем эти закрытые API в реальные видеопродукты по тем вертикалам, в которых работаем, и выбор конкретного семейства моделей полностью зависит от задачи. В OTT и e-learning конспектирование длинных видео и генерация глав реализуются на базе Gemini Flash – здесь математика токенов в секунду позволяет обрабатывать тысячи часов контента в рамках бюджета. В видеоконференциях и телемедицине ассистенты встреч, сочетающие расшифровку с структурированным рассуждением, чаще всего работают на линейке GPT-5, а аккуратный, хорошо обоснованный стиль ответов Claude делает его идеальным выбором там, где ошибка в уверенном ответе может иметь клинические или юридические последствия. В системах видеонаблюдения и набирающей обороты автоматизации бэк-офиса функция Claude Computer Use позволяет системе не только описывать, что видит камера или консоль оператора, но и управлять внешними инструментами. Главное, чему учит эта статья: направлять каждую задачу на самый дешёвый тир, соответствующий требуемой точности, считать ввод и вывод отдельно и резервировать open-weights решения для данных, которые не могут покидать здание.
Главные выводы
- Фронтир 2026 контролируется тремя закрытыми семействами моделей: Google Gemini, OpenAI GPT-5 и Anthropic Claude Opus 4.
- Нативная обработка видео – преимущество, которое есть только у Gemini, и оно доступно лишь в текущих версиях, но не в закреплённых старых.
- Оплата идёт по токенам: ввод и вывод тарифицируются отдельно, причём стоимость вывода в разы выше – всегда учитывайте оба.
- Окно в 1 миллион токенов вмещает около часа видео в разрешении по умолчанию и до трёх часов – при низком.
- Claude Computer Use – единственная уникальная возможность: модель может видеть скриншоты и управлять мышью и клавиатурой через агентный цикл.
- По умолчанию используйте дешёвый тариф flash; переходите на pro только при явно провальных запросах.
Что почитать дальше
- Видео-VLM в 2026 – сэмплирование кадров против потоковой передачи токенов – математика токенов и пределы контекстного окна, на которых основан этот урок.
- Открытый фронтир – LLaVA, Qwen-VL, LLaVA-NeXT и поле открытых мультимодальных моделей – альтернатива на открытых весах всему, что описано здесь.
- Claude Code, Manus AI, Operator, Perplexity Comet – агенты computer-use – полный ландшафт агентов, управляющих компьютером, к которому относится Computer Use.