Содержание статьи +
- Кратко
- Почему это важно
- Что на самом деле значит «закрытый фронтир»
- Как каждое семейство работает с видео
- Модель стоимости – читаем счёт до того, как он придёт
- Контекстное окно – по-прежнему жёсткий потолок для длинного видео
- Claude Computer Use – единственная возможность, что стои́т особняком
- Выбор между тремя – правило решения
- Частая ошибка – считать по модели pro, когда хватило бы flash
- Где здесь Фора Софт
- Главные выводы
- Что почитать дальше
Кратко
Три закрытых «передовых» семейства моделей – Gemini от Google, GPT-5 от OpenAI и Claude Opus 4 от Anthropic – это самые способные системы понимания видео, которые можно арендовать через API в 2026 году, и обращаетесь вы ко всем трём одинаково: отправляете видео (или сэмплированные кадры) плюс вопрос – получаете обратно текст. Главным различием между ними раньше было то, что только Gemini умел принимать видеофайл нативно, тогда как GPT и Claude требовали, чтобы вы сами нарезали видео на отдельные кадры; в течение 2026 года этот разрыв закрылся, и нативное видео стало нормой для всего фронтира. Что по-прежнему их разделяет – это форма счёта, размер контекстного окна и одна возможность, которую как полноценный продукт поставляет только Anthropic – Claude Computer Use, где модель смотрит на скриншоты реального экрана и водит мышью и клавиатурой, чтобы выполнить задачу. Эта статья объясняет – для читателя без подготовки в машинном обучении – что именно каждое семейство делает с видео, сколько это стоит и когда «просто вызвать закрытый API» – правильное инженерное решение, а когда лучше запустить открытую модель у себя.
Почему это важно
Если вашему продукту нужно понимать видео – сделать конспект записанной встречи, ответить на вопросы по лекции, отметить инцидент безопасности в записи с камеры или прочитать, что на экране у пользователя, и действовать, – самый быстрый путь в 2026 году это вызвать один из трёх закрытых API, а не обучать и не хостить что-либо самому. Но за словом «быстрый» прячутся три решения, которые тихо определяют, будет функция дешёвой или разорительной, точной или слепой, и можно ли её выпустить за неделю или она застрянет в согласованиях на квартал: какое семейство, сколько оно стоит за одно видео и могут ли данные вообще легально покинуть ваши серверы. Этот урок – для продакт-менеджера, основателя или операционного руководителя, которому предстоит сидеть на встрече по выбору вендора и понимать, почему инженеры твердят «Gemini для длинных видео, Claude для автоматизации экрана и следите за счётом за выходные токены». Он предполагает, что вы прочитали введение в видео-VLM; если слова «токен», «сэмплирование кадров» и «контекстное окно» вам новы, начните с него.
Что на самом деле значит «закрытый фронтир»
Начнём с двух слов, потому что каждое работает. Фронтир – это самые способные модели общего назначения, которые существуют: те, что набирают больше всего на самых трудных бенчмарках и с которыми сравнивают модели поменьше и подешевле. Закрытая значит, что вы не можете скачать модель и запустить её на своём железе; вы арендуете доступ к ней через интернет, отправляя свои данные на серверы вендора и платя за каждое использование. Противоположность – модель с открытыми весами (open-weights), которую можно скачать и запустить самому – тема урока об открытом фронтире.
Три компании владеют закрытым фронтиром в 2026 году, и стоит закрепить в голове их названия и продукты прежде всего остального. Google поставляет семейство Gemini. OpenAI поставляет семейство GPT-5. Anthropic поставляет семейство Claude Opus 4. У каждого семейства несколько размеров – большая, медленная, дорогая модель «pro» для трудных задач и маленькая, быстрая, дешёвая модель «flash» или «mini» для объёмной работы – и каждое часто выпускает точечные релизы (Gemini 2.5, затем 3.x; GPT-5, затем 5.4 и 5.5; Opus с 4.5 по 4.8), которые повышают возможности, не меняя способ вызова. Конкретные номера версий меняются каждые несколько недель; семейства и способ интеграции стабильны, и именно на этой стабильности вы строите.
Вот аналогия, которую стоит запомнить. Закрытая передовая модель – это как нанять блестящего аналитика-фрилансера через агентство. Вы с ним не встречаетесь, не видите его стол, отправляете материал в агентство, и обратно приходит готовый ответ, а счёт выставляют по страницам. Вы получаете экспертную работу, никого не нанимая, не обучая и не размещая, – но ваш материал покидает здание, вы платите каждый раз, и если агентство поднимет ставки или сменит сотрудников, повлиять вы почти не можете. Запустить открытую модель у себя – противоположность: вы нанимаете аналитика в штат. Остальная часть статьи – о том, когда стоит идти в агентство.
Как каждое семейство работает с видео
Каждая из этих моделей по своей сути – vision-language-модель, система, научившаяся читать и картинки, и текст и отвечать на вопросы по ним. Но за словами «работать с видео» прячется реальное инженерное различие, которое до недавнего времени было самым важным фактом во всём сравнении: принимает ли модель видеофайл напрямую – или вам сначала нужно превратить видео в стопку неподвижных изображений?
Нативный приём видео значит, что вы отдаёте API настоящее видео – файл или ссылку, – и сама платформа сэмплирует кадры, выравнивает звук и подаёт это модели. Покадровый приём значит, что модель принимает только неподвижные изображения, поэтому вы отвечаете за то, чтобы открыть видео, извлечь кадры (обычно один в секунду), закодировать каждый как изображение и отправить их пакетом вместе с текстовой расшифровкой звука. Оба приходят к одному и тому же – модель рассуждает над сэмплированными кадрами как над токенами, – но нативный приём переносит сантехнику из вашего кода в код вендора, и это разница между функцией, которую собирают за день, и той, что собирают за неделю.
Бо́льшую часть эпохи GPT-5 это и было главным водоразделом. Gemini принимал видео нативно с самого начала: по документации Google о понимании видео, вы загружаете видео, и оно сэмплируется на одном кадре в секунду по умолчанию, каждый кадр стоит около 258 токенов плюс примерно 32 токена в секунду на звук – число, которое стоит запомнить, потому что оно закрепляет любую оценку стоимости Gemini. GPT-5 (релиз августа 2025 года) и линейка Claude Opus 4 принимали только неподвижные изображения, так что видео означало извлечение кадров в вашем собственном конвейере. Именно этот мир до сих пор описывают многие статьи 2024–2025 годов, и он уже устарел.
В течение 2026 года разрыв закрылся. GPT-5.4 от OpenAI (март 2026) и GPT-5.5 (апрель 2026) добавили нативный ввод видео – GPT-5.5 был описан OpenAI как объединяющий текст, изображение, звук и видео в одной сессии модели. Gemini 3.x от Google расширил свою и без того нативную обработку видео. Практический вывод для покупателя 2026 года точен: нативное видео больше не повод выбирать одного вендора вместо другого, потому что текущая топ-модель в каждом семействе это умеет. Что по-прежнему нужно проверять – это версию: если ваш стек закреплён на исходном GPT-5, а не на 5.4 или новее, вы всё ещё в мире извлечения кадров, и инженер, предположивший иное, выпустит сломанную интеграцию. Сила Claude, как мы увидим, в другом.
Модель стоимости – читаем счёт до того, как он придёт
Способ оплаты закрытой модели прост на словах и легко недооценивается: вам выставляют счёт за токены, отдельно за то, что вы отправляете (ввод), и за то, что модель пишет в ответ (вывод), по цене за миллион токенов. Вывод всегда в несколько раз дороже ввода, потому что генерация текста – дорогая часть. Получите эти два числа – остальное умножение.
Проделаем реальный пример вслух, потому что арифметика и есть модель стоимости. Допустим, вы отправляете 10-минутный клип в быструю модель Gemini на дефолтном одном кадре в секунду и разрешении по умолчанию и просите короткий конспект. Десять минут – это 600 секунд, поэтому платформа оставляет 600 кадров:
600 кадров × 258 токенов/кадр = 154 800 визуальных токенов
600 секунд × 32 токена/секунду = 19 200 аудио-токенов
----------------------
ввод ≈ 174 000 токеновПри репрезентативной цене 2026 года для быстрой модели – Gemini 2.5 Flash указан как \$0.30 за миллион входных токенов – входная сторона запроса стоит:
174 000 ÷ 1 000 000 × $0.30 ≈ $0.052Около пяти центов, чтобы модель посмотрела десять минут видео. Теперь добавьте вывод. Конспект на 300 слов – это примерно 400 выходных токенов; на модели с ценой, скажем, \$2.50 за миллион выходных токенов это доли цента – здесь несущественно. Но переверните задачу: попросите модель выдать для того же видео полную расшифровку с тайм-кодами и разметкой по дикторам – и вывод может вырасти до 20 000 токенов, что при \$2.50 за миллион уже пять центов сами по себе, удваивая счёт. Правило, которое удивляет команды: на функциях понимания видео ввод обычно доминирует, но на любой функции, генерирующей много текста, строка вывода тихо становится бо́льшим числом. Всегда считайте обе стороны.
Заявленные цены различаются по семействам и тирам и меняются достаточно часто, чтобы любую цифру здесь нужно было перепроверить перед обязательствами. Как снимок 2026 года только для ориентира: большие модели «pro» – Gemini 2.5 Pro, GPT-5, Claude Opus 4 – группируются около \$1.25–5 за миллион входных токенов и \$10–25 за миллион выходных, а самые свежие премиум-релизы (GPT-5.5, быстрые режимы) идут выше. Маленькие модели «flash» и «mini» примерно в четыре–десять раз дешевле, и именно там должен идти основной продакшен-объём видео. Дисциплина – не запоминать цены; это знать, что между тиром pro и flash одного и того же вендора есть десятикратный разрыв в цене, и направлять каждую функцию на самый дешёвый тир, который проходит её планку точности.
| Семейство (снимок 2026) | Репрезентативная большая модель | Ввод \$/M | Вывод \$/M | Контекстное окно | Нативное видео |
|---|---|---|---|---|---|
| Google Gemini | Gemini 2.5 Pro | \$1.25–2.50 | \$10–15 | 1 000 000 | Да |
| OpenAI GPT-5 | GPT-5 (5.4 / 5.5) | \$1.25–5.00 | \$10–30 | 400 000–1 100 000 | 5.4+ да; 5.0 кадры |
| Anthropic Claude | Claude Opus 4.x | \$5.00 | \$25 | 1 000 000 | Изображения + скриншоты |
Цены и размеры контекста – ориентировочный снимок 2026 года, меняются каждые несколько недель; считайте таблицу «каким порядком величины», а не «что вписать в договор». Gemini Pro и GPT-5 берут более высокую ставку выше порога около 200K токенов в запросе.
Контекстное окно – по-прежнему жёсткий потолок для длинного видео
Токены – это не только стоимость; это жёсткий предел. У каждой модели есть контекстное окно – максимальное число токенов, которое она может удерживать одновременно, ввод плюс вывод вместе. Как только ваше сэмплированное, токенизированное видео его превышает, вы физически не можете отправить больше, каким бы ни был бюджет.
В 2026 году фронтир сошёлся на одном миллионе токенов как общем большом размере, а некоторые варианты GPT-5 идут выше. Это звучит огромно, пока не проделаешь видео-арифметику. При примерно 300 токенах Gemini на секунду видео в разрешении по умолчанию один миллион токенов вмещает около 3600 секунд – один час видео, и ни секундой больше. Опуститесь до низкого разрешения, около 100 токенов в секунду, и то же окно растягивается примерно до трёх часов. Это не причуда Gemini; это физика превращения видео в токены, и она применима к любой закрытой модели, заявляющей размер контекста.
Следствие меняет любой продукт с длинным видео. Двухчасовой фильм просто не помещается в разрешении по умолчанию в окно на миллион токенов, точка. У вас ровно три хода, и каждая функция длинного видео выбирает из них: понизить разрешение (дешевле за кадр, помещается больше, видно меньше деталей), понизить частоту кадров (меньше кадров, помещается больше, риск пропустить быстрые события) или перестать пытаться вместить всё разом и перейти к поиску – нарезать видео на куски, проиндексировать их и подавать модели только релевантные каждому вопросу куски, это паттерн мультимодального RAG. Четвёртого варианта, который даёт полное разрешение, полную частоту кадров и неограниченную длину, нет. Контекстное окно – это стена; архитектура – это как жить в её пределах. Бо́льшее окно из нового релиза сдвигает стену, но никогда не убирает её.
Claude Computer Use – единственная возможность, что стои́т особняком
Всё сказанное до сих пор применимо, с различиями в степени, ко всем трём семействам. Claude Computer Use отличается по сути, и именно из-за неё видео-инженер интересуется именно Claude. Стоит притормозить, потому что большинство нетехнических читателей слышали эту фразу, и очень немногие знают, что она реально делает.
Computer Use – это возможность, при которой модели дают скриншоты реального экрана компьютера, и она, вместо того чтобы только описывать их, решает, что нажать, напечатать и прокрутить, и отправляет эти действия обратно для исполнения. Экран – это понимание видео, превращённое в действие: модель «видит» текущее состояние рабочего стола как изображение, рассуждает о нём и управляет машиной так, как делал бы человек. По документации Anthropic, это поставляется через стандартный API как бета-инструмент, дающий снятие скриншота, управление мышью, ввод с клавиатуры и (на новейших моделях) действие zoom для чтения мелкого текста.
Механизм – это цикл, и понимание цикла демистифицирует всю возможность. Anthropic называет его агентным циклом, и в нём четыре повторяющихся шага. Первый – вы отправляете Claude скриншот и цель, например «сохрани картинку кота на рабочий стол». Второй – Claude смотрит на скриншот и отвечает не прозой, а действием: «нажми по этим координатам», «напечатай этот текст», «сделай ещё один скриншот». Третий – ваше ПО выполняет это действие на реальной (или виртуальной) машине и присылает свежий скриншот результата. Четвёртый – Claude смотрит на новый скриншот, решает, выполнена ли задача, и либо завершает, либо просит следующее действие. Цикл повторяется, пока цель не достигнута или пока его не остановит лимит безопасности. Важно: Claude никогда не касается вашего компьютера напрямую – ваш код всегда руки; Claude только глаза и суждение.
Почему это место в курсе по видео-инженерии, а не в общем курсе по ИИ? Потому что живой экран – это видеопоток, и паттерны те же, что в уроках о конвейере ИИ реального времени: последовательность кадров, модель, рассуждающая над недавними, и действие, выданное в ответ. Computer Use – это то, что позволяет видео-продукту что-то сделать с увиденным – открыть нужный инструмент, заполнить нужную форму, провести таймлайн постпродакшена, – а не только пересказывать. В 2026 году заглавный бенчмарк для этого навыка – OSWorld (и его более чистый вариант OSWorld-Verified), который оценивает модели на выполнении реальных задач в реальных приложениях. Закрытый фронтир группируется там в районе высоких 70-х – низких 80-х процентов, и линейка Opus от Anthropic стабильно среди лидеров – результат уровня state-of-the-art на трудном бенчмарке, и одновременно напоминание, что примерно одна задача из пяти всё ещё проваливается, так что человек должен оставаться в цикле для всего значимого.
Здесь уместна короткая честная оговорка. Computer Use мощен и не достроен. Он медленный по сравнению с человеком, делающим те же клики, иногда промахивается мимо элемента или галлюцинирует координаты и – что важнее всего – может быть захвачен инъекцией промпта (prompt injection), когда текст, спрятанный на веб-странице или в изображении, велит модели сделать то, о чём пользователь не просил. Anthropic поставляет классификаторы и рекомендации, чтобы это снизить, но стандартный совет твёрд: запускайте в изолированной виртуальной машине с минимальными привилегиями, держите её подальше от чувствительных учётных данных и просите человека подтверждать любое действие с реальными последствиями. Более широкое семейство агентов, водящих по экрану, – Claude Code, OpenAI Operator, Manus, Perplexity Comet – это отдельная большая тема, разобранная в уроке об агентах computer-use; здесь мысль у́же: Computer Use – это возможность, которая делает Claude уникально интересным команде, строящей действующий видео-продукт, а не только наблюдающий.
Выбор между тремя – правило решения
Удержитесь от соблазна короновать одного победителя. В 2026 году три семейства достаточно близки по сырому пониманию видео, чтобы выбор определялся спецификой вашей функции, а не лидербордом. Вот правило, которое применяем мы.
Берите Gemini, когда задача – понимание длинного видео в масштабе и важна стоимость. Его нативный видео-конвейер самый зрелый, окно на миллион токенов и задокументированные ставки токенов в секунду делают стоимость предсказуемой, а тир flash оценён под объём. Конспектировать тысячи записанных лекций, генерировать главы для архива OTT или просматривать ночные записи с камер – это домашняя территория Gemini.
Берите GPT-5, когда работа с видео сидит внутри более широкого процесса рассуждений или использования инструментов, или когда вы уже стандартизированы на стеке OpenAI. Релизы 5.4 и новее принимают видео нативно, экосистема инструментов и библиотек вокруг – крупнейшая, и для функций, где видео смешано с тяжёлым текстовым рассуждением, генерацией кода или вызовом функций, держать всё в одной сессии модели – это реальное упрощение.
Берите Claude, когда функция должна действовать на экране – Computer Use, – или когда ваши проверяющие ценят аккуратные, честные, хорошо оговорённые ответы и строгое поведение в плане безопасности, что важно в регулируемых вертикалях вроде телемедицины и видеонаблюдения. Ввод видео у Claude основан на изображениях и скриншотах, а не на нативном файле, поэтому для чистого конспектирования длинного видео он менее очевидный выбор; для автоматизации экрана и агентного действия – очевидный.
И берите ни одну из них – идите в open-weights – когда данные легально не могут покинуть ваши серверы, когда экономика одного вызова для объёмной функции бьёт стоимость хостинга своей модели, или когда нужно дообучить модель на приватном домене. Этот компромисс – целиком тема урока «просто возьмём VLM» и урока об открытом фронтире; коротко: закрытые API выигрывают на скорости выпуска и пиковой способности, а проигрывают на резидентности данных, удельной стоимости в масштабе и кастомизации.
| Если ваша функция… | Лучший первый выбор | Почему |
|---|---|---|
| Конспектирует длинное записанное видео в объёме | Gemini (тир flash) | Зрелое нативное видео, предсказуемая цена за секунду, дешёвый flash |
| Смешивает видео с тяжёлым рассуждением / инструментами | GPT-5 (5.4+) | Крупнейшая экосистема инструментов, нативное видео, одна сессия |
| Должна нажимать, печатать и водить реальный экран | Claude (Computer Use) | Единственный полноценный продукт автоматизации экрана; лидер OSWorld |
| Работает в регулируемой, критичной к безопасности вертикали | Claude | Аккуратные, хорошо оговорённые ответы; строгое поведение безопасности |
| Не может отправлять данные за пределы серверов, или огромный масштаб | Ни одна – open-weights | Резидентность данных, удельная стоимость, дообучение |
Частая ошибка – считать по модели pro, когда хватило бы flash
Чаще всего мы видим, как команды бенчмаркают и закладывают в бюджет тир pro – самую большую, умную и дорогую модель семейства – для функции, с которой тир flash справился бы безупречно. Модель pro может стоить в десять раз дороже своего собрата flash за токен, так что функция с видео, которая шла бы по пять центов за клип на flash, оценивается в пятьдесят центов на pro, и кто-то делает вывод «видео-ИИ слишком дорог», тогда как реальная проблема – выбор тира.
Лечение – это дисциплина из двух строк. Первая: по умолчанию направляйте каждую новую функцию с видео на самую дешёвую модель flash или mini в выбранном семействе и поднимайтесь до pro только для тех конкретных запросов, что доказуемо проваливаются на flash, – и измеряйте этот процент провалов, а не предполагайте его. Вторая: разделяйте счёт за ввод и счёт за вывод в каждой оценке, потому что рычаг, понижающий каждый, разный: стоимость ввода падает с понижением разрешения и частоты кадров, стоимость вывода – с более короткими, более ограниченными ответами. Вторая, связанная ошибка: закрепление на старой версии. Исходный GPT-5 требует извлечения кадров; GPT-5.4 – нет. Строка модели, скопированная из годовалого туториала, может тихо посадить вас в неправильный мир, заставляя платить за сантехнику, которую текущая версия сделала бы бесплатно.
Где здесь Фора Софт
Мы интегрируем эти закрытые API в реальные видео-продукты по вертикалям, в которых работаем, и выбор семейства чисто ложится на них. В OTT и e-learning конспектирование длинного видео и генерация глав идут на тире flash от Gemini, где математика токенов в секунду удерживает тысячи часов в рамках бюджета. В видеоконференциях и телемедицине ассистенты встреч, смешивающие расшифровку со структурированным рассуждением, часто сидят на линейке GPT-5, а аккуратный, хорошо оговорённый стиль ответов Claude заслуживает своё место всюду, где неверный уверенный ответ несёт клинический или юридический вес. В видеонаблюдении и нарождающейся автоматизации бэк-офиса Claude Computer Use позволяет системе не только описывать, что показывает камера или консоль оператора, но и управлять инструментами вокруг. Суждение, которое мы приносим, – то самое, чему учит эта статья: направлять каждую функцию на самый дешёвый тир, проходящий её планку точности, считать ввод и вывод раздельно и резервировать путь open-weights для данных, которые не могут покинуть здание.
Главные выводы
- Три закрытых семейства владеют фронтиром 2026: Google Gemini, OpenAI GPT-5, Anthropic Claude Opus 4.
- Нативный приём видео из преимущества одного Gemini стал нормой – но только на текущих версиях, не на закреплённых старых.
- Стоимость – за токены, ввод и вывод счётом раздельно; вывод в разы дороже – всегда считайте оба.
- Окно на 1M токенов вмещает около часа видео в разрешении по умолчанию, трёх – при низком.
- Claude Computer Use – единственная уникальная возможность: модель видит скриншоты и водит мышью и клавиатурой через агентный цикл.
- По умолчанию ставьте функции на дешёвый тир flash; поднимайтесь до pro только для измеримо провальных запросов.
Что почитать дальше
- Видео-VLM в 2026 – сэмплирование кадров против потоковой передачи токенов – математика токенов и пределы контекстного окна, на которые опирается этот урок.
- Открытый фронтир – LLaVA, Qwen-VL, LLaVA-NeXT и поле открытых мультимодальных моделей – альтернатива на открытых весах всему здесь.
- Claude Code, Manus AI, Operator, Perplexity Comet – агенты computer-use – полный ландшафт водящих по экрану агентов, к которому относится Computer Use.