Содержание статьи +
- TL;DR
- Зачем это нужно
- Как видео превращается в доллары – одна ментальная модель на всю статью
- Слой закрытых API – Gemini, OpenAI, Anthropic в цифрах 2026
- Слой аудио-ИИ – ASR, TTS, шумоподавление
- Слой генеративного видео – Sora, Runway, Veo, Kling, Pika, Luma, Hailuo
- Слой self-host – экономика GPU в 2026
- Fine-tuning, RAG и то, о чём не говорят
- EU AI Act – вступит в силу в августе 2026 года
- Пример с цифрами – видеопродукт на 100 000 пользователей в месяц
- Распространённая ошибка – путать счёт прототипа со счётом прода
- Двенадцать рычагов стоимости – задействуйте все
- Где здесь Фора Софт
- Ключевые выводы
- Что читать дальше
TL;DR
Закрытый AI API в видеопродукте может показаться дешёвым при единичном запросе, но становится очень дорогим в масштабах, поскольку видео генерирует токены, минуты и секунды с темпом, недоступным для чисто текстовых чат-продуктов. Цифры за май 2026 года: Gemini 2.5 Pro – $1,25 / $10,00 за миллион токенов, GPT-5 – $0,625 / $5,00, Claude Sonnet 4.6 – $3,00 / $15,00, OpenAI Realtime API – $32 / $64 за миллион аудио-токенов, Sora 2 – $0,10–$0,50 за сгенерированную секунду. Эти цифры складываются в несколько доминирующих статей бюджета, которые легко посчитать на салфетке, если известен профиль нагрузки. Статья проходит весь стек цен – от закрытых API, аудио-ИИ и генеративного видео до GPU для self-host, fine-tuning и RAG – и переводит каждую категорию в стоимость одного часа видео, чтобы продакт, основатель и инженер могли спорить на основе одной таблицы. Далее она показывает, как сократить эти затраты в 5–20 раз с помощью кэширования, пакетной обработки, лёгких моделей и гибридной топологии, которая направляет качество frontier-технологий туда, где оно действительно нужно, а везде остальном использует open-модель с миллиардом параметров.
Зачем это нужно
Если вы создаёте видеопродукт в 2026 году, ваш счёт за ИИ – не просто статья расходов, а ключевая строка в бюджете. Inference уже занимает около двух третей всех вычислений в области ИИ и продолжает расти по траектории, при которой к 2030 году он полностью доминирует над спросом дата-центров (McKinsey, Deloitte). Прогноз Gartner о снижении стоимости inference на 90% к 2030 году – вот почему ваш CFO спрашивает, почему счёт вырос на 320% за два года, хотя цена за токен упала в 280 раз: рост масштаба опережает падение цен. Правильная модель издержек позволяет вам выпускать фичи, которые окупаются сами собой; неправильная – и runway сгорает между seed и Series A.
Этот урок нужен продакт-менеджеру, которому нужна защищённая таблица к ближайшему борду, основателю, выбирающему между Sora и Runway на первой неделе, и инженеру, объясняющему, почему счёт от OpenAI Realtime превышает счёт от AWS. Предполагается, что вы уже ознакомились с уроком 1.2 о латентности и топологии деплоя и уроком 1.3 о форматах артефактов моделей и выборе open-vs closed, потому что вопрос стоимости имеет смысл только в контексте того, где работает модель и в каком формате она поставляется.
Как видео превращается в доллары – одна ментальная модель на всю статью
Каждая ИИ-стоимость в видеопродукте привязана к одному из пяти юнитов: токены (текст и мультимодальные данные), аудио-минуты (специализированный аудио-токенный тариф), сгенерированные секунды (для диффузионных видеомоделей), GPU-часы (self-host) и байты (векторное хранилище, egress, холодный архив). Что удивляет инженеров, пришедших из чисто текстовых продуктов, – как быстро видео превращает время сразу во все пять юнитов.
Часовое видео, обработанное в Gemini при стандартном разрешении, составляет около 1 080 000 входных токенов. (Google токенизирует видео примерно по 300 токенов в секунду при стандартном разрешении; в часе – 3600 секунд; 300 × 3600 = 1 080 000.) Сам по себе этот факт кардинально меняет любой разговор о стоимости API: чат-приложение, в котором типичный пользователь отправляет пару тысяч токенов за сессию, существует в совершенно иной реальности, чем видеопродукт, где одна загрузка пользователя уже требует миллиона токенов – ещё до того, как кто-то прочитает хотя бы одно слово ответа. Добавьте к этому аудиодорожку (час аудио в токенизации OpenAI Realtime API по 100 мс на токен – это 36 000 входных аудио-токенов, при цене $32 за миллион – $1,15 только за аудио), и становится очевидно, как видеопродукты генерируют счета на ИИ ещё до того, как сгенерируют первый ответ.
Следствие – самый простой и при этом недооценённый инструмент экономии в индустрии: большинство этих токенов можно было бы не отправлять. Кэширование, батчинг, снижение частоты выборки, разреженный сэмплинг кадров и переход с frontier-модели на тариф Flash для 90% лёгких запросов – вот что делает разницу между фичей, которая окупается, и фичей, которая обнуляет прибыльность продукта. Каждая часть этой статьи возвращается к этому рычагу.
Слой закрытых API – Gemini, OpenAI, Anthropic в цифрах 2026
Слой закрытых API проще всего моделировать, потому что вендоры публикуют стоимость за миллион токенов. Сложнее – подобрать тариф под нагрузку и помнить, что флагманские модели для сложных задач в 10–30 раз, а не в два, дороже, чем Flash-тариф. Неправильно распределить поток рутинных запросов – и счёт это покажет.
Цены на API Gemini – линейка 2026
Семейство Google Gemini 2.5 – настоящая рабочая лошадка для большинства видеонагрузок 2026 года, поскольку его токенизатор нативно обрабатывает видео. Стандартный тариф для разработчиков Gemini 2.5 Pro стоит 1,25 доллара за миллион входных токенов и 10 долларов за миллион выходных при длине промпта до 200 000 токенов; при превышении этого лимита цена возрастает до 2,50 и 15 долларов соответственно. Gemini 2.5 Flash – модель, на которую большинство видеопродуктов в итоге перейдут по умолчанию, – обходится в 0,30 доллара за миллион входных и 2,50 доллара за миллион выходных токенов. Самый компактный production-уровневый тариф – Gemini 2.5 Flash-Lite – снижает стоимость до 0,10 доллара за миллион входных и 0,40 доллара за миллион выходных токенов.
Поверх базовых цен действуют три механизма скидок, которые часто упускают из виду. Batch-обработка снижает цену вдвое для задач, которые можно выполнить асинхронно и получить позже – а это практически любой офлайн-ворклоад по обработке видео. Явное кэширование контекста уменьшает стоимость входных данных на 90% для закэшированной части длинного промпта – вы платите всего $0.125 за миллион токенов при чтении из кэша против Pro-тарифов плюс $4.50 за миллион токенов в час на хранение. А Live API для реального времени с аудио и видео поверх семейства Gemini 2.5 тарифицирует аудиовход примерно в $3.00 за миллион токенов (около $0.005 в минуту) и аудиовыход – в $12.00 за миллион (примерно $0.018 в минуту).
Цифра, которую должна увидеть финансовая команда. Часовое пользовательское видео на дефолтном медиа-разрешении – 1 080 000 input-токенов. Подача его в Gemini 2.5 Flash для саммари с 2 000 output-токенов стоит 1.08 × $0.30 + 0.002 × $2.50 ≈ $0.33. То же на Gemini 2.5 Pro – 1.08 × $1.25 + 0.002 × $10.00 ≈ $1.37. Переключитесь на low-resolution media (100 токенов/сек видео вместо 300) – и Flash опустится до примерно $0.11 за час обработки. Переключитесь на batch – и поделите ещё пополам. Это и есть инженерное решение, превращающее счёт от Gemini из тяжёлой проблемы в погрешность округления: low-resolution + Flash + batch на тех 90% нагрузок, где frontier-рассуждение не нужно.
Цены OpenAI API в 2026 году – семейство GPT-5 и слой Realtime
OpenAI в конце 2025 и на всём протяжении 2026 года жёстко перестроил линейку моделей. Текущий производственный набор: GPT-5 (рабочая лошадка) – $0.625 за токен ввода и $5.00 за токен вывода; GPT-5 Pro – $15.00 / $120.00; GPT-5.5, запущенный в апреле 2026 года как новый флагман для сложных рассуждений – $5.00 / $30.00; GPT-5.5 Pro – $30.00 / $180.00. Более лёгкие версии – GPT-5.4 Mini ($0.75 / $4.50) и GPT-5.4 Nano ($0.20 / $1.25) – покрывают большую часть объёмов в продакшене. GPT-4o и GPT-4o-mini остаются в прайсе по $2.50 / $10.00 и $0.15 / $0.60 соответственно, пока OpenAI постепенно сворачивает старую линейку; новые решения необходимо строить на базе моделей 5.x.
Batch и flex-исполнение делят стоимость GPT-5.5 пополам – с $5/$30 до $2,50/$15. Data residency в регулируемых регионах добавляет 10% к тарифам 5.x.
Строчка в прайсе OpenAI, которая удивляет каждую команду, – Realtime API. Голос и видео в реальном времени – это слой, обеспечивающий работу разговорных ИИ-агентов в звонках, – тарифицируется не текстовыми, а аудио-токенами. Текущее поколение, gpt-realtime-2, стоит $32 за миллион входных аудио-токенов и $64 за миллион выходных; кэшированный ввод обходится всего в $0,40 за миллион. Один токен – примерно 100 мс пользовательского аудио или 50 мс ассистентского. В пересчёте на минуту: некэшируемый real-time агент обходится примерно в $0,18–0,46 в минуту, а хорошо кэшируемый (большая часть промпта в кэше) – в $0,05–0,10 в минуту. Варианты translate ($0,034/мин) и whisper ($0,017/мин) – это специализированные и дешёвые решения для задач, которым не нужен полноценный разговорный слой.
Ловушка: команды строят прототип на стандартном Realtime API по $0.30/мин, масштабируют до десяти тысяч одновременных пользователей и обнаруживают, что счёт за голосовой ИИ – шестизначный в месяц. Лекарство почти всегда – prompt caching, который держит статичный system prompt в кэше и биллит по read-rate, плюс перенос лёгкой половины голосовых запросов с Realtime API на более дешёвый STT-LLM-TTS пайплайн.
Claude API цены – Opus, Sonnet, Haiku
Линейка Anthropic – самая прозрачная из трёх. По состоянию на май 2026 года тарифы для production: Claude Opus 4.7 – $5,00 за миллион токенов на вход и $25,00 на выход, Claude Sonnet 4.6 – $3,00 / $15,00, Claude Haiku 4.5 – $1,00 / $5,00. Старые источники до сих пор ссылаются на устаревший Claude 4 Opus по цене $15 / $75 – это модель предыдущего поколения; обращайте внимание на буквенную версию, а не только на название семейства.
Prompt caching у Claude работает иначе, чем у OpenAI: запись в 5-минутный кэш обходится в 1,25× базовой стоимости ввода, в часовой – в 2×, а чтение из кэша – всего 0,1× (скидка 90%). Batch-переработка снижает стоимость вывода вдвое для моделей Sonnet и Opus и сочетается с кэшированием. Эта комбинация особенно важна, потому что модели Anthropic чаще всего используются в задачах с высокими требованиями к рассуждению и длинными ответами – именно там batch и кэширование обеспечивают наибольшую экономию.
Одна таблица, которая висит над столом
Таблица ниже – это чит-шит по закрытым API на май 2026 года. Относитесь к ней как к снимку – обновляйте поквартально, потому что каждая её строка за последний год менялась более одного раза.
| Модель | Input $/1M | Output $/1M | Batch | Cache read | Применение |
|---|---|---|---|---|---|
| Gemini 2.5 Flash-Lite | 0.10 | 0.40 | 0.05 / 0.20 | 0.01 | Высокий поток классификаций, роутинг |
| Gemini 2.5 Flash | 0.30 | 2.50 | 0.15 / 1.25 | 0.03 | Дефолт большинства видео-нагрузок |
| Gemini 2.5 Pro | 1.25 | 10.00 | 0.625 / 5.00 | 0.125 | Long-context рассуждение по видео |
| GPT-5.4 Nano | 0.20 | 1.25 | n/a | varies | Дешёвый роутинг, черновики |
| GPT-5.4 Mini | 0.75 | 4.50 | n/a | varies | Mid-tier чат |
| GPT-5 | 0.625 | 5.00 | n/a | varies | Рабочая лошадка рассуждений |
| GPT-5.5 | 5.00 | 30.00 | 2.50 / 15.00 | varies | Flagship-рассуждение |
| GPT-5.5 Pro | 30.00 | 180.00 | varies | varies | Только крайние случаи |
| Claude Haiku 4.5 | 1.00 | 5.00 | 0.50 / 2.50 | 0.10 | Быстрый структурированный вывод |
| Claude Sonnet 4.6 | 3.00 | 15.00 | 1.50 / 7.50 | 0.30 | Long-form, агенты |
| Claude Opus 4.7 | 5.00 | 25.00 | 2.50 / 12.50 | 0.50 | Самые сложные задачи рассуждения |
| OpenAI Realtime gpt-realtime-2 (audio) | 32 | 64 | n/a | 0.40 | Real-time голос в WebRTC |
| Gemini Live (audio) | 3.00 | 12.00 | n/a | varies | Real-time голос/видео, стек Google |
Строки Gemini Live и Realtime API – единственные, которые тарифицируются по аудио-токенам, а не по текстовым. Не сравнивайте их построчно с текстовыми тарифами без пересчёта через эквивалент в минуту.
Слой аудио-ИИ – ASR, TTS, шумоподавление
Видеопродукт без слоя аудио-ИИ – это недостроенный продукт. Хорошая новость: в 2026 году аудиослой станет самой дешёвой строкой в вашем счёте по ИИ-услугам; единственный способ сделать аудио-ИИ дорогим – использовать неправильный API.
Доминирующие паттерны цен. Deepgram Nova-3 – самый дешёвый кредитоспособный ASR: $0.0043/мин в батч-режиме для английского языка и $0.0077/мин в стриминге. Час видео в батч-транскрипции обойдётся в $0.26, а в стриминге – в $0.46. OpenAI gpt-4o-mini-transcribe стоит около $0.003/мин ($0.18/час), gpt-4o-transcribe – $0.006/мин ($0.36/час). AssemblyAI Universal Streaming, тарифицируемый по времени открытой сессии по $0.15/час, – самый дешёвый вариант стриминга при плотных сессиях. Azure Speech real-time – $1.00/час, Google Cloud STT V2 base – $0.96/час: оба сервиса в десятки раз дороже Deepgram и OpenAI при выполнении той же задачи.
TTS – это место, где единица измерения меняется с минуты на символ, и именно это становится причиной перерасхода бюджета на TTS. ElevenLabs Flash и Turbo берут 0,5 кредита за символ, тогда как минимальный пакет – 100 кредитов – стоит от 99 долларов в месяц; эффективная стоимость составляет около 35–50 долларов за миллион символов в зависимости от выбранного тарифа. Cartesia Sonic 3 находится в той же ценовой категории. Open-source решение Kokoro TTS при развёртывании на собственном сервере (одна A100) позволяет обрабатывать около 3,6 млрд символов в месяц примерно за 750 долларов на вычисления – это около 0,20 доллара за миллион символов, что в 100 раз дешевле закрытых API, но требует самостоятельного управления GPU.
Пример с цифрами. Телемедицинский продукт, генерирующий часовое голосовое резюме при скорости 150 слов в минуту и примерно 5 символов на слово с пробелами, даёт около 60 000 символов TTS на приём. На ElevenLabs Flash это обходится примерно в $3 за приём; на Kokoro self-host – около $0,012. Умножьте на тысячу приёмов в день – разница составит около $1080 в день, или около $400 000 в год. Trade-off – качество голоса (ElevenLabs сейчас лучший по натуральности) и стоимость содержания GPU-парка. Для продуктов с высокой нагрузкой и внутренними голосами математика очевидна; для продуктов с низкой нагрузкой и строгим бренд-голосом ElevenLabs остаётся предпочтительным выбором.
Шумоподавление – категория-сюрприз. В мае 2026 года Krisp ввёл metered-pricing для SDK, и поминутный тариф BVC v3 теперь доступен только по приватному SDK-контракту. Бесплатные альтернативы – RNNoise и DeepFilterNet для подавления шума на стороне CPU, а также NVIDIA Maxine Audio Effects SDK для обработки на GPU – в целом соответствуют по качеству, но требуют значительных инженерных усилий. Подробный разбор вариантов «разработка или покупка» – в глубоком разборе шумоподавления в главе 3.
Чит-шит на строчку аудио-ИИ, рассчитанную на один час видео:
| Сервис | За минуту | За час |
|---|---|---|
| Deepgram Nova-3 batch | $0.0043 | $0.26 |
| Deepgram Nova-3 streaming | $0.0077 | $0.46 |
| OpenAI gpt-4o-mini-transcribe | $0.003 | $0.18 |
| OpenAI gpt-4o-transcribe | $0.006 | $0.36 |
| AssemblyAI Universal Streaming | n/a | $0.15 (session-based) |
| Azure Speech standard real-time | $0.0167 | $1.00 |
| Google STT V2 base | $0.016 | $0.96 |
| Whisper self-host (только compute) | n/a | ~$0.03 (плюс ops overhead) |
Оговорка «плюс ops overhead» в строке self-host Whisper – та, которую часто игнорируют. Рабочий деплой Whisper с production-надёжностью, мониторингом, автоскейлингом, ретраями и on-call инженерией обходится примерно в $1 в час – против $0,03 в час чистого вычисления. Вычисления дешёвые; обвязка – нет. Решение self-host для ASR редко имеет финансовый смысл при нагрузке ниже десяти тысяч часов аудио в месяц.
Слой генеративного видео – Sora, Runway, Veo, Kling, Pika, Luma, Hailuo
Генеративное видео – строчка, превращающая ИИ-бюджеты в ИИ-кошмары: единица измерения – сгенерированные секунды, а цена за секунду на несколько порядков выше, чем у любой текстовой или аудио-модели. Sora 2 Standard по $0.10 за секунду – это пол для серьёзного frontier-качества; Sora 2 Pro по $0.50 за секунду при разрешении 1024p – потолок. Переведите это в «один час сгенерированного видео» – получите $360 за Standard и $1 800 за Pro в час, цифра, способная положить конец обсуждению дорожной карты продукта, если математика не была проделана заранее.
Линейка 2026, нормализованная по цене за секунду, выглядит следующим образом. Дешёвые тарифы – Hailuo 02 Standard 768p ($0.045/сек), Runway Gen-4 Turbo ($0.05/сек), Veo 3.1 Lite ($0.05/сек) – подходят для быстрой итерации, черновиков и большинства задач consumer-ориентированного b-ролла. Средний сегмент – Luma Dream Machine Ray 3 ($0.08/сек), Hailuo 02 Pro 1080p ($0.08/сек), Kling 2.0/3.0 ($0.075–$0.112/сек в зависимости от тира и разрешения) и Runway Gen-4 Standard ($0.10–$0.15/сек). Флагманы – Sora 2 Standard ($0.10/сек), Sora 2 Pro 720p ($0.30/сек), Veo 3 с нативным аудио ($0.75/сек), Sora 2 Pro 1024p ($0.50/сек).
Форма кривой стоимости интереснее абсолютных чисел. Качество, аудио, разрешение и частота кадров влияют на цену примерно линейно. Добавление аудио к Veo 3 увеличивает стоимость с $0.50 до $0.75 за секунду – это премия в 50%. Переход с 720p на 1024p у Sora 2 Pro – с $0.30 до $0.50 за секунду – даёт премию в 67%. Удвоение длительности с 5 до 10 секунд приводит к удвоению цены. Принимая решения о добавлении аудио, повышении разрешения или увеличении длительности клипа, важно понимать: каждый из этих параметров – множитель цены, а не бесплатный переключатель.
Ловушка – разрыв между прототипом и продакшеном. Основатель генерирует десять клипов Sora 2 Pro в 1024p в пятницу днём, счёт – $25, и думает: «Sora – дешёвый». Через три месяца продукт генерирует десять тысяч клипов в день на том же уровне, счёт – $25 000 в день, $9 млн в год – и основатель звонит в Anthropic за скидкой на Sonnet. Выход тот же, что и на стороне LLM: работать по use case. Черновики – на Runway Gen-4 Turbo или Hailuo 02 Standard по $0,05 за секунду; финальный hero-контент – на Sora 2 Pro. Продукту никогда не нужно frontier-качество на каждом клипе.
| Генератор | За секунду | За 10-сек клип | За час сгенерированного |
|---|---|---|---|
| Hailuo 02 Standard 768p | $0.045 | $0.45 | $162 |
| Runway Gen-4 Turbo | $0.05 | $0.50 | $180 |
| Veo 3.1 Lite 720p no audio | $0.05 | $0.50 | $180 |
| Kling 3.0 720p | $0.075 | $0.75 | $270 |
| Luma Dream Machine Ray 3 | $0.08 | $0.80 | $288 |
| Hailuo 02 Pro 1080p | $0.08 | $0.80 | $288 |
| Sora 2 Standard 720p | $0.10 | $1.00 | $360 |
| Runway Gen-4 standard | $0.10 to $0.15 | $1.00 to $1.50 | $360 to $540 |
| Sora 2 Pro 720p | $0.30 | $3.00 | $1 080 |
| Veo 3 with native audio | $0.75 | $7.50 | $2 700 |
| Sora 2 Pro 1024p | $0.50 | $5.00 | $1 800 |
Другой рычаг – скрытый за сравнением цен: не каждому продукту нужно создавать видео с нуля. ИИ-редактирование стокового футажа, автоматический монтаж трейлеров из существующих OTT-библиотек и генерация превью per-title – часто правильный выбор. Стоимость секунды готового контента, доставленного таким способом, на один-два порядка ниже, чем при генерации с нуля через диффузию. Статья главы 5 про инструменты ИИ-видеоредактирования – Opus Clip, Descript, Submagic, Captions AI, DaVinci AI подробно разбирает этот подход.
Слой self-host – экономика GPU в 2026
Закрытые API выигрывают по скорости разработки и передовым возможностям, а self-Hosting – по удельной стоимости при превышении определённого объёма. Точка пересечения – самое важное число в вашей модели издержек.
Почасовая стоимость GPU в мае 2026 года значительно снизилась по сравнению с пиковыми значениями 2024 года, но сильно различается между провайдерами. Цены от самых дешёвых к самым дорогим: NVIDIA H100 SXM5 – Spheron spot $1.03/час, RunPod community $1.99/час, Lambda Labs on-demand $2.99/час, GCP A3-высокопроизводительный $3.00/час, CoreWeave HGX 8-узловые GPU $6.15/GPU/час, AWS p5 около $6.88/час, Azure около $12.29/час. Разница в 12 раз между самым дешёвым и самым дорогим вариантом – реальная и самая значительная возможность для экономии при self-host. Компромисс заключается не только в цене: важны также надёжность, географическое покрытие, соответствие регуляторным требованиям и скорость возврата инстансов после прерывания. При работе в продакшене на дешёвых провайдерах планируйте утилизацию на уровне 70–80%, а не 100%.
Цены на NVIDIA B200 (Blackwell) стабилизировались к 2026 году: от $2,12 до $2,25 в час на spot-рынке, $2,65 в час при бронировании на год на CoreWeave, $3,49 в час по модели on-demand на Lambda, $5,98 в час на RunPod и до $14,24 в час на премиальных тирах с высокой доступностью. B200 обеспечивает примерно в 2,5 раза больший throughput по сравнению с H100 при работе с трансформерными нагрузками, поэтому грубое правило таково: B200 по цене $3 в час сопоставим с H100 по $1,20 в час при нормализации по производительности.
Старые GPU – правильный выбор для многих видеонагрузок. NVIDIA L40S стоит $0.50/час на spot и имеет медианную цену on-demand около $1.73/час. A100 80GB – $0.44/час на spot и медиана on-demand около $2.06/час. На Vast.ai A100 доступны от $0.67/час. Для задач компьютерного зрения – YOLO, SAM 2, optical flow, сегментация – эти GPU оказываются избыточными, и стоимость обработки одного кадра приближается к минимально возможной без перехода на CPU. AMD MI300X закрыл разрыв в сфере сервинга LLM: от $0.95/час на spot до $3.02/час медианной цены on-demand на RunPod и DigitalOcean.
Край кривой стоимости – и по цене, и по задержкам. NVIDIA Jetson Orin Nano Super Developer Kit за $249 (67 TOPS) и Jetson AGX Orin 64GB Developer Kit за $1 999 (275 TOPS) – канонический edge-решение для видеоаналитики. Амортизированный на три года, AGX Orin даёт примерно $0,08 за час вычислений – дешевле любого облачного GPU, с нулевой сетевой задержкой и полным контролем над данными. Компромисс – пропускная способность: AGX Orin справляется с десятками потоков камер, но не с тысячами.
Apple Silicon заслуживает места на карте стоимости для любого продукта с on-device inference. Mac Studio M4 Max со 128 ГБ unified memory стартует с $1 999 и обрабатывает 70B-модели со скоростью 15–18 токенов в секунду через MLX; M3 Ultra со 192 ГБ памяти и пропускной способностью 800 ГБ/с стартует с $3 999 и справляется с теми же моделями на скорости 25–30 токенов в секунду. В случае внутренних видеоинструментов, где компания полностью контролирует оборудование, стоимость одного вывода после капитальных затрат стремится к нулю, а в качестве дополнительного бонуса – пользовательские данные остаются на устройстве.
Пересечение – когда self-host выигрывает?
Пересечение API и self-host происходит на порогах, зависящих от объёма рабочей нагрузки, и всё это – математика на салфетке.
Канонический пример – Whisper. OpenAI Whisper API по $0.006 за минуту стоит $9 в час при полной загрузке одного GPU (один GPU обрабатывает около 1 500 минут аудио в час с качественной моделью). Самостоятельный запуск Whisper Large на A100 через Spheron по тарифу on-demand – $1.07 в час – обеспечивает ту же производительность примерно за $1.07 в час GPU-времени. Точка пересечения – около 7 200 минут в месяц, то есть примерно 120 часов, или четыре часа в день при постоянной загрузке GPU. Ниже этого порога API дешевле и значительно проще в использовании. Выше – self-host выигрывает в 4–8 раз по чистой вычислительной мощности, не считая накладных расходов на операции.
Исследование Lenovo Press 2026 TCO показывает преимущество self-Hosting на оборудовании Lenovo в 8 раз по сравнению с облачным IaaS для LLM-инференса и до 18 раз – по сравнению с использованием API моделей frontier-моделей как сервиса (model-as-a-service). Пятилетняя экономия на одном сервере может превысить 5 млн долларов. Подвох – а он всегда есть – в том, что сравнение предполагает: нагрузка легко размещается на одном сервере, у команды есть операционная экспертиза для управления платформами инференса, а альтернативный API-подход использует тарифы frontier, где вы платите и за вычисления, и за бренд. Если ваша нагрузка в основном использует дешёвые тарифы (Flash, Haiku, Gemini Flash-Lite), точка безубыточности смещается далеко вправо, и self-hosting может никогда не окупиться.
Fine-tuning, RAG и то, о чём не говорят
Базовая стоимость инференса – лишь половина счёта. Fine-tuning, retrieval, векторное хранение и операционные расходы на всё, что работает в продакшене, – это строки, которые появляются только после того, как прототип отправлен в продакшн, и CFO начинает задавать острые вопросы.
OpenAI fine-tuning – 25 долларов за миллион токенов обучения для GPT-4o, fine-tuned inference – 3,75 доллара за миллион входных токенов и 15 долларов за миллион выходных. К маю 2026 года OpenAI прекращает поддержку своей платформы fine-tuning для новых пользователей; существующие задания продолжают работать, а до устаревания базовой модели fine-tuned модели остаются доступны для вывода. Для новых проектов рекомендуется использовать prompt engineering в сочетании с retrieval или перейти на fine-tuning открытых моделей, таких как Llama, Qwen или Mistral, на собственных GPU.
Vertex AI тарифицирует fine-tuning модели Gemini по node-hour для custom training и по количеству training token для supervised fine-tuning. Плоского публичного тарифа в $/1M токенов нет – стоимость зависит от региона, объёма использования и доступной ёмкости. Эта непрозрачность – один из реальных минусов стека Vertex по сравнению с альтернативой в лице OpenAI, и её стоит учитывать при закупках.
Векторное хранение – это строка, теряющаяся в счётчике AWS, пока кто-то не запросит отчёт. Pinecone Serverless стоит около $70 в месяц при 10 млн векторов и превышает $700 в месяц при 100 млн. Pgvector в self-host режиме на Postgres справляется с таким же масштабом примерно за $45 в месяц на малом инстансе и менее чем за $100 в месяц на более мощном. Разница в стоимости – в 7–14 раз и растёт нелинейно с увеличением объёма. Поэтому правильный архитектурный подход для любого видеопродукта, ожидающего более нескольких миллионов видео-сегментов в RAG-индексе, – начать с pgvector, а Pinecone использовать только в случае, если операционные требования делают Postgres неприемлемым. Статья четвёртой фазы про video RAG и multimodal RAG поверх архива видео подробно разбирает архитектуру.
Скрытый операционный налог – это всё остальное: мониторинг (Datadog, Grafana Cloud, Honeycomb – обычно 5–10% от затрат на вычисления), отслеживание ошибок, наблюдаемость для агентских воркфлоу (AgentOps, LangSmith, Helicone), передача данных на облачные API (часто 10% от вычислительных затрат в пайплайнах между регионами) и поддержка дежурных инженеров. Эмпирическое правило для хорошо проинструментированного production-стека ИИ – умножить чистую стоимость вычислений на 1,4–1,6, чтобы получить итоговую сумму.
EU AI Act – вступит в силу в августе 2026 года
Обязательства по GPAI в рамках EU AI Act вступают в силу с 2 августа 2025 года, однако полномочия Еврокомиссии по контролю за их соблюдением и применение штрафов – до 3% глобального оборота или 15 млн евро – начнутся только 2 августа 2026 года. Для любого видеопродукта, продаваемого на рынке ЕС и использующего модели общего назначения на основе ИИ, затраты на соответствие требованиям реальны и поддаются оценке.
Latham & Watkins и другие юридические трекеры оценивают затраты на первый год соблюдения норм (compliance) для провайдеров foundation-моделей и интеграторов в диапазоне от 12 до 25 млн долларов. Для большинства видеопродуктовых компаний эта сумма ниже, поскольку они выступают интеграторами, а не провайдерами моделей, – однако обязательства остаются серьёзными: техническая документация, инструкции по использованию, соответствие директиве об авторском праве, сводки по обучающим данным, оценка моделей, тестирование на устойчивость к атакам, отчётность об инцидентах и контроль кибербезопасности.
В ИИ-учёте обычно не учитываются часы юристов, хотя они тоже складываются. Речь идёт об инженерных усилиях по инструментированию каждого вызова модели метаданными, которые требует регулятор, хранению логов в compliant-хранилище и предоставлению audit trail по запросу. Если выходите на рынок ЕС, закладывайте 10–15 процентных пунктов сверх чистого API-расхода на compliance-накладные. Статья главы 8 про регуляторный engineering EU AI Act разбирает конкретные статьи и инженерные решения.
Пример с цифрами – видеопродукт на 100 000 пользователей в месяц
Смысл cost-модели – предсказать счёт до того, как счёт придёт. Полный пример для типового видеоконференц-продукта 2026 года: 100 000 monthly active users, в среднем 8 часов видеозвонков в месяц на пользователя, с live-субтитрами, опциональным real-time переводом, ИИ-нотетейкером встреч и еженедельными ИИ-дайджестами.
Цифры построчно.
Live-субтитры на каждой минуте каждого звонка. 100 000 × 8 часов = 800 000 часов аудио. На Deepgram Nova-3 streaming по $0,46/час счёт за live-субтитры – $368 000/мес. На AssemblyAI Universal Streaming по $0,15/час session-based (сессии примерно непрерывные) – $120 000/мес. Выбор реальный: точность в реальном времени против стоимости; для большинства продуктов Deepgram выигрывает по качеству, AssemblyAI – по цене.
Real-time перевод используется в 20% звонков. 20% от 800 000 часов – это 160 000 часов. По тарифу gpt-realtime-translate $0,034 за минуту получается $326 400 в месяц. Это самая крупная статья расходов в расчёте, и она наиболее убедительно обосновывает переход на стек Gemini Live или собственный хостинг пайплайна перевода.
ИИ-нотетейкер на каждом звонке. Нотетейкер обрабатывает полный транскрипт (час аудио при скорости 150 слов в минуту – около 9 000 слов, или примерно 13 000 input-токенов) и генерирует структурированное резюме (около 1 000 output-токенов на звонок). 800 000 звонков × $0.30/1M × 13K input + $2.50/1M × 1K output = 800 000 × ($0.0039 + $0.0025) = $5 120/мес на Gemini 2.5 Flash. Статьи главы 6 про LiveKit real-time AI meeting assistant и полный репозиторий LiveKit meeting note-тейкер проходят production-имплементацию.
Еженедельный дайджест саммари недельных звонков на пользователя. 100 000 пользователей × 4 недели = 400 000 дайджестов в месяц. Каждый ест недельные 8 часов аудио, сведённые к примерно 50 000 транскрибированных слов (около 65 000 input-токенов) и выдаёт 500-словный дайджест (около 650 output-токенов). На Gemini 2.5 Flash: 400 000 × ($0.30/1M × 65K + $2.50/1M × 650) = $8 450/мес.
Векторное хранилище архива встреч (RAG поверх последних 90 дней встреч компании). 100 000 пользователей × ~50 часов аудио в квартал × 1 embedding на 10 секунд = 1.8 млрд активных embeddings. На Pinecone Serverless в масштабе – примерно $12 600/мес; на pgvector self-host на мощном Postgres-кластере – примерно $2 000/мес с учётом времени DB-оператора, амортизированного.
Compliance overhead – 12% от ИИ-линии: примерно $32 000 в месяц на комбинации Deepgram/translation/Flash.
Операционный налог – 1,5× compute: множитель к чистой стоимости вычислительных ресурсов.
Итог дешёвого пути: $120 000 (AssemblyAI) + $326 400 (перевод) + $5 120 (нотетейкер) + $8 450 (дайджест) + $2 000 (pgvector) = $462 000 в месяц до накладных расходов; с учётом накладных и compliance – примерно $700 000/мес all-in. Это $4,20 на пользователя в месяц за ИИ-линию – в пределах того, что может выдержать здоровый consumer- или B2B SaaS-продукт при выручке $10–$30 в месяц на пользователя.
Теперь воспользуемся рычагами оптимизации. Переключимся на Gemini Live по тарифу $0.018 за минуту генерации: 160 000 × 60 × $0.018 = $172 800 в месяц вместо $326 400 – экономия составляет $153 000 в месяц. Кэшируем system-промпты в нотетейкере и дайджестере – это даёт сокращение input-токенов примерно на 70%, экономия около $4 000 в месяц. Переведём нотетейкер на Gemini 2.5 Flash-Lite для принятия решений о роутинге, а саммари оставим на полнофункциональном Flash – дополнительная экономия $1 500 в месяц. Самостоятельно хостим Whisper Large для live-субтитров, снижая затраты с $120 000 до примерно $8 000 в месяц на GPU-вычисления плюс инженерные издержки – итого около $25 000 в месяц «всё включено». Итог: $200 000–$250 000 в месяц «всё включено» за тот же функционал – $2.20 на пользователя в месяц на ИИ, что в три раза эффективнее наивного подхода.
Сопровождающий XLSX-воркшит проходит тот же пример с редактируемыми ячейками, чтобы вы могли подставить свои числа пользователей, профиль нагрузки и выбор тарифов. Скачать ниже.
Распространённая ошибка – путать счёт прототипа со счётом прода
Самая дорогая ошибка команд – экстраполировать месячный счёт прототипа линейно на продукт. Три фактора делают рост стоимости в продакшене сверхлинейным, а не линейным.
Во-первых, нагрузка прототипа обычно сконцентрирована на самом дешёвом тарифе – разработчик платит своей картой и делает аккуратные выборы. Production-нагрузка накапливает исключения: клиент попал в edge-case, инженер добавил fallback на более дорогую модель; шипнулась новая фича, PM попросил «умную версию», логика роутинга добавила ещё один путь к GPT-5 Pro. Каждое добавление – множитель ×5–×30 на затронутый кусок трафика.
Во-вторых, ретраи, инвалидации кэша и reasoning loops накапливаются. Один ретрай провалившегося Realtime API-звонка удваивает стоимость минуты. Инвалидация кэша, вызванная сменой system-промпта, стирает неделю экономии. Агент, который трижды пытается уточнить tool call вместо однократного выполнения, утраивает стоимость взаимодействия.
В-третьих, операционный налог мультипликативен, а не аддитивен. Множитель 1.5× на чистый compute – это множитель, применяемый к растущей базе. Операционный тулинг (Datadog, отслеживание ошибок, наблюдаемость) тарифицируется за каждый обработанный event, поэтому его стоимость растёт пропорционально нагрузке на API.
Защитная практика – построить cost-модель первой, продукт вторым. Возьмите целевой unit-cost на пользователя в месяц, разложите на per-feature unit-cost, проинструментируйте каждый вызов API против этих целей в проде, алертируйте, когда фича пересекает 120% от своей цели. Статья главы 8 про оптимизацию стоимости видео-ИИ – 25 рычагов каталогизирует полный набор оптимизаций, но дисциплина измерять до оптимизации важнее любого отдельного рычага.
Двенадцать рычагов стоимости – задействуйте все
Один и тот же шаблон повторяется во всех пройденных категориях. Ниже – мастер-список. Большинство команд выполняют два-три пункта; высокоэффективные – все двенадцать.
Первые шесть – это рычаги уровня модели. Исследуйте use case и выбирайте самый дешёвый тариф, который соответствует плану качества. Используйте Flash, Haiku, Mini, Nano как базовые варианты; резервируйте флагманские тарифы только для тех запросов, которым они действительно необходимы. Агрессивно кэшируйте статичные промпты: у Gemini, OpenAI и Anthropic чтение из кэша даёт скидку 90% от стоимости ввода, а затраты на запись в кэш окупаются после нескольких обращений. Обрабатывайте в батч-режиме любую нагрузку, не требующую мгновенного ответа – батч-обработка экономит до 50% вычислительных ресурсов. Используйте низкое разрешение медиа для видео и аудио, если задача не требует полного качества: на Gemini это даёт сокращение видео-токенов в три раза. Агрессивно обрезайте контекст – большинству задач на рассуждение требуется лишь малая часть того, что содержится в промпте. Сжимайте system-промпты после каждой смены фич: со временем они растут, а их никто не сокращает.
Следующие три – рычаги уровня архитектуры. Перейдите с frontier-API на self-host решёток Llama / Qwen / Mistral для 80% нагрузок, которым не нужна frontier-способность – TCO Lenovo показывает экономию в 8–18 раз в масштабе, а open-weight модели отстают от frontier не более чем на 5% по большинству production-бенчмарков (см. сравнение open-frontier VLM в главе 4). Переносите inference на edge – Jetson Orin или Apple Silicon – для задач, где узкое место – данные пользователя, а не вычислительные мощности. И заменяйте дорогие синхронные API более дешёвыми асинхронными пайплайнами там, где это допустимо с точки зрения UX.
Последние три – операционные рычаги. Договоритесь о volume-контрактах на сумму выше $50 000/мес по API-расходам – у каждого крупного провайдера есть скидки для клиентов с фиксированным использованием, обычно 20–40%. Следите за стоимостью одного запроса, а не только за их количеством: стоимость на запрос (cost-per-request) помогает выявить регрессии в роутинге раньше, чем это покажет счёт. Используйте spot- или interruptible-GPU для пакетных задач – экономия составляет 50–80% по сравнению с on-demand, а инженерная сложность работы с прерываниями минимальна при использовании подходящего фреймворка.
| Рычаг | Типичная экономия | Где применяется |
|---|---|---|
| Роутинг на более дешёвый тариф | ×5–×30 на роутном трафике | Любой closed-API workload |
| Prompt caching | 70–90% на закэшированной части | Стабильные system-промпты |
| Batch-обработка | 50% | Не-realtime нагрузки |
| Low-resolution media | ×3 на видео-токенах | Большинство VLM-задач |
| Context truncation | 20–60% | Long-context reasoning |
| System-prompt compression | 10–30% | Зрелые продукты |
| Self-host на open weights | ×5–×20 | High-volume нагрузки |
| Edge inference | до ×100 | Latency-sensitive фичи |
| Async пайплайны | 50–80% | Batch-приемлемый UX |
| Volume-контракты | 20–40% | Выше $50K/мес расхода |
| Cost-per-request мониторинг | 10–30% (пойманные регрессии) | Production-масштаб |
| Spot / interruptible GPU | 50–80% | Batch GPU-работа |
Где здесь Фора Софт
Фора Софт с 2005 года разрабатывает видеопродукты с закрытым API для искусственного интеллекта, поддержкой локального вывода и гибридными топологиями в видеоконференциях, OTT, видеонаблюдении, телемедицине и e-learning. Мы пересматривали модели затрат у клиентов в продакшене, помогая им перейти с ежемесячного счёта в $200 000 за закрытый API на гибридный стек стоимостью $40 000 в месяц – без потери качества пользовательских функций. Работа не самая яркая: логика маршрутизации, политики кэширования, выбор между батчевой и потоковой обработкой, а также ежеквартальный пересмотр таблицы unit-экономики. Но именно это решает, будут ли ИИ-функции окупать свою разработку или станут причиной отказа на следующем бюджете. Если вы столкнулись с жёсткими ограничениями по стоимости ИИ в видеопродукте, мы – та команда, к которой обращаются, когда прочитаны все статьи по теме, а цифры всё равно не сходятся.
Ключевые выводы
- Видео генерирует токены, минуты и секунды с темпом, недоступным текстовым продуктам – оценивайте стоимость в расчёте на час видео.
- Флагманские модели для сложных рассуждений в 10–30 раз дороже тарифа Flash; выбирайте решение под конкретный use case, а не по умолчанию.
- Кэширование, батчинг, использование низкокачественных медиа и самохостинг на открытых весах в совокупности позволяют сократить затраты в 5–20 раз при масштабировании.
- Генерация видео тарифицируется по секундам и увеличивает счёт быстрее, чем любая другая категория – обязательно моделируйте расходы заранее, до масштабирования.
- Переход от закрытых API к самохостингу происходит на порогах, зависящих от объёма и специфики нагрузки; ниже этих порогов API остаётся более выгодным и простым решением.
Что читать дальше
- Латентность, топология деплоя и real-time vs batch – архитектурные решения, формирующие cost-модель.
- Форматы артефактов моделей и выбор open-vs closed – формат, определяющий возможность self-host.
- Оптимизация стоимости видео-ИИ – 25 рычагов – подробный разбор каждого приёма экономии.