Содержание статьи +
- TL;DR
- Зачем это нужно
- Как видео превращается в доллары – одна ментальная модель на всю статью
- Слой закрытых API – Gemini, OpenAI, Anthropic в цифрах 2026
- Слой аудио-AI – ASR, TTS, шумоподавление
- Слой генеративного видео – Sora, Runway, Veo, Kling, Pika, Luma, Hailuo
- Слой self-host – экономика GPU в 2026
- Fine-tuning, RAG и то, о чём не говорят
- EU AI Act – строка, бьющая в августе 2026
- Пример с цифрами – видеопродукт на 100 000 пользователей в месяц
- Распространённая ошибка – путать счёт прототипа со счётом прода
- Двенадцать рычагов стоимости – стакайте все
- Где здесь Фора Софт
- Ключевые выводы
- Что читать дальше
TL;DR
Закрытый AI API в видеопродукте кажется дешёвым на единичном запросе и становится очень дорогим в масштабе, потому что видео порождает токены, минуты и секунды с темпом, которого нет в чисто текстовых чат-продуктах. Цифры мая 2026 года – Gemini 2.5 Pro по $1.25 / $10.00 за миллион токенов, GPT-5 по $0.625 / $5.00, Claude Sonnet 4.6 по $3.00 / $15.00, OpenAI Realtime API по $32 / $64 за миллион аудио-токенов, Sora 2 по $0.10–$0.50 за сгенерированную секунду – складываются в небольшое число доминирующих строк бюджета, которые можно посчитать на салфетке, если знать профиль нагрузки. Статья проходит весь стек цен – закрытые API, аудио-ИИ, генеративное видео, GPU для self-host, fine-tuning и RAG – и переводит каждую категорию в стоимость одного часа видео, чтобы продакт, основатель и инженер могли спорить на основе одной таблицы. Затем показывает, как сократить эти числа в 5–20 раз кэшированием, batch-обработкой, маленькими моделями и гибридной топологией, которая шлёт frontier-качество туда, где оно нужно, и 1B-параметрическую open-модель везде ещё.
Зачем это нужно
Если вы строите видеопродукт в 2026 году, ваш ИИ-счёт – не строчка бюджета, а та самая строчка бюджета. Inference уже занимает примерно две трети от всех ИИ-вычислений и идёт по траектории, при которой к 2030 году доминирует над спросом дата-центров (McKinsey, Deloitte). Тот же прогноз Gartner о падении стоимости inference на 90% к 2030 году – это причина, по которой ваш CFO спрашивает, почему счёт вырос на 320% за два года, хотя цена за токен упала в 280 раз: масштаб обгоняет снижение цены. Правильная модель издержек – и вы шипите фичи, окупающие сами себя; неправильная – и runway сгорает между seed и Series A. Этот урок для продакт-менеджера, которому нужна защищаемая таблица к ближайшему борду, для основателя, выбирающего между Sora и Runway на первой неделе, и для инженера, объясняющего, почему счёт от OpenAI Realtime больше счёта от AWS. Предполагается, что вы уже прочитали урок 1.2 о латентности и топологии деплоя и урок 1.3 о форматах артефактов моделей и решении open-vs-closed, потому что вопрос стоимости имеет смысл только в контексте того, где модель работает и в каком файле она поставляется.
Как видео превращается в доллары – одна ментальная модель на всю статью
Каждая ИИ-стоимость в видеопродукте трассируется к одному из пяти юнитов: токены (текст и мультимодальные данные), аудио-минуты (специализированный аудио-токенный тариф), сгенерированные секунды (для диффузионных видеомоделей), GPU-часы (self-host) и байты (векторное хранилище, egress, холодный архив). Что удивляет инженеров, пришедших из чисто текстовых продуктов, – как быстро видео превращает время сразу во все пять юнитов.
Часовое видео, поданное в Gemini на дефолтном медиа-разрешении, – это примерно 1 080 000 входных токенов. (Google токенизирует видео примерно по 300 токенов на секунду на дефолтном разрешении; час равен 3600 секундам; 300 × 3600 = 1 080 000.) Один этот факт меняет любой разговор о стоимости API: чат-продукт, где типичный пользователь шлёт пару тысяч токенов за сессию, живёт во вселенной, отличной от видеопродукта, где одна пользовательская загрузка – это миллион токенов до того, как кто-то прочитал хоть слово ответа. Помножьте на аудиодорожку (час аудио в токенизации OpenAI Realtime API по 100 мс на токен – это 36 000 входных аудио-токенов, при $32 за миллион – $1.15 только за аудио), и видно, как видеопродукты генерируют ИИ-счета ещё до того, как сгенерируют первый ответ.
Следствие – самый простой и самый недооценённый рычаг экономии в индустрии: большинство этих токенов можно было не отправлять. Кэширование, batch, downsampling, разреженный sampling кадров и переключение с frontier-модели на Flash-тариф на лёгких 90% запросов – это разница между фичей, которая окупается, и фичей, которая обнуляет линию продукта. Каждая секция этой статьи возвращается к этому рычагу.
Слой закрытых API – Gemini, OpenAI, Anthropic в цифрах 2026
Слой закрытых API проще всего моделировать, потому что вендоры публикуют цену за миллион токенов. Сложная часть – попасть тарифом в нагрузку и помнить, что flagship-модели для рассуждений не в 2 раза, а в 10–30 раз дороже Flash-тарифа. Неправильно роутить поток рутинных запросов – и счёт это покажет.
Gemini API цены – линейка 2026
Семейство Google Gemini 2.5 – рабочая лошадка для большинства видео-нагрузок 2026 года, потому что его токенизатор нативно обрабатывает видео-вход. Стандартный developer-тариф Gemini 2.5 Pro – $1.25 за миллион входных токенов и $10.00 за миллион выходных на промптах до 200 000 токенов; выше 200 000 цена поднимается до $2.50 и $15.00. Gemini 2.5 Flash, модель, на которую большинство видеопродуктов в итоге переключатся по умолчанию, стоит $0.30 input и $2.50 output за миллион. Gemini 2.5 Flash-Lite – самый маленький production-grade тариф – опускается до $0.10 input и $0.40 output.
Поверх этих базовых цен стакаются три механизма скидок, которые регулярно упускают. Batch-обработка делит цену пополам на джобах, которые можно отправить асинхронно и забрать позже, – а это почти любой offline workload понимания видео. Явное context caching срезает input-стоимость на 90% на закэшированной части длинного промпта – вы платите $0.125 за миллион токенов на чтениях кэша против Pro-тарифа плюс сбор за хранение $4.50 за миллион токенов в час. И Live API для real-time аудио и видео поверх семейства Gemini 2.5 тарифицирует аудио-вход примерно в $3.00 за миллион токенов (около $0.005/мин) и аудио-выход в $12.00 за миллион (около $0.018/мин).
Цифра, которую должна увидеть финансовая команда. Часовое пользовательское видео на дефолтном медиа-разрешении – 1 080 000 input-токенов. Подача его в Gemini 2.5 Flash для саммари с 2 000 output-токенов стоит 1.08 × $0.30 + 0.002 × $2.50 ≈ $0.33. То же на Gemini 2.5 Pro – 1.08 × $1.25 + 0.002 × $10.00 ≈ $1.37. Переключитесь на low-resolution media (100 токенов/сек видео вместо 300) – и Flash опустится до примерно $0.11 за час обработки. Переключитесь на batch – и поделите ещё пополам. Это и есть инженерное решение, превращающее счёт от Gemini из тяжёлой проблемы в погрешность округления: low-resolution + Flash + batch на тех 90% нагрузок, где frontier-рассуждение не нужно.
OpenAI API цены 2026 – семейство GPT-5 и слой Realtime
OpenAI в конце 2025 и весь 2026 жёстко переставил линейку. Production-набор на сейчас: GPT-5 (рабочая лошадка) по $0.625 input и $5.00 output; GPT-5 Pro по $15.00 / $120.00; GPT-5.5, запущенный в апреле 2026 как новый flagship для рассуждений, по $5.00 / $30.00; GPT-5.5 Pro по $30.00 / $180.00. Меньшие тарифы – GPT-5.4 Mini ($0.75 / $4.50) и GPT-5.4 Nano ($0.20 / $1.25) – покрывают большую часть объёмов в проде. GPT-4o и GPT-4o-mini остаются в прайсе по $2.50 / $10.00 и $0.15 / $0.60, пока OpenAI сворачивает линейку; новые билды нужно строить под 5.x.
Batch и flex-исполнение делят стоимость GPT-5.5 пополам – с $5/$30 до $2.50/$15. Data residency в регулируемых регионах прибавляет 10% к 5.x.
Строчка в прайсе OpenAI, которая удивляет каждую команду, – Realtime API. Real-time голос и видео – слой, питающий разговорные ИИ-агенты внутри звонков, – тарифицируется не текстовыми токенами, а аудио-токенами. Текущее поколение, gpt-realtime-2, – $32 за миллион входных аудио-токенов и $64 за миллион выходных; cached input падает до $0.40 за миллион. Один токен – примерно 100 мс пользовательского аудио или 50 мс ассистентского. В пересчёте на минуту: некэшируемый real-time агент стоит примерно $0.18–$0.46/мин, а хорошо кэшируемый (большая часть промпта в кэше) – $0.05–$0.10/мин. Варианты translate ($0.034/мин) и whisper ($0.017/мин) – специализированные дешёвые пути для нагрузок, которым не нужен полноценный разговорный слой.
Ловушка: команды строят прототип на стандартном Realtime API по $0.30/мин, масштабируют до десяти тысяч одновременных пользователей и обнаруживают, что счёт за голосовой ИИ – шестизначный в месяц. Лекарство почти всегда – prompt caching, который держит статичный system prompt в кэше и биллит по read-rate, плюс перенос лёгкой половины голосовых запросов с Realtime API на более дешёвый STT-LLM-TTS пайплайн.
Claude API цены – Opus, Sonnet, Haiku
Линейка Anthropic – самая чистая из трёх. На май 2026 production-тарифы: Claude Opus 4.7 – $5.00 input и $25.00 output за миллион, Claude Sonnet 4.6 – $3.00 / $15.00, Claude Haiku 4.5 – $1.00 / $5.00. Старые трекеры всё ещё ссылаются на legacy Claude 4 Opus по $15 / $75 – это предыдущее поколение; смотрите на буквенную версию, не только на имя семейства.
Prompt caching у Claude устроен иначе, чем у OpenAI: запись в 5-минутный кэш стоит 1.25× базовой input-цены, запись в часовой – 2×, чтения из кэша – 0.1× (скидка 90%). Batch делит output-стоимость пополам на Sonnet и Opus и стакается с кэшированием. Комбинация важна, потому что модели Anthropic обычно выбирают для нагрузок с высокими требованиями к рассуждению и длинными ответами – ровно тех, где batch + cache дают самую большую экономию.
Одна таблица, которая висит над столом
Таблица ниже – это чит-шит на слой закрытых API в мае 2026 года. Относитесь к ней как к снимку – освежайте поквартально, потому что каждая её строка двигалась в течение последнего года больше одного раза.
| Модель | Input $/1M | Output $/1M | Batch | Cache read | Применение |
|---|---|---|---|---|---|
| Gemini 2.5 Flash-Lite | 0.10 | 0.40 | 0.05 / 0.20 | 0.01 | Высокий поток классификаций, роутинг |
| Gemini 2.5 Flash | 0.30 | 2.50 | 0.15 / 1.25 | 0.03 | Дефолт большинства видео-нагрузок |
| Gemini 2.5 Pro | 1.25 | 10.00 | 0.625 / 5.00 | 0.125 | Long-context рассуждение по видео |
| GPT-5.4 Nano | 0.20 | 1.25 | n/a | varies | Дешёвый роутинг, черновики |
| GPT-5.4 Mini | 0.75 | 4.50 | n/a | varies | Mid-tier чат |
| GPT-5 | 0.625 | 5.00 | n/a | varies | Рабочая лошадка рассуждений |
| GPT-5.5 | 5.00 | 30.00 | 2.50 / 15.00 | varies | Flagship-рассуждение |
| GPT-5.5 Pro | 30.00 | 180.00 | varies | varies | Только крайние случаи |
| Claude Haiku 4.5 | 1.00 | 5.00 | 0.50 / 2.50 | 0.10 | Быстрый структурированный вывод |
| Claude Sonnet 4.6 | 3.00 | 15.00 | 1.50 / 7.50 | 0.30 | Long-form, агенты |
| Claude Opus 4.7 | 5.00 | 25.00 | 2.50 / 12.50 | 0.50 | Самые сложные задачи рассуждения |
| OpenAI Realtime gpt-realtime-2 (audio) | 32 | 64 | n/a | 0.40 | Real-time голос в WebRTC |
| Gemini Live (audio) | 3.00 | 12.00 | n/a | varies | Real-time голос/видео, стек Google |
Строки Gemini Live и Realtime API – единственные, что биллятся по аудио-токенам, а не текстовым. Не сравнивайте их построчно с текстовыми тарифами без пересчёта через эквивалент за минуту.
Слой аудио-AI – ASR, TTS, шумоподавление
Видеопродукт без слоя аудио-ИИ – недостроенный продукт. Хорошая новость: в 2026 году аудио-слой – самая дешёвая из ИИ-линий вашего счёта; единственный способ сделать аудио-ИИ дорогим – заролить его через неправильный API.
Доминирующие паттерны цен. Deepgram Nova-3 – самый дешёвый кредитоспособный ASR: $0.0043/мин batch для английского и $0.0077/мин streaming – час видео batch-транскрипцией стоит $0.26, а тот же час в стриминге – $0.46. OpenAI gpt-4o-mini-transcribe – около $0.003/мин ($0.18/час), gpt-4o-transcribe – $0.006/мин ($0.36/час). AssemblyAI Universal Streaming, биллящийся по времени открытой сессии по $0.15/час, – самый дешёвый streaming, если сессии плотные. Azure Speech real-time – $1.00/час, Google Cloud STT V2 base – $0.96/час: оба на порядок дороже Deepgram и OpenAI за ту же задачу.
TTS – место, где юнит меняется с минуты на символ, и это источник любого переборка TTS-бюджета. ElevenLabs Flash и Turbo берут 0.5 кредита за символ против кредит-пака, нижняя планка которого – $99/мес за 100-кредитный пак; эффективная стоимость – примерно $35–$50 за миллион символов в зависимости от плана. Cartesia Sonic 3 в той же зоне. Open-source Kokoro TTS на self-host (одна A100) даёт около 3.6 млрд символов в месяц примерно за $750 в compute – около $0.20 за миллион символов, в 100 раз дешевле закрытых API, ценой того, что GPU вы крутите сами.
Пример с цифрами. Телемедицинский продукт, генерирующий часовое голосовое саммари при темпе 150 слов/мин и примерно 5 символов на слово плюс пробелы, даёт около 60 000 символов TTS на визит. На ElevenLabs Flash это примерно $3 за визит; на Kokoro self-host – около $0.012. Помножьте на тысячу визитов в день – разрыв около $1 080/день, около $400 000 в год. Trade-off – качество голоса (ElevenLabs сейчас лучший по натуральности) и стоимость владения GPU-парком. Для high-volume продуктов с внутренними голосами математика очевидна; для low-volume продуктов со строгим бренд-голосом ElevenLabs выигрывает.
Шумоподавление – категория-сюрприз. Krisp в мае 2026 ввёл metered-pricing на SDK, и поминутный тариф BVC v3 теперь под приватным SDK-контрактом. Бесплатные альтернативы – RNNoise и DeepFilterNet для CPU-side подавления, NVIDIA Maxine Audio Effects SDK для GPU-side – закрывают большую часть качества, но требуют инженерных усилий. Разбор build-vs-buy – в глубоком разборе шумоподавления в главе 3.
Чит-шит на строчку аудио-ИИ, посчитанную на один час видео:
| Сервис | За минуту | За час |
|---|---|---|
| Deepgram Nova-3 batch | $0.0043 | $0.26 |
| Deepgram Nova-3 streaming | $0.0077 | $0.46 |
| OpenAI gpt-4o-mini-transcribe | $0.003 | $0.18 |
| OpenAI gpt-4o-transcribe | $0.006 | $0.36 |
| AssemblyAI Universal Streaming | n/a | $0.15 (session-based) |
| Azure Speech standard real-time | $0.0167 | $1.00 |
| Google STT V2 base | $0.016 | $0.96 |
| Whisper self-host (только compute) | n/a | ~$0.03 (плюс ops overhead) |
Оговорка «плюс ops overhead» в строке self-host Whisper – это та, которую игнорируют. Рабочий деплой Whisper с production-надёжностью, мониторингом, автоскейлингом, ретраями и on-call инженерией выходит примерно в $1/час эффективно против $0.03/час чистого compute. Compute дёшев; обвязка – нет. Решение self-host для ASR редко имеет финансовый смысл ниже десяти тысяч часов аудио в месяц.
Слой генеративного видео – Sora, Runway, Veo, Kling, Pika, Luma, Hailuo
Генеративное видео – строчка, превращающая ИИ-бюджеты в ИИ-кошмары: юнит – сгенерированные секунды, а цена за секунду на несколько порядков выше любой текстовой или аудио-модели. Sora 2 Standard по $0.10/сек – пол для серьёзного frontier-качества; Sora 2 Pro по $0.50/сек для 1024p – потолок. Переведите в «один час сгенерированного видео» – получите $360 за Standard и $1 800 за Pro в час, число, способное закончить разговор о roadmap продукта, если математику никто не сделал заранее.
Линейка 2026, нормализованная по цене за секунду, сортируется так. Дешёвый тариф – Hailuo 02 Standard 768p ($0.045/сек), Runway Gen-4 Turbo ($0.05/сек), Veo 3.1 Lite ($0.05/сек) – для быстрой итерации, черновиков и большинства consumer-facing b-roll нагрузок. Средний – Luma Dream Machine Ray 3 ($0.08/сек), Hailuo 02 Pro 1080p ($0.08/сек), Kling 2.0/3.0 ($0.075–$0.112/сек в зависимости от тира и разрешения) и Runway Gen-4 standard ($0.10–$0.15/сек). Frontier – Sora 2 Standard ($0.10/сек), Sora 2 Pro 720p ($0.30/сек), Veo 3 с нативным аудио ($0.75/сек), Sora 2 Pro 1024p ($0.50/сек).
Форма кривой стоимости интереснее, чем абсолютные числа. Качество, аудио, разрешение и частота кадров умножают счёт примерно линейно. Добавление аудио к Veo 3 двигает с $0.50 до $0.75/сек – премия 50%. Переход с 720p на 1024p у Sora 2 Pro – с $0.30 до $0.50/сек – премия 67%. Удвоение длительности с 5 до 10 секунд – ровно ×2. Решения о добавлении аудио, поднятии разрешения или удлинении клипа нужно принимать со знанием, что каждое – множитель цены, а не бесплатный тумблер.
Ловушка – разрыв между прототипом и продом. Основатель генерит десять Sora 2 Pro 1024p клипов в пятницу днём, счёт $25, и в голове – «Sora дешёвая». Через три месяца продукт генерит десять тысяч клипов в день на том же тире, счёт – $25 000/день, $9 млн/год – и основатель звонит в Anthropic за скидкой на Sonnet. Выход тот же, что на LLM-стороне: ролить по use case. Черновики – на Runway Gen-4 Turbo или Hailuo 02 Standard по $0.05/сек; финальный hero-контент – на Sora 2 Pro. Продукту никогда не нужно frontier-качество на каждом клипе.
| Генератор | За секунду | За 10-сек клип | За час сгенерированного |
|---|---|---|---|
| Hailuo 02 Standard 768p | $0.045 | $0.45 | $162 |
| Runway Gen-4 Turbo | $0.05 | $0.50 | $180 |
| Veo 3.1 Lite 720p no audio | $0.05 | $0.50 | $180 |
| Kling 3.0 720p | $0.075 | $0.75 | $270 |
| Luma Dream Machine Ray 3 | $0.08 | $0.80 | $288 |
| Hailuo 02 Pro 1080p | $0.08 | $0.80 | $288 |
| Sora 2 Standard 720p | $0.10 | $1.00 | $360 |
| Runway Gen-4 standard | $0.10 to $0.15 | $1.00 to $1.50 | $360 to $540 |
| Sora 2 Pro 720p | $0.30 | $3.00 | $1 080 |
| Veo 3 with native audio | $0.75 | $7.50 | $2 700 |
| Sora 2 Pro 1024p | $0.50 | $5.00 | $1 800 |
Другой рычаг, скрытый за сравнением цен: не каждому продукту нужно генерировать видео вообще. ИИ-редактирование стокового футажа, автомонтаж трейлеров из существующих OTT-библиотек и генерация тамбнейлов per-title часто – правильный ответ: стоимость секунды доставленного готового контента на один-два порядка ниже, чем диффузия с нуля. Статья главы 5 про инструменты ИИ-видеоредактирования – Opus Clip, Descript, Submagic, Captions AI, DaVinci AI разбирает этот путь.
Слой self-host – экономика GPU в 2026
Закрытые API выигрывают по скорости разработки и frontier-возможностям; self-host – по unit-стоимости выше определённого объёма. Точка пересечения – самое важное число в вашей модели издержек.
Почасовая цена GPU в мае 2026 года резко упала с пиков 2024 года, но разбита между провайдерами. Цифры заголовков, от дешёвого к дорогому: NVIDIA H100 SXM5 – Spheron spot $1.03/час, RunPod community $1.99/час, Lambda Labs on-demand $2.99/час, GCP A3-high около $3.00/час, CoreWeave HGX 8-GPU узлы $6.15/GPU/час, AWS p5 около $6.88/час, Azure около $12.29/час. Разрыв ×12 между самым дешёвым и самым дорогим – реальный и самый большой рычаг self-host экономики. Trade-off – не только цена: ещё надёжность, географическое покрытие, регуляторный compliance и как быстро вы возвращаете инстансы после пре-эмпта. Под прод на дешёвых провайдерах планируйте 70–80% утилизации, а не 100%.
Цены NVIDIA B200 (Blackwell) стабилизировались в 2026 году: $2.12–$2.25/час на spot, $2.65/час на CoreWeave one-year reserved, $3.49/час на Lambda on-demand, $5.98/час на RunPod on-demand, до $14.24/час на premium high-availability тирах. B200 даёт примерно ×2.5 throughput H100 на transformer-нагрузках, так что грубое правило: B200 по $3/час сопоставим с H100 по $1.20/час в throughput-нормализации.
Старые GPU – правильный ответ для многих видео-нагрузок. NVIDIA L40S – пол $0.50/час на spot и медиана on-demand около $1.73/час. A100 80GB – пол $0.44/час на spot и медиана on-demand около $2.06/час. Vast.ai листит A100 от $0.67/час. Для CV-нагрузок – YOLO, SAM 2, optical flow, сегментация – эти GPU переразмерены, и стоимость кадра – практически дешёвое, что возможно, без перехода на CPU. AMD MI300X закрыл разрыв на стороне LLM-сервинга, от $0.95/час spot до $3.02/час медианы on-demand на RunPod и DigitalOcean.
Край кривой стоимости – и по цене, и по латентности. NVIDIA Jetson Orin Nano Super Developer Kit за $249 (67 TOPS) и Jetson AGX Orin 64GB Developer Kit за $1 999 (275 TOPS) – канонический edge-ИИ хардвар для видео. Амортизированный на три года, AGX Orin даёт примерно $0.08 за час compute – дешевле любого облачного GPU, с нулевой сетевой латентностью и полным data sovereignty. Trade-off – throughput: AGX Orin обрабатывает десятки потоков камер, не тысячи.
Apple Silicon заслуживает места на карте стоимости для любого продукта с on-device inference. Mac Studio M4 Max со 128 ГБ unified memory стартует с $1 999 и крутит 70B-моделей на 15–18 ток/сек через MLX; M3 Ultra со 192 ГБ и 800 ГБ/с памяти стартует с $3 999 и крутит те же модели на 25–30 ток/сек. Для внутренних видеоинструментов, где компания владеет железом раз и навсегда, стоимость per-inference после capex стремится к нулю, с дополнительным бонусом – пользовательские данные не покидают устройство.
Пересечение – когда self-host выигрывает?
Пересечение API → self-host происходит на workload-specific объёмных порогах, и математика на салфетку.
Канонический пример – Whisper. OpenAI Whisper API по $0.006/мин – $9/час обработанного аудио при полной загрузке одного GPU (один GPU стримит около 1 500 минут аудио в час с качественной моделью). Self-host Whisper Large на A100 по Spheron $1.07/час on-demand держит тот же throughput за примерно $1.07/час GPU-времени. Пересечение – примерно 7 200 минут в месяц, около 120 часов, четыре часа в день, при условии загрузки GPU. Ниже – API дешевле и бесконечно проще. Выше – self-host выигрывает в 4–8 раз в чистом compute, до ops overhead.
Исследование Lenovo Press 2026 TCO находит ×8 преимущество self-host на железе Lenovo против cloud IaaS для LLM-inference и до ×18 против frontier model-as-a-service API. Их пятилетние сбережения per server могут превысить $5 млн. Подвох – а он всегда есть – сравнение предполагает, что нагрузка комфортно помещается на сервере, у команды есть операционная компетенция крутить inference-платформы, и API-альтернатива – frontier-тариф, где вы платите и за compute, и за бренд. Если ваша нагрузка – в основном дешёвые тарифы (Flash, Haiku, Gemini Flash-Lite), точка пересечения двигается далеко вправо, и self-host может никогда не окупиться.
Fine-tuning, RAG и то, о чём не говорят
Базовая inference-стоимость – только половина счёта. Fine-tuning, retrieval, векторное хранение и операционный налог за всё, что крутится в проде, – строки, которые появляются только после того, как прототип отправлен в прод и CFO начинает задавать заострённые вопросы.
OpenAI fine-tuning – $25 за миллион токенов обучения для GPT-4o, fine-tuned inference – $3.75 за миллион input и $15.00 за миллион output. На май 2026 OpenAI сворачивает свою fine-tuning платформу для новых пользователей; существующие джобы продолжают работать, fine-tuned модели остаются доступными для inference до deprecation базовой модели. Мигрируйте на prompt engineering плюс retrieval для новых билдов или на open-weight fine-tuning Llama / Qwen / Mistral на своих GPU.
Vertex ИИ тарифицирует fine-tuning Gemini по node-hour для custom training и по training token для supervised fine-tuning. Плоского публичного $/1M-тарифа нет – цены под кво и зависят от региона и capacity. Эта непрозрачность – один из реальных минусов стека Vertex против альтернативы OpenAI, и её стоит флажить при закупках.
Векторное хранение – строка, теряющаяся в счёте AWS, пока кто-то не вытащит отчёт. Pinecone Serverless на 10 млн векторов – около $70/мес; на 100 млн векторов пересекает $700/мес. Pgvector self-host на Postgres держит тот же масштаб за около $45/мес на маленьком инстансе и меньше $100/мес на более мощном. Разрыв ×7–×14 реальный и растёт нелинейно с масштабом, так что правильный паттерн дизайна для любого видеопродукта, ожидающего более нескольких миллионов видео-сегментов в RAG-индексе, – pgvector сначала, Pinecone только если операционные требования делают Postgres неподъёмным. Статья главы 4 про video RAG и multimodal RAG поверх архива видео разбирает архитектуру в глубину.
Скрытый операционный налог – это всё остальное: мониторинг (Datadog, Grafana Cloud, Honeycomb – обычно 5–10% от compute spend), error tracking, observability для agent-воркфлоу (AgentOps, LangSmith, Helicone), data egress на cloud API (часто 10% от compute на cross-region пайплайнах) и on-call инженерия. Правило большого пальца для нормально проинструментированного production ИИ-стека – умножить чистый compute-счёт на 1.4×–1.6×, чтобы получить all-in.
EU AI Act – строка, бьющая в августе 2026
GPAI-обязательства EU AI Act действуют с 2 августа 2025 года, но enforcement-полномочия Еврокомиссии и соответствующие штрафы – до 3% глобального оборота или €15 млн – начинают применяться 2 августа 2026 года. Для любого видеопродукта, размещённого на рынке EU и использующего general-purpose ИИ модели, compliance-стоимость реальная и поддаётся оценке.
Latham & Watkins и другие юридические трекеры оценивают первый год compliance для провайдеров foundation-моделей и интеграторов в $12–25 млн. Для большинства видеопродуктовых компаний стоимость меньше, потому что они интеграторы, не провайдеры моделей, – но обязательства всё равно нетривиальны: техническая документация, instructions for use, copyright-directive compliance, training-data summaries, model evaluations, adversarial testing, incident reporting, cybersecurity controls.
В ИИ-счёте обычно появляются не часы юристов, хотя они тоже складываются. Это инженерные усилия проинструментировать каждый вызов модели метаданными, которых хочет регулятор, хранить логи в compliant-storage и предоставлять audit trail по запросу. Закладывайте 10–15 процентных пунктов поверх чистого API-расхода на compliance overhead, если шипите на рынок EU. Статья главы 8 про регуляторный engineering EU AI Act проходит конкретные статьи и инженерный ответ.
Пример с цифрами – видеопродукт на 100 000 пользователей в месяц
Смысл cost-модели – предсказать счёт до того, как счёт придёт. Полный пример для типового видеоконференц-продукта 2026 года: 100 000 monthly active users, в среднем 8 часов видеозвонков в месяц на пользователя, с live-субтитрами, опциональным real-time переводом, ИИ-нотетейкером встреч и еженедельными ИИ-дайджестами.
Цифры построчно.
Live-субтитры на каждой минуте каждого звонка. 100 000 × 8 часов = 800 000 часов аудио. На Deepgram Nova-3 streaming по $0.46/час счёт за live-субтитры – $368 000/мес. На AssemblyAI Universal Streaming по $0.15/час session-based (сессии примерно непрерывные) – $120 000/мес. Выбор реальный: real-time точность против стоимости; для большинства продуктов Deepgram выигрывает по качеству, AssemblyAI – по цене.
Real-time перевод в 20% звонков. 20% от 800 000 часов = 160 000 часов, по тарифу gpt-realtime-translate $0.034/мин = $326 400/мес. Это самая большая строка в примере, и она агрессивнее всего оправдывает переход на стек Gemini Live или self-host translation-пайплайн.
ИИ-нотетейкер на каждом звонке. Нотетейкер съедает полный транскрипт (час аудио на 150 слов/мин – около 9 000 слов, примерно 13 000 input-токенов) и выдаёт структурированное саммари (около 1 000 output-токенов на звонок). 800 000 звонков × $0.30/1M × 13K input + $2.50/1M × 1K output = 800 000 × ($0.0039 + $0.0025) = $5 120/мес на Gemini 2.5 Flash. Статьи главы 6 про LiveKit real-time AI meeting assistant и полный репозиторий LiveKit meeting note-taker проходят production-имплементацию.
Еженедельный дайджест саммари недельных звонков на пользователя. 100 000 пользователей × 4 недели = 400 000 дайджестов в месяц. Каждый ест недельные 8 часов аудио, сведённые к примерно 50 000 транскрибированных слов (около 65 000 input-токенов) и выдаёт 500-словный дайджест (около 650 output-токенов). На Gemini 2.5 Flash: 400 000 × ($0.30/1M × 65K + $2.50/1M × 650) = $8 450/мес.
Векторное хранилище архива встреч (RAG поверх последних 90 дней встреч компании). 100 000 пользователей × ~50 часов аудио в квартал × 1 embedding на 10 секунд = 1.8 млрд активных embeddings. На Pinecone Serverless в масштабе – примерно $12 600/мес; на pgvector self-host на мощном Postgres-кластере – примерно $2 000/мес с учётом времени DB-оператора, амортизированного.
Compliance overhead – 12% от ИИ-линии: примерно $32 000/мес на комбинации Deepgram/translation/Flash.
Операционный налог – 1.5× compute: множитель на чистый compute-счёт.
Итог дешёвого пути: $120 000 (AssemblyAI) + $326 400 (translation) + $5 120 (нотетейкер) + $8 450 (дайджест) + $2 000 (pgvector) = $462 000/мес до overhead; с overhead и compliance примерно $700 000/мес all-in. Это $4.20 на пользователя в месяц за ИИ-линию – в пределах того, что здоровый consumer или B2B SaaS продукт может выдержать при $10–$30/мес выручки на пользователя.
Теперь применим рычаги. Переключим перевод на Gemini Live по $0.018/мин output = 160 000 × 60 × $0.018 = $172 800/мес вместо $326 400 – экономия $153 000/мес. Кэшируем system-промпты в нотетейкере и дайджестере – скажем, 70% сокращение input-токенов, экономия около $4 000/мес. Опустим нотетейкер на Gemini 2.5 Flash-Lite для решения о роутинге и зарезервируем Flash под собственно саммари, экономя ещё $1 500/мес. Self-host Whisper Large под live-субтитры, опуская строку $120 000/мес до примерно $8 000/мес в GPU-compute плюс инженерный overhead – пусть $25 000/мес all-in. Итог: $200 000–$250 000/мес all-in за тот же набор фич – $2.20 на пользователя в месяц за ИИ, ×3 улучшение от наивного билда.
Сопровождающий XLSX-воркшит проходит тот же пример с редактируемыми ячейками, чтобы вы могли подставить свои числа пользователей, профиль нагрузки и выбор тарифов. Скачать ниже.
Распространённая ошибка – путать счёт прототипа со счётом прода
Самая дорогая ошибка команд – экстраполировать месячный счёт прототипа линейно к проду. Три силы делают рост стоимости в проде супер-линейным, не линейным.
Во-первых, нагрузка прототипа обычно сконцентрирована на самом дешёвом тарифе – разработчик платит своей картой и делает аккуратные выборы. Production-нагрузка накапливает исключения: клиент попал в edge-case, инженер добавил fallback на более дорогую модель; шипнулась новая фича, PM попросил «умную версию», логика роутинга добавила ещё один путь к GPT-5 Pro. Каждое добавление – множитель ×5–×30 на затронутый кусок трафика.
Во-вторых, ретраи, инвалидации кэша и reasoning loops компаундятся. Один ретрай провалившегося Realtime API звонка удваивает стоимость минуты. Инвалидация кэша, форсированная сменой system-промпта, стирает неделю экономии. Агент, который три раза лупится, чтобы уточнить tool call вместо one-shot, утраивает стоимость взаимодействия.
В-третьих, операционный налог мультипликативен, не аддитивен. Множитель 1.5× на чистый compute – сам множитель на растущей базе, а операционный тулинг (Datadog, error tracking, observability) биллится за заинжестированный event, так что его счёт растёт в шаг с API.
Защитная практика – построить cost-модель первой, продукт вторым. Возьмите целевой unit-cost на пользователя в месяц, разложите на per-feature unit-cost, проинструментируйте каждый вызов API против этих целей в проде, алертируйте, когда фича пересекает 120% от своей цели. Статья главы 8 про оптимизацию стоимости видео-ИИ – 25 рычагов каталогизирует полный набор оптимизаций, но дисциплина измерять до оптимизации важнее любого отдельного рычага.
Двенадцать рычагов стоимости – стакайте все
Один и тот же шаблон повторяется по всем категориям, которые мы прошли. Ниже – мастер-список. Большинство команд тянут два-три; высокоэффективные тянут все двенадцать.
Первые шесть – рычаги уровня модели. Ройте по use case к самому дешёвому тарифу, проходящему планку качества. Используйте Flash, Haiku, Mini, Nano как дефолт; резервируйте flagship-тарифы под запросы, которым это реально нужно. Кэшируйте статичные промпты агрессивно; у Gemini, OpenAI, Anthropic cache-read – 90% скидка от input, а стоимость записи в кэш амортизируется после нескольких чтений. Batch-обработайте любую нагрузку, не требующую real-time ответа; batch экономит 50% compute. Используйте low media resolution для видео и аудио, когда задаче не нужно полное разрешение; на Gemini это ×3 сокращение видео-токенов. Truncate контекст агрессивно – большинству reasoning-задач нужна доля того, что промпт реально содержит. Сжимайте system-промпты после каждой смены фич; промпты растут со временем, и никто их никогда не сокращает.
Следующие три – рычаги уровня архитектуры. Перейдите с frontier-API на self-host семейств Llama / Qwen / Mistral для 80% нагрузок, которым не нужна frontier-способность – TCO Lenovo находит ×8–×18 экономии в масштабе, и open-weight модели в пределах 5% от frontier на большинстве production-бенчмарков (см. сравнение open-frontier VLM в главе 4). Толкайте inference на edge – Jetson Orin или Apple Silicon – для любой нагрузки, где узкое место – данные пользователя, не compute. И заменяйте дорогие синхронные API более дешёвыми асинхронными пайплайнами там, где UX позволяет.
Последние три – операционные рычаги. Договаривайтесь о volume-контрактах выше $50 000/мес API-расхода – каждый крупный провайдер имеет скидочные цены для committed-use клиентов, скидка обычно 20–40%. Мониторьте стоимость на запрос, не только количество запросов; cost-per-request ловит регрессии роутинга раньше счёта. Используйте spot или interruptible GPU для batch-нагрузок – экономия 50–80% против on-demand, и инженерная сложность работы с пре-эмптом скромная с правильным фреймворком.
| Рычаг | Типичная экономия | Где применяется |
|---|---|---|
| Роутинг на более дешёвый тариф | ×5–×30 на роутном трафике | Любой closed-API workload |
| Prompt caching | 70–90% на закэшированной части | Стабильные system-промпты |
| Batch-обработка | 50% | Не-realtime нагрузки |
| Low-resolution media | ×3 на видео-токенах | Большинство VLM-задач |
| Context truncation | 20–60% | Long-context reasoning |
| System-prompt compression | 10–30% | Зрелые продукты |
| Self-host на open weights | ×5–×20 | High-volume нагрузки |
| Edge inference | до ×100 | Latency-sensitive фичи |
| Async пайплайны | 50–80% | Batch-приемлемый UX |
| Volume-контракты | 20–40% | Выше $50K/мес расхода |
| Cost-per-request мониторинг | 10–30% (пойманные регрессии) | Production-масштаб |
| Spot / interruptible GPU | 50–80% | Batch GPU-работа |
Где здесь Фора Софт
Фора Софт с 2005 года шипит видеопродукты с closed-API AI, self-host inference и гибридными топологиями в видеоконференциях, OTT, видеонаблюдении, телемедицине и e-learning. Мы перестраивали cost-модель в проде у клиентов, переходящих с $200 000/мес closed-API счёта на $40 000/мес гибридный стек без потери качества на user-visible фичах. Работа негламурная – логика роутинга, политики кэширования, batch-vs-realtime решения и поквартальный refresh таблицы unit-экономики, – но это разница между ИИ-фичами, окупающими разработку, и ИИ-фичами, которые убивают на следующем budget review. Если вы упёрлись в стену по стоимости ИИ в видеопродукте, мы – команда, которой звонят после того, как прочитан каждый пост по теме, а цифры всё равно не сходятся.
Ключевые выводы
- Видео порождает токены, минуты и секунды в темпе, которого нет у текстовых продуктов – моделируйте счёт в юнитах «стоимость на час видео».
- Flagship-модели для рассуждений в 10–30 раз дороже Flash-тарифа; ройте по use case, не по дефолту.
- Кэширование, batch, low-resolution media и self-host на open weights стакаются и дают ×5–×20 сокращения стоимости в масштабе.
- Генеративное видео тарифицируется в секундах и добавляет нули к счёту быстрее любой другой категории – моделируйте явно до масштабирования.
- Пересечение closed-API → self-host происходит на workload-specific объёмных порогах; ниже них API дешевле и проще.
Что читать дальше
- Латентность, топология деплоя и real-time vs batch – архитектурные решения, формирующие cost-модель.
- Форматы артефактов моделей и решение open-vs-closed – формат, ворота к self-host.
- Оптимизация стоимости видео-ИИ – 25 рычагов – глубокий разбор каждого приёма экономии.