Streaming ASR в проде – Whisper, Deepgram и AssemblyAI в 2026

Автор: Николай СапуновОбновлено: август 202628 мин чтения
Содержание статьи +

Коротко

Потоковое распознавание речи (streaming ASR) – это преобразование живого аудио в текст в режиме реального времени, пока человек говорит. Эта технология лежит в основе живых субтитров, голосовых агентов, расшифровки совещаний и перевода на ходу. В 2026 году почти любой продакшен выбирает один из трёх вариантов: OpenAI Whisper (открытая модель под лицензией MIT, которую нужно самостоятельно интегрировать в потоковую обработку), Deepgram (быстрый облачный API, изначально созданный для работы в реальном времени) или AssemblyAI (облачный API, разработанный специально под голосовых агентов).

Whisper изначально не предназначен для стриминга – он обрабатывает аудио блоками по 30 секунд, – поэтому потоковый режим реализуется за счёт умного цикла с перекрытием. Открытый стандарт здесь – политика LocalAgreement-2, которая подтверждает слово только тогда, когда оно одинаково распознано в двух последовательных проходах. Облачные API избавляют от этой инженерной работы: Deepgram Nova-3 обеспечивает точность около 6,8% (WER) при задержке менее 300 мс и стоимости примерно $0,46 за час аудио, а AssemblyAI Universal-Streaming выдаёт «неизменяемые» слова примерно за 300 мс по цене $0,15 за час и встроенно определяет конец реплики – важную функцию для голосовых агентов.

Выбор почти никогда не сводится к простому сравнению общей точности моделей – он зависит от допустимой задержки, поддерживаемых языков, требований к хранению данных и наличия команды, способной обслуживать парк GPU. Все эти аспекты подробно разбираем ниже.

Зачем это нужно

Если ваш видеопродукт преобразует речь в текст в процессе произношения – значит, у вас работает streaming ASR, независимо от того, написали вы его сами или приобрели. Живые субтитры на вебинаре должны отображать слова с задержкой в одну–две секунды после произнесения. Голосовой агент, принимающий запись на приём, должен распознать паузу после окончания речи звонящего, чтобы ответить вовремя и не перебить. Расшифровщик совещания должен вести бегущий транскрипт, чтобы сразу после завершения встречи составить краткое содержание. Телемедицинская консультация требует точной фиксации устных заметок врача с минимальной задержкой.

Все четыре сценария – одна и та же задача: преобразование живого аудиопотока в постепенно формируемый текст, и все они ломаются одинаково: слова появляются с опозданием, ранние версии распознавания переписываются, система перебивает пользователя, а итоговая стоимость оказывается в десять раз выше, чем обещал прототип.

Эта статья даёт продакт-менеджеру, основателю или техлиду достаточное понимание, чтобы выбрать между тремя основными решениями 2026 года, разобраться, что на самом деле означает «задержка 300 мс», и избежать подводных камней, связанных со стоимостью и точностью, которые подводят большинство первых внедрений.

Что такое «streaming ASR» на самом деле

Разберём термин. Автоматическое распознавание речи (automatic speech recognition, ASR) – это технология, которая преобразует записанную речь в текст. Она лежит в основе диктовки, субтитров и голосовых ассистентов. Слово потоковое (streaming) описывает, как происходит обработка: аудио анализируется по мере поступления – в реальном времени, а не после полной записи. Противоположность стримингу – пакетный режим (batch): вы передаёте системе готовый аудиофайл и ждёте готовый транскрипт целиком.

Разница важнее, чем кажется. В пакетном режиме система может просмотреть всю запись целиком, прежде чем зафиксировать хоть одно слово. Она использует контекст, следующий после сложного слова, чтобы понять, каким оно было – так же, как вы перечитываете запутанную фразу до конца, прежде чем осмыслить её первую половину. В потоковом режиме система вынуждена выдавать текст посреди предложения, не зная, что прозвучит дальше. Это как разница между переводом речи, когда у вас уже есть её транскрипт, и синхронным переводом вживую в кабине. Стриминг сложнее, и именно эта сложность напрямую влияет на пользовательский опыт.

Главное понятие в streaming ASR – различие между частичным и финальным результатом. Частичный результат – это лучшая на данный момент догадка системы, которая может меняться по мере поступления аудио. Финальный результат – это слово, на котором система окончательно остановилась и которое больше не изменит. Представьте живые субтитры, где текст на мгновение мерцает и переписывает сам себя, прежде чем окончательно застыть: мерцающий текст – это поток частичных результатов, а момент, когда он перестаёт меняться, – финал. Каждая потоковая система выбирает: показывать частичные результаты как можно раньше (быстро, но дёргано и иногда неверно) или ждать финальных (стабильно, но медленнее). Понять этот компромисс – почти то же самое, что понять принцип работы streaming ASR.

Рисунок 1. Пакетный ASR обрабатывает всю запись целиком, прежде чем зафиксировать слово; потоковый ASR должен выдавать текст уже посреди фразы, балансируя между ранними частичными результатами и стабильными финальными вариантами.

Как речевая модель «слышит»: окно в 30 секунд

Чтобы понять, почему стриминг сложен, нужно знать один важный факт о том, как устроены современные речевые модели. Модель вроде Whisper не обрабатывает звук в его исходном виде. Сначала аудиосигнал преобразуется в мел-спектрограмму – визуальное представление того, как энергия звука распределена по частотам во времени, адаптированное примерно под особенности восприятия громкости человеческим ухом. Если вас интересуют технические детали аудиоинженерии – что такое мел-спектрограмма и почему она устроена именно так, – это отдельная тема, которую мы подробно разбираем в уроке по основам аудио для видео. Здесь достаточно считать её «изображением звука, которое модель и анализирует».

Whisper обрабатывает аудио фиксированными блоками по 30 секунд. Это значение заложено в модель: её обучали на 30-секундных фрагментах, и она лучше всего работает, имея 30 секунд контекста (Radford et al., 2022). При пакетной расшифровке это не проблема – вы просто разбиваете запись на 30-секундные части, и модель обрабатывает каждую. А вот для стриминга это серьёзная трудность: когда человек произнёс лишь три слова, у вас нет 30 секунд будущего аудио. Вы либо ждёте эти 30 секунд (что даёт недопустимую задержку), либо подаёте модели короткое, неполное окно и принимаете, что результат будет менее точным и может измениться.

Это корневая причина почти всех трудностей в streaming ASR. Модель нуждается в контексте, а стриминг его лишает. Всё остальное – стратегии, позволяющие предоставить модели как можно больше контекста, не замедляя вывод текста.

Вариант 1 – Whisper, заставленный стримить

Whisper – открытая речевая модель от OpenAI, выпущенная в 2022 году под лицензией MIT, то есть её можно бесплатно использовать на собственных серверах и интегрировать в коммерческие продукты (Radford et al., 2022). Это Transformer encoder-decoder: энкодер обрабатывает мел-спектрограмму аудиосигнала, а декодер генерирует текст по одному токену – та же архитектура, что лежит в основе крупных языковых моделей. Модель обучали на 680 000 часов аудио, собранного из интернета, с разметкой по принципу слабого наблюдения (weak supervision): обучающие пары не проверялись вручную экспертами, а формировались автоматически в больших объёмах. Поэтому Whisper хорошо справляется с акцентами, фоновым шумом и поддерживает 99 языков – и именно из-за этого иногда галлюцинирует, выдавая связный текст там, где речи нет, например, в продолжительной тишине.

Загвоздка из предыдущего раздела: Whisper по своей природе – пакетная модель. Декодер изначально не предназначался для постепенной выдачи текста. Чтобы обеспечить стриминг, его оборачивают в цикл, который многократно запускает пакетную модель на растущем буфере аудио и определяет, какие слова достаточно стабильны, чтобы их зафиксировать. Открытый эталон такого подхода – Whisper-Streaming, опубликованный исследователями Карлова университета в 2023 году (Macháček et al., 2023).

Приём LocalAgreement

Сердце Whisper-Streaming – правило, определяющее, когда слово можно считать надёжно распознанным, называемое LocalAgreement-2. Его суть сводится к одному утверждению: слово фиксируется только тогда, когда два последовательных прохода модели дают одинаковый результат. Система хранит буфер с недавним аудио. Каждый раз, когда поступает новый фрагмент звука, она запускает Whisper на всём буфере и получает обновлённый транскрипт. Затем сравнивает новый транскрипт со старым и находит самый длинный общий префикс – самую длинную цепочку слов с начала, совпадающую в обоих вариантах. Эти согласованные слова помечаются как окончательные; всё, что следует за ними, остаётся предварительным и ждёт подтверждения на следующем шаге.

Это работает, потому что слово, которое два независимых прохода выделяют из слегка отличающихся фрагментов аудио, почти наверняка правильное. Слово, появившееся в одном проходе и исчезнувшее в следующем, было догадкой, от которой модель отказалась, услышав больше данных. LocalAgreement-2 изначально не разрабатывался для Whisper – он пришёл из исследований синхронного перевода и победил в соревновании IWSLT 2022, – а авторы Whisper-Streaming обнаружили, что согласование по двум проходам («2» в названии) – золотая середина между скоростью и стабильностью (Macháček et al., 2023).

Несколько вспомогательных приёмов делают цикл практичным. Буфер обрезается в конце предложения, чтобы не превысить 30-секундный лимит Whisper. Последние 200 подтверждённых слов подаются обратно в модель как подсказка (prompt), обеспечивая межфразовый контекст, который иначе терялся бы. Опциональный детектор речевой активности (voice activity detector, VAD) – небольшая и недорогая модель, определяющая, есть ли в фрагменте аудио речь, – включается, чтобы пропускать тишину, что повышает и точность, и экономичность.

Рисунок 2. Whisper-Streaming фиксирует слово только тогда, когда два последовательных прохода сходятся на нём: самый длинный общий префикс становится окончательным, а хвост остаётся временным.

Цена в задержке и железе

Числа из статьи Whisper-Streaming – хорошая отправная точка. На несегментированной длинной английской речи при запуске большой модели на NVIDIA A40 система демонстрировала среднюю задержку около 3,3 секунды при минимальном размере фрагмента в одну секунду и WER примерно на 2 процентных пункта выше, чем у той же модели в пакетном режиме (Macháček et al., 2023). Задержка зависит от аппаратного обеспечения и размера фрагмента: уменьшение фрагмента снижает задержку, но уменьшает объём контекста, что повышает количество ошибок.

Практическая заметка о скорости. Эталонная реализация не использует оригинальный код OpenAI Whisper – вместо этого она основана на faster-whisper, переписанной версии на движке CTranslate2. По словам авторов, она работает примерно в четыре раза быстрее стандартной реализации при 16-битной точности (Macháček et al., 2023). Если вы строите стриминг на базе Whisper, вы почти наверняка используете faster-whisper или аналогичный оптимизированный рантайм, а не «ванильную» модель: последняя слишком медленна, чтобы успевать за живым аудиопотоком на доступном железе.

Причина выбрать Whisper – контроль и экономия на масштабе. Лицензия бесплатна, модель полностью работает внутри вашей инфраструктуры (что особенно важно для медицинского или регулируемого аудио, которое не может покидать серверы), и поддерживает 99 языков одной моделью. Причина не выбирать – теперь у вас на руках парк GPU, потоковая обработка и бюджет на задержку, которые облачный API предоставлял бы вам за пару центов в час.

Вариант 2 – Deepgram, разработанный для работы в реальном времени

Deepgram – облачный API распознавания речи, разработанный с нуля для стриминга, а не как пакетная система, переделанная под потоковую обработку. Вы устанавливаете WebSocket – двустороннее сетевое соединение, которое остаётся открытым, чтобы аудиоданные передавались вверх, а текст – вниз непрерывно, – подаёте в него фрагменты аудио и получаете частичные и финальные транскрипты. Флагман 2026 года – модель Nova-3.

Числа, которые публикует Deepgram для Nova-3, находятся на переднем крае: около 6,8% WER на потоковом реальном аудио в таких доменах, как медицина, финансы и колл-центры, при задержке менее 300 мс (Deepgram, 2026). Поддерживается более 45 языков, а также всё необходимое для расшифровки в продакшене: диаризация дикторов (разметка – кто говорил в каждом сегменте), умное форматирование (превращение «два тридцать» в «2:30») и keyterm prompting (возможность заранее сообщить модели о необычных словах, например, названиях продуктов, чтобы она их корректно распознала).

По цене Nova-3 в стриминге стоит около $0,0077 за минуту аудио, то есть примерно $0,46 за час (Deepgram, 2026). Deepgram также даёт $200 бесплатных кредитов новым аккаунтам – этого хватит на аудио для сборки и тестирования настоящего прототипа до первой оплаты.

Задача голосового агента: знать, когда говорить

В 2026 году компания Deepgram представила отдельную модель Flux, ориентированную на голосовых агентов – автоматические системы, ведущие устный диалог с человеком. Главная сложность в работе голосового агента – не просто распознать слова, а точно определить момент, когда человек закончил говорить, чтобы агент ответил вовремя, не перебивая и не создавая неловкой паузы. Традиционные системы решают эту задачу по тишине: ждут полсекунды молчания и делают вывод, что пользователь закончил. Однако такой подход сбоит, если человек делает паузу посреди мысли или говорит тише.

Flux встраивает определение конца реплики (end-of-turn detection) прямо в речевую модель, опираясь на смысл и ритм речи, а не только на тишину, и принимает решения о завершении реплики менее чем за 400 мс (Deepgram, 2026). В апреле 2026 года Deepgram расширил поддержку Flux до десяти языков с возможностью переключения языка в ходе разговора (Deepgram, 2026). Если вы разрабатываете голосового агента, а не субтитры или расшифровщик, эта способность к определению конца реплики часто становится ключевой – чего не даёт из коробки открытый цикл Whisper.

Вариант 3 – AssemblyAI, разработанный для голосовых агентов

AssemblyAI – третий по значимости облачный вариант. Его потоковый продукт Universal-Streaming вышел в середине 2025 года с фокусом на голосовых агентах (AssemblyAI, 2025). Одной из ключевых особенностей решения, заслуживающей внимания даже при отсутствии прямого использования, является неизменяемость транскриптов с момента поступления.

Вспомните компромисс «частичный против финального». Большинство потоковых систем выдают изменяемые частичные результаты, которые постоянно обновляются, пока не поступит окончательный вариант – и это заставляет разработчика выбирать между реакцией на быстрые, но нестабильные промежуточные данные и ожиданием медленных, но надёжных финальных результатов. AssemblyAI переворачивает эту модель: каждое слово становится окончательным в момент получения и больше никогда не пересматривается. Эти неизменяемые слова поступают примерно за 300 мс, и компания утверждает, что делает это на 41% быстрее по медиане, чем Deepgram Nova-3 – 307 мс против 516 мс на одно слово, – и почти вдвое быстрее на 99-м перцентиле (AssemblyAI, 2025). Выгода для голосового агента очевидна: он может начать «думать» над ответом, пока пользователь ещё говорит, поскольку уже полученные слова гарантированно не изменятся.

Universal-Streaming тарифицируется по фиксированной ставке – $0,15 за час сессии, с неограниченным количеством параллельных потоков и без дополнительных платежей за каждый поток (AssemblyAI, 2025). Как и Flux от Deepgram, он поддерживает нативное определение конца реплики, комбинируя акустические и семантические признаки с традиционным детектированием тишины. Новый уровень Universal-3 Pro Streaming добавляет диаризацию дикторов в реальном времени (за дополнительные $0,12 в час), поддержку keyterm prompting и 99+ языков, а WER на этом уровне компания оценивает примерно в 6,3% в среднем по английским доменам (AssemblyAI, 2026). AssemblyAI также предоставляет готовые интеграции с платформами оркестрации голоса, которые используют большинство команд – среди них LiveKit и Pipecat, – так что подключение к WebRTC-звонку сводится к настройке конфигурации, а не к исследовательской работе. О том, как компоненты real-time ИИ объединяются в рамках живого видеозвонка, см. урок про real-time ИИ в пайплайне WebRTC; о рассылке одного транскрипта множеству зрителей – урок про live-субтитры с fan-out на SFU.

Три варианта рядом

Таблица ниже собирает опубликованные данные на 2026 год, чтобы сравнивать по осям, которые реально определяют эффективность внедрения. Считайте цифры задержки и точности – данными вендоров, полученными на их собственных тестовых наборах: независимые результаты варьируются в зависимости от аудиодоменов, и единственное значение, которое в итоге имеет значение, – это то, что вы измерите на своём аудио.

КритерийWhisper (свой хостинг)Deepgram Nova-3AssemblyAI Universal-Streaming
ТипОткрытая модель, запускаете самиОблачный API стримингаОблачный API стриминга
Лицензия / хостингMIT, ваши GPUОблако вендораОблако вендора
WER в стриминге (вендор / статья)~+2 пт к своему batch-WER~6,8%~6,3% (Universal-3 Pro)
Задержка (выдача слова)~3,3 с (A40, кусок 1 с)<300 мс~300 мс, неизменяемо
Частичные пересматриваются?Да (пока LocalAgreement не подтвердит)Да (изменяемые частичные)Нет (неизменяемы с начала)
Определение конца репликиДелаете самиНативно в FluxНативно
Языки9945+99+ (Pro)
Цена (стриминг)Только стоимость GPU~$0,46 / час$0,15 / час (+$0,12 диаризация)
Когда выбратьДанные должны остаться on-prem; огромный масштабМинимальная задержка; широкий набор функцийГолосовые агенты; неизменяемые транскрипты

Источники: Macháček et al. (2023); Deepgram (2026); AssemblyAI (2025, 2026).

Разбор на числах – во что обходятся живые субтитры

Числа сами по себе не помогут в принятии бюджетного решения, поэтому подставим реальные. Допустим, вы внедряете живые субтитры в вебинарный продукт и ожидаете 2000 часов потокового аудио в месяц – например, 1000 часовых вебинаров с двумя дикторами или любой эквивалентный объём.

На AssemblyAI Universal-Streaming по $0,15 за час месячный счёт за расшифровку выглядит так:

2 000 часов × $0,15/час = $300 в месяц.

На Deepgram Nova-3 в режиме стриминга тот же объём обрабатывается примерно за $0,46 в час:

2 000 часов × $0,46/час = $920 в месяц.

Теперь путь с собственным хостингом Whisper. Модель бесплатна, так что основная статья расходов – это GPU. Один средний облачный GPU-инстанс, способный запускать faster-whisper в реальном времени, обходится примерно в $0,50–$1,50 в час аренды, и один такой инстанс справляется с несколькими параллельными потоками. Однако вебинарный продукт не генерирует аудио равномерно в течение месяца – 2 000 часов могут сгуститься в пиковые часы рабочего дня, когда требуется сразу много инстансов, и ни одного – ночью. Если заложить пик в, скажем, десять параллельных GPU-инстансов по $1,00 в час, и каждый работает в среднем 200 часов в месяц, то:

10 инстансов × 200 часов × $1,00/час = $2 000 в месяц – только в сырой стоимости GPU, до зарплаты инженера, который держит парк на ходу.

Это и есть ловушка, в которую попадают большинство команд. На 2000 часах в месяц облачный API становится значительно дешевле собственного хостинга, потому что вы платите только за реально обработанное аудио, а поставщик берёт на себя расходы на простаивающие мощности. Собственный хостинг оказывается выгоднее по цене за час только при очень большом и стабильном объёме – независимые оценки указывают точку безубыточности примерно в районе сотен тысяч минут в месяц, и то с учётом затрат инженеров на эксплуатацию. Ниже этой границы «бесплатная модель» – самый дорогой вариант.

Частая ошибка – принимать частичные результаты за финальные

Самая разрушительная ошибка, которую мы видим, – и она не видна на демо, – это воспринимать частичный транскрипт как окончательный результат. В быстром тесте промежуточные результаты выглядят отлично: слова появляются быстро и в целом правильно. Но в продакшене частичный результат, который позже пересматривается, хотя вы уже на него отреагировали, порождает целый класс багов, крайне трудных для отладки.

Голосовой агент, который запускает действие в момент, когда частичный результат говорит «отмени мой заказ», отменит заказ даже если пользователь на самом деле сказал «отмени мой заказ – нет, стой, лучше поменяй адрес», потому что ранний частичный результат был зафиксирован до того, как пришла поправка. Функция живого перевода, переводящая каждый частичный результат, выдаёт дёргающуюся, самокорректирующуюся кашу на экране. Инструмент медицинских заметок, сохраняющий частичный результат как запись, может занести слово, от которого модель потом отказалась.

Лечение – чётко понимать, какие результаты ваш провайдер гарантирует стабильными, и действовать только на их основе. В AssemblyAI каждое распознанное слово фиксируется окончательно, так что подобная ошибка невозможна – именно это и заложено в архитектуру. В Deepgram и в цикле Whisper с LocalAgreement нужно дождаться явного финального результата (Deepgram его помечает; LocalAgreement подтверждает после двух согласованных проходов), прежде чем выполнять необратимые действия, а промежуточные результаты использовать лишь для обновления интерфейса, о чём пользователь должен знать, что они ещё могут измениться. Различие между «промежуточным» и «финальным» состоянием закладывайте в модель данных с самого начала, а не после первого непонятного сбоя.

Как выбрать – четыре вопроса

Решение сводится к четырём вопросам – по порядку.

Первый: должно ли аудио оставаться на ваших серверах? Если вы обрабатываете медицинские консультации, юридические записи или любые данные, регулируемые строгими правилами хранения, запрещающими передачу аудио в стороннее облако, – собственный хостинг Whisper часто остаётся единственным вариантом, соответствующим требованиям комплаенса, и эксплуатационные расходы становятся ценой этого соответствия. Если же аудио может покидать серверы, облачный API почти всегда дешевле и позволяет быстрее вывести продукт на рынок.

Второй: вы строите голосового агента или транскрипт? Голосовой агент – всё, что отвечает пользователю – живёт и умирает на определении конца реплики, так что модель, которая его встраивает (Deepgram Flux или AssemblyAI Universal-Streaming), снимает с вас самую сложную инженерную задачу проекта. Функция субтитров или расшифровки, которой никогда не надо «знать, когда говорить», в определении реплики не нуждается и может взять самый простой и дешёвый вариант, попадающий в бюджет задержки.

Третий вопрос: каков ваш бюджет задержки? Если слова должны появляться за несколько сотен миллисекунд – например, для отзывчивого голосового агента или живых субтитров, которые воспринимаются как мгновенные, – реалистичный выбор – облачные API с задержкой менее 300 мс; цикл Whisper на собственном хостинге с задержкой в несколько секунд будет работать слишком медленно. Если задержка в две-три секунды допустима – а многие сценарии субтитров и постобработки звонков её терпят, – Whisper снова становится вариантом.

Четвёртый: какой объём и насколько он ровный? На низком или скачкообразном объёме облачные API выигрывают по цене – вы платите только за использованное. На очень большом, стабильном объёме, при наличии команды по машинному обучению для эксплуатации, собственный хостинг может оказаться выгоднее – но только выше точки безубыточности и только если первые три вопроса уже решены в его пользу.

Рисунок 3. Четыре вопроса, заданные по порядку, направляют большинство проектов потоковой ASR к нужному решению.

Где здесь Фора Софт

Мы интегрируем функции потоковой распознавания речи (streaming-ASR) в видеопродукты наших клиентов: живые субтитры для вебинаров и e-learning, расшифровку в реальном времени для телемедицинских консультаций, голосовых агентов и ассистентов встреч на конференц-платформах, а также поисковые транскрипты для OTT-сервисов и архивов видеонаблюдения. Основной вывод из всех этих проектов один: выбор модели – задача простая; настоящая сложность – в интеграции: извлечение чистого аудио из WebRTC-звонков, корректная обработка различий между «частичной» и «финальной» транскрипцией без гонок данных, соблюдение задержек в рамках заявленных продуктом параметров и выбор архитектуры развёртывания, соответствующей требованиям комплаенса клиента. Каждый из трёх рассмотренных вариантов мы тестировали, опираясь на эти четыре критерия, а не на то, какая модель показала лучшие результаты в бенчмарках в текущем квартале.

Ключевые выводы

  • Streaming ASR расшифровывает живое аудио; ключевой компромисс – между быстрыми частичными результатами и стабильными финальными.
  • Whisper по сути работает в пакетном режиме; для стриминга требуется цикл LocalAgreement и отдельные GPU.
  • Deepgram Nova-3 обеспечивает стриминг с задержкой менее 300 мс по цене около $0,46 в час, поддерживает широкий набор языков и функций.
  • AssemblyAI выдаёт неизменные транскрипты с задержкой около 300 мс по $0,15 в час, оптимизирована под голосовых агентов.
  • Голосовые агенты полагаются на определение конца реплики – встроенную функцию облачных API.
  • Облачные API дешевле локального хостинга во всех случаях, кроме очень больших и равномерных объёмов нагрузки.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.